Agent 评估不再只看能力上限,先守住最坏行为
Agent 评估的重点正在从追逐能力上限转向守住行为底线。Ben Hylak 分享了生产问题发现、评估代码化,以及用确定性信号筛选异常的实践。
标签索引
这个标签下有 471 篇文章。按时间回看相关判断与实践记录。
标签精选
Agent 评估的重点正在从追逐能力上限转向守住行为底线。Ben Hylak 分享了生产问题发现、评估代码化,以及用确定性信号筛选异常的实践。
很多人搭知识库,第一步就开始设计目录、标签和模板。结果通常是:系统越来越漂亮,笔记越来越少。 Warp 开发者关系负责人 Ben Holmes 在一场分享里给出的顺序很反直觉:先别整理,先把想到的东西尽可能留下来。等原材料积累到一定规模,再...
Jason Liu 在 AI Engineer 的这场 Codex 工作坊,表面是在讲 appshots、skills、plugins、memory、automation 和 computer use,实际讲的是一个更大的转向:Agent ...
Peter Yang 这期视频展示了 GPT-5.6 发布后,ChatGPT 桌面端如何从聊天工具变成管理邮件、日历、播客准备和网站发布的个人操作系统。这不只是一个工具教程,更是一套 AI 时代工作方式的落地样本。 Peter Yang 这...
上一课讲 Function Calling 时留了一个尾巴:各家 API 的工具定义互不相通,工具一多,集成工作量就爆炸。这一课要讲的 MCP(Model Context Protocol,模型上下文协议)就是冲着这个问题来的——它是 An...
“把公司知识库接进 AI”几乎是每个 AI 产品经理都会接到的第一单需求: 智能客服要懂产品手册, 内部助手要懂规章制度, 销售工具要懂最新报价单。但模型本身不认识你公司的任何一份文档, 让它”认识...
这一课解决一个非常具体的问题:你想让 AI 稳定地干一件复杂的活——比如每天产出一篇合格的公众号文章——但你发现,把所有要求塞进一段超长提示词里,结果时好时坏,坏了还不知道坏在哪。学完这一课,你会掌握”工作流”这个解...
这一课解决三个问题: 智能体(AI Agent)到底是什么, 为什么一段写得好的提示词就能构建出一个最简版本, 以及这种”纯提示词智能体”的能力边界画在哪里。学完你可以自己动手做一个能用的智能体——不写一行代码。 很...
你大概遇到过这种场面:老板说”给客服系统加个 AI 总结功能”,你打开对话框写下”请总结这段对话”,跑了三次,三次结果长得都不一样——有时五百字,有时两行,有时结尾还带一句”希望这...
Vaibhav Gupta 的题目叫 “fighting slop with slop”。这个标题很口语,但讲的是一个严肃问题:AI 产出的粗糙内容,能不能用另一套 AI 工具链来治理。 原视频:https://ww...