大模型周报第41周:Agent开始进生产线,开源模型继续压成本
> 大模型周刊|2026.08.15–08.21 本周大模型行业有一条清晰主线:模型厂商开始把竞争重点推向真实工作流。OpenAI补青少年安全与教育产品,Anthropic把 Computer Use、Skills API 和 Files ...
标签索引
这个标签下有 382 篇文章。按时间回看相关判断与实践记录。
标签精选
> 大模型周刊|2026.08.15–08.21 本周大模型行业有一条清晰主线:模型厂商开始把竞争重点推向真实工作流。OpenAI补青少年安全与教育产品,Anthropic把 Computer Use、Skills API 和 Files ...
Agent 评估的重点正在从追逐能力上限转向守住行为底线。Ben Hylak 分享了生产问题发现、评估代码化,以及用确定性信号筛选异常的实践。
2026 年 7 月 18 日到 7 月 24 日,大模型圈的关键词不是单纯的跑分,而是安全事故、算力约束和开源模型的反击。OpenAI 内部测试引发的 Hugging Face 安全事件,把能力与护栏的矛盾推到了台前;Kimi K3、GL...
Google DeepMind 研究副总裁 Benoit Schillings 在 AI Engineer 的这场分享里说了一句很狠的话:代码已经结束了,但还有大量事情要做。本文整理这场演讲,并结合我自己的 AI 编程 / Harness ...
本文整理自 Google DeepMind 工程师 Philipp Schmid 在 AI Engineer 的演讲。核心问题不是 Skill 有没有用,而是没有 eval 的 Skill 无法判断何时该触发、何时该退休,也无法证明它真的让...
作者:toy | 覆盖周期:2026.6.29 – 2026.7.10 这一周 OpenAI 和 Anthropic 都把自己最强的模型放了出来,但两家都不是自己说了算。GPT-5.6 等联邦机构做完安全基准评估才全球开放;Anthropi...
AI Engineer World’s Fair 2026 收尾日(官方叫 Day 4),主舞台的关键词是 harness engineering。如果说 Day 1 在搭软件工厂、Day 2 在教工厂做研究,Day 3 问的是...
当天主舞台大多数分享讲的都是怎么让 agent 更好地写代码、调用工具、管住上下文。轮到 Brendan Rappazzo,话题忽然从代码对不对,跳到了一个更难缠的问题:道德对不对。他带来的项目叫 Loophole。做法是把你的道德原则翻译...
PostHog 有个叫 wizard 的命令行工具,能读你的代码库、装 SDK、埋点、建仪表盘。团队一度想把它变成安装 PostHog 的默认方式。做这件事的 context engineer Sarah Sanders 说,野心刚冒头,她...
AI Engineer World’s Fair 2026 的 Harness Engineering 专场排了一整个上午,从九点排到中午,一共五场。几乎都在回答同一个问题:怎么让 agent 在没人盯着的时候还靠谱。压轴的这场...