持续更新
更多文章
大模型周报第41周:Agent开始进生产线,开源模型继续压成本
> 大模型周刊|2026.08.15–08.21 本周大模型行业有一条清晰主线:模型厂商开始把竞争重点推向真实工作流。OpenAI补青少年安全与教育产品,Anthropic把 Computer Use、Skills API 和 Files ...
Karpathy 讲透 Software 3.0:当英文成为编程语言,AI 工程师真正该设计什么
Andrej Karpathy 在 Stanford 的这场演讲,表面上是一场关于 Transformer、GPT 和提示工程的技术分享,真正值得留下的核心判断只有一句:软件正在从“人来设计算法”,转向“人来设计数据和语言程序”。模型能力越...
杀死代码评审:AI 写代码、AI 审代码之后,人剩下的是对齐
本文整理自 AI Engineer 大会上 Aviator 联合创始人 Ankit Jain 的演讲《How to Kill the Code Review》。他几个月前写过一套「杀死代码评审」的五层信任模型,这次上台主要做自我修正:评审从...
Agent 评估不再只看能力上限,先守住最坏行为
Agent 评估的重点正在从追逐能力上限转向守住行为底线。Ben Hylak 分享了生产问题发现、评估代码化,以及用确定性信号筛选异常的实践。
别急着整理知识库:先让 Agent 有足够的“原材料”可吃
很多人搭知识库,第一步就开始设计目录、标签和模板。结果通常是:系统越来越漂亮,笔记越来越少。 Warp 开发者关系负责人 Ben Holmes 在一场分享里给出的顺序很反直觉:先别整理,先把想到的东西尽可能留下来。等原材料积累到一定规模,再...
ChatGPT Go、Plus、Pro 和 Claude 怎么选?按周看懂 7 款套餐
AI 个人订阅只需要看两组对标:**ChatGPT Plus 对 Claude Pro,ChatGPT Pro 对 Claude Max 5× / Max 20×**。放在一张总表里,价格和额度关系会清楚很多。 月金额按一年 52 周折算:...
从单线程长事务到并行短事务:任务投送链路的修复方法
一个任务投送系统出现过两种症状。待执行任务进入 Kafka 的速度不够,数据库也频繁出现锁等待。两种症状来自同一段调度代码。 旧流程用一个线程逐条发送任务。整批投送又共用一个数据库事务。前面的任务已经改过状态,却要等批次尾部的任务发送结束。...
我把 Codex 上的几十个 Skill 迁移到了 DeepSeek Harness,全程可用
AI 竞争已经打到了第三层。第一层拼基础模型——GPT、Claude、Gemini 谁更强;第二层拼 Agent——Codex、Claude Code、Trae 谁更好用。DeepSeek 上周扔出一件新东西,直接把战场拉到了第三层:Har...
AI Agent 做 TDD 有没有用: 实测排名与 3 倍 token 成本
过去一年里,”让 AI 写测试优先”几乎成了 AI 编程的政治正确。绝大多数被传播的 CLAUDE.md、AGENTS.md、.cursorrules 里,都能找到一句”先写失败的测试,再写实现̶...
大模型周刊第40周:后训练开始接管主战场
本周大模型圈最重要的信号不是又多了几个新模型,而是后训练、Agent能力和开源可用性同时加速。智谱、DeepSeek、Google、OpenAI和Anthropic都在用不同方式回答同一个问题:模型怎样从会聊天变成能稳定干活。
四个工作 Agent 同题实测:好看的报告不等于可信交付
本文整理自「灵姐说AI」对 WorkBuddy、Kimi Work、千问办公和 TRAE Work 的同题实测。真正值得看的不是谁的界面更像 Codex,而是工作 Agent 进入日常流程后,什么才算可验证、可追责、可直接使用的交付。原视频...
Codex 背后的 Harness:OpenAI 把 Coding Agent 的控制层讲透了
本文整理自 OpenAI Dominik Kundel 在 AI Engineer World’s Fair 的演讲。它真正值得看的地方,不是 Codex 又多了几个功能,而是 OpenAI 正在把 coding agent 的关键能力从“...
Claude Team 合租:南洋公司招 Claude 难民,275 元/月值不值
如果最近一轮 Claude 封号潮把你赶出了个人订阅,这个标题可能很有画面感:一家南洋公司开始“招聘 Claude 难民”,月薪没有,工位费倒是每月 275 元。 这里的“招聘”当然不是劳动合同,而是加入一家新加坡公司的 Claude Te...
大模型周刊 39:工作流开始压过参数规模
2026 年 8 月第一周没有新的旗舰模型炸场,但产品下沉、企业合规、开源视频、Agent 基础设施和融资动作都在加速。真正的主线越来越清楚:大模型竞争正在从参数规模,转向稳定、便宜、可控地交付工作流。 上半月的余温还在。OpenAI 继续...
Jason Liu 的 Codex 工作坊:别再把 Agent 当聊天框了
Jason Liu 在 AI Engineer 的这场 Codex 工作坊,表面是在讲 appshots、skills、plugins、memory、automation 和 computer use,实际讲的是一个更大的转向:Agent ...
大模型周刊 38|价格战、开源权重和 Agent 落地同时加速
2026 年 7 月最后一周,大模型行业的主线很清楚:美国头部厂商用降价和生态补强防守,中国开源阵营继续用权重开放和性价比抢开发者心智,Agent 与具身智能开始从概念走向生产场景。
FreeModel.dev 实测: Claude Code 中转站接入、套餐与验真
有人在搜索框里反复打 freemodel 这个词。需求还是那个老需求:想用 Claude Code,但官方订阅要美区信用卡,价格也压手,于是去找中转站。 FreeModel.dev 是最近冒出来的一个,口号喊得很大——”One ...
大模型周刊 37:越狱、算力与开源反击
2026 年 7 月 18 日到 7 月 24 日,大模型圈的关键词不是单纯的跑分,而是安全事故、算力约束和开源模型的反击。OpenAI 内部测试引发的 Hugging Face 安全事件,把能力与护栏的矛盾推到了台前;Kimi K3、GL...
代码写作快免费了,软件工程反而更难了
Google DeepMind 研究副总裁 Benoit Schillings 在 AI Engineer 的这场分享里说了一句很狠的话:代码已经结束了,但还有大量事情要做。本文整理这场演讲,并结合我自己的 AI 编程 / Harness ...



















