
大模型周刊|2026.08.15–08.21
本周大模型行业有一条清晰主线:模型厂商开始把竞争重点推向真实工作流。OpenAI补青少年安全与教育产品,Anthropic把 Computer Use、Skills API 和 Files API 推向生产使用,Google继续用 Flash 系列争夺速度与成本,国产模型则借助后训练和开源,把编程、网络安全与 Agent 能力继续往前推。
如果只看一句话:闭源厂商在强化可控性和产品交付,开源阵营在压缩能力与成本差距。
OpenAI:安全机制开始进入产品默认值
8月18日,ChatGPT for Teens 正式上线。系统会自动识别 13–17 岁用户,并默认加强对自残、暴力、色情内容和浪漫角色扮演的防护。产品还加入 Study Mode、作业提醒,以及家长侧的 Quiet Hours 和 Study Hours 控制。
OpenAI也给出了更明确的互动边界:模型不应假装拥有情感或意识。学习场景中,产品提供可视化学习工具和测验功能,方向从“回答问题”扩展到“辅助学习过程”。
付费用户获得了 Private Safety Processing。它尝试结合多轮对话识别风险模式,降低只看单次请求带来的误判。
产品侧还有两个变化:ChatGPT 的 Apple Messages 插件上线,可以在获得授权后代发或整理 iMessage;Codex则继续出现在代码迁移等实际业务案例中,外界关注点从“能不能写代码”转向“能否用更低成本完成长期工程”。
Teen 模式仍有待验证。年龄预测是否可靠、家长控制是否会被持续使用、作业提醒能否被轻易绕过,都决定了产品效果。已有测试显示,系统会拒绝直接代写论文,但在解题类请求中仍可能给出接近完整答案。
我的判断是:OpenAI正在补齐安全产品的基础设施。方向比缺位强,距离“默认安全”还有距离,难点集中在有用性、风险识别和教育边界之间的动态平衡。
Anthropic:Computer Use 从实验能力走向生产工具
Anthropic本周将 Computer Use、Skills API 和 Files API 推向一般可用,并配套提供浏览器工具 Browser Use。开发者可以在 Claude Platform 上组合批量动作、文件处理和浏览器操作,构建更完整的生产级 Agent。
Claude Academy 也同步推出,重点放在安全、有效地使用 AI。Anthropic的路线很明确:模型能力需要进入软件、浏览器和文件系统,Agent才有机会承担连续任务。
Computer Use 从实验功能进入 GA 后,评估重点会发生变化。开发者关心的不再只是演示效果,还包括动作成功率、失败恢复、权限隔离、审计能力和成本控制。Agent能否稳定运行,决定了这条路线的长期价值。
Google:Flash 系列继续抢速度与成本
Gemini 3.7 Flash 于8月13日发布,并在本周持续推开。产品定位是高速度、高性价比的工作马,重点覆盖编码、Agent 和知识工作流。年底前的价格优惠进一步强化了它在开发者场景中的吸引力。
在 DeepSWE、FrontierCode 等基准上,Gemini 3.7 Flash 相比前代有提升。Google还公布了手语 AI、WeatherNext 气旋预测等应用侧进展。
Google的节奏越来越像“三周一个小版本”:Flash先快速迭代,Pro保持更谨慎的发布节奏。短期看,Flash更适合成本敏感的 Agent 和批量任务;旗舰 Pro 何时全面上线,以及能否在复杂任务上拉齐竞品,仍是后续观察点。
智谱 GLM-5.3:后训练把同一基座推上新台阶
8月14日,智谱发布 GLM-5.3,API 于本周上线,模型权重计划下周五开源。GLM-5.3沿用 GLM-5.2 基座,主要通过后训练提升编程与网络安全能力。
按本周材料,GLM-5.3 已进入 Artificial Analysis Intelligence Index 的全球前沿区间,在开源模型中处于前列。编码相关基准相比前代提升明显,网络安全能力接近甚至在部分测试中超过 Mythos 5 与 GPT-5.6 Sol。
智谱还启动了“开源的盾”安全审计计划,试图在模型开放与风险控制之间建立配套机制。
GLM-5.3最值得关注的地方是后训练效率。基座能力达到一定水平后,强化学习和任务导向后训练可以快速改善编程、工具调用与安全任务表现。权重开源后的真实部署体验、显存要求和社区微调效果,才会决定这次跃升能否转化为长期生态优势。
DeepSeek:V4 Pro 和 Harness 一起推进 Agent 落地
DeepSeek-V4-Pro-0813 正式版上线后,Agent能力继续提升。DeepSWE、Terminal 等相关基准均有进步,部分结果接近 Fable 5。
DeepSeek同步开源 DeepSeek Harness,采用 MIT 许可和“一切皆插件”的架构,方便开发者二次开发 Agent。模型之外,Harness降低了任务编排、工具扩展和运行时集成的门槛。
DeepSeek的差异化越来越清楚:价格保持竞争力,模型围绕 Agent 场景优化,配套工具直接开放。峰谷定价计划如果落地,还会进一步影响批量 Agent 任务的成本模型。
Kimi、MiniMax:开源规模与创作工具成为另一条线
月之暗面本周主要延续 Kimi K3 的影响。K3的开源、2.8T 参数规模和综合评测表现仍在开发者社区持续发酵,融资进展以及美国侧制裁威胁讨论也在增加。
K3是今年开源模型的重要节点,但算力供给、部署成本和商业化落地仍是现实约束。中国模型开源之后,技术竞争和地缘政治风险会同时进入产品决策。
MiniMax发布 MiniMax Design,定位为多模态创作 Harness,覆盖素材处理、生成、编辑和交付流程,底层使用海螺 H3 等视频模型。它的价值取决于能否把意图理解、任务拆解和模型调度真正串起来。完成这一步,产品才会从“模型入口”变成可交付的创作工具。
OpenClaw 与 Hermes:Agent开始组织成团队
OpenClaw 7.1 发布后,Control UI 继续升级,并支持更多前沿模型。它正在从一个“能运行 Agent”的框架,向本地或远程 Agent 控制台演进,插件生态和本地 LLM 部署也获得更多讨论。
Hermes Desktop则将 Bot Mode 正式内置。用户可以把单个 Agent 配置成带名称的 Bot 团队,支持互相 @、共享 Inbox 和多 Agent 协作。
两条路线都指向同一个变化:Agent的产品形态开始从单体助手转向可编排的工作单元。接下来比拼的会是任务分工、上下文共享、权限管理和失败恢复,而非 Bot 数量本身。
本周判断:能力、成本、控制权同时进入交付阶段
本周的四个信号可以压缩成一张判断表:
| 方向 | 本周变化 | 对开发者的影响 |
|---|---|---|
| 安全 | OpenAI推进青少年安全,智谱启动开源审计 | 安全策略逐渐进入产品默认值 |
| Agent | Anthropic工具 GA,DeepSeek发布 Harness | Agent开始接入浏览器、文件和真实业务流程 |
| 成本 | Gemini Flash、DeepSeek继续压低使用成本 | 批量任务和长流程 Agent 更容易落地 |
| 生态 | GLM-5.3权重、DeepSeek Harness、Hermes Bot Mode | 开发者获得更多模型与运行时选择 |
本周最值得跟踪的有四件事:GLM-5.3权重开源后的部署反馈,Claude Computer Use 的真实成功率,DeepSeek Harness 的插件生态,以及 ChatGPT for Teens 的实际安全效果。
下一阶段的分水岭会落在真实工作流里:谁能稳定完成任务,失败时能恢复,成本还能算得过来,谁就更接近生产级 Agent。
下周一见。







