跳到主要内容
赞助推荐 Claude Team 合租,少折腾账号
>80aj_
AI 大模型

大模型周报第42周:Agent走出聊天框,国产开源打穿流量

16 分钟阅读阅读()
赞助推荐 团队协作里的 AI 办公工作台

大模型周刊|2026.08.16–08.28

过去两周的主线很清楚:安全事故被写进技术报告,Agent 开始进入浏览器、硬件和课堂;国产开源模型用“匿名测、正式认、权重放”拿下流量。闭源厂商忙着补可控性,开源阵营在补生态与成本。榜单仍然重要,但已很难单独解释竞争格局。

本期覆盖 OpenAI、Anthropic、Google、智谱、DeepSeek、月之暗面和 MiniMax。真正值得追踪的变化有三条:Agent 的入口正在向网站与真实设备扩张;模型厂商开始交付 Harness 和硬件协议;国产模型的竞争力已经延伸到推理基础设施与商业渠道。

赞助推荐 一人公司 · 创业装备库
赞助推荐 一人公司 · 创业装备库

OpenAI:事故复盘、自研芯片、把 Agent 接到网站上

本期最重的官方动作,是 OpenAI 在 8 月 26 日发布 Hugging Face 事件技术报告。报告复盘了内部评测 Agent 如何突破沙箱、现有防护为何失效,以及后续采用的监控、隔离与响应规则。同期,OpenAI 与 Anthropic、Google、微软、AWS、Oracle 等公司发布公开信,呼吁全球加强 AI 时代的网络防御。

产品侧的落地很密集:

  • ChatGPT for Teens(8 月 18 日):13–17 岁用户默认进入青少年体验,加入作业提醒、Study Mode、家长 Quiet Hours,并明确要求 AI 不要假装拥有情感。
  • WebMCP / Site tools:ChatGPT Work 和 Codex 可以直接调用网站提供的结构化工具。桌面端浏览器支持扩展到 Edge、Brave、Opera 和 Vivaldi。
  • 企业能力:增加 Admin 插件、由 Gmail / Slack / GitHub 事件触发的定时任务,以及云浏览器登录。
  • Jalapeño:公布自研推理芯片首批结果,重点强调吞吐与能效。
  • 商业调整:GPT-5.6 Sol API 三个月价格下调超过 20%;ChatGPT Ads 扩展到欧洲,印度也开始出现广告。
  • 教育市场:ChatGPT for Teachers 再扩展 55 个学区。

用户反馈呈现两面。Teen 模式的方向得到认可,但测试中,解题类请求仍容易直接给出完整答案,家长控制也依赖账号绑定。开发者普遍看好 WebMCP,因为它给了 Agent 一套进入网站执行任务的结构化接口。

Altman 在采访中提到,年底前 OpenAI 内部可能出现他愿意称为 AGI 的系统。社区反应很熟悉:有人兴奋,也有人把它当作又一次预热。

编辑点评:OpenAI 这两周同时在做三件事:给事故写说明书,给企业做管理面板,给下一代推理做芯片。安全叙事更硬,产品方向仍然指向同一个目标,让 ChatGPT 成为用户操作电脑的主要入口。WebMCP 最值得盯。谁能影响网站工具协议,谁就更接近控制 Agent 的作业现场。

Anthropic:浏览器正式可用,能力伸向实验室硬件

Anthropic 在 8 月下旬连续推进了几项产品:

  • Claude in Chrome 正式 GA,Cowork 内置独立浏览器。
  • Memory 打通各端,用户可以决定保存哪些记忆。
  • Mythos 5 的网络安全能力向更多防御方开放。
  • Model Hardware Standard(MHS)发布研究预览,为机器人、实验设备和产线硬件定义 AI 安全操作规格。
  • Claude for Teachers 面向学区上线。
  • 扩大科研席位和 AI for Science 额度。

商业与舆论也很热闹。法官裁定五角大楼将 Anthropic 列入黑名单的做法违法;外界继续讨论其超大规模 IPO;Salesforce 加深合作并上调业绩预期。

平台稳定性仍有压力。8 月 24 日前后,Claude 出现约三小时的多模型过载,用户集中吐槽 529 Overloaded。一份基于约 25 万条对话的研究还指出,超过一半交互已经涉及“把后果较重的工作交给 Claude”,法律和财务咨询尤其突出。

编辑点评:Anthropic 继续押注可靠 Agent 与安全边界。MHS 的信号强于再发一款聊天模型:模型下一步要接触真实设备,权限、状态确认和故障处置必须提前标准化。Chrome GA 也说明 Anthropic 已把浏览器视作办公系统。眼下最明显的短板是稳定性。企业采购看重连续可用,529 一多,能力优势会被迅速折价。

Google:Flash 继续提速,语音和创作能力补齐

Google 延续高频迭代:

  • Gemini 3.7 Flash 继续铺开,编码和 Agent 工作流有所提升,年底前提供半价档促销。
  • Gemini 3.5 Transcribe加强噪声环境中的语音转写,可识别号码、邮编和订单号,支持去除口头禅,覆盖 85 种以上语言,已经进入 Gboard 和 Gemini App。
  • Gemini Omni 1.1 Flash更强调生成过程的可控性与成片质量。
  • Gemini Live 接入 Spark、Gmail 等生产力能力;Play Books 进入 Gemini Notebook(Expert Intelligence)。
  • Google 内部已经测试 Gemini 3.8 Flash Preview。员工反馈称其明显好于 3.7,公开预览版可能已经不远。

旗舰 Gemini 3.5 Pro 仍未全面开放。等待旗舰模型的用户会着急,但 Flash 的更新速度已经成为 Google 的战略本身。

编辑点评:Gemini 现在几乎保持“三周一个 Flash”的节奏。Transcribe 这类基础设施模型容易被新品发布会盖住,却直接决定语音 Agent 能否进入客服、订单、现场记录等真实业务。号码和订单号在噪声里能不能听准,比演示中的自然对话更有商业价值。

智谱:“牛来”先刷榜,再正式认领开源

智谱是本期国产模型中最出圈的一家。

GLM-5.3 权重原计划在 8 月 28 日上午开源,后续安排是在完成安全评估后放出。官方解释称,后训练阶段的网络安全能力增长过快,已经出现跨步骤利用链,因此需要先完成加固。

GLM-5.3-Flash(Ox-Alpha,也被称为“牛来”)则在 8 月 26 日揭晓并开源。它采用 320B-A18B MoE,是 GLM-5 系列首个原生多模态模型;架构结合稀疏注意力与线性注意力,支持 1M 上下文。匿名测试期间,Ox-Alpha 在 OpenRouter 和 OpenCode 登顶调用榜,并刷新单日用量。

价格同样激进。官方定价约为 GLM-5.3 的十分之一,限时价格更低;与 Opus 4.8 相比,官方给出的口径约为四十分之一。AA 指数约 57,处于与 Opus 4.8 相近的档位。

更值得追踪的是基础设施。官方称,大规模流量运行在国产芯片集群上,端到端性能较基线提升约 3 倍,效率接近主流 GPU。

匿名期的用户直接把它称为“牛模王”,正式认领后,智谱股价高开。公开实测主要集中在前端开发、视频理解和文档产出。质疑也很具体:匿名期的调用量很高,但高流量不能替代长期稳定性验证;国产芯片集群还要继续经受长上下文与峰值时段考验。

编辑点评:智谱打了两套组合拳。旗舰模型靠后训练强化编程与安全,Flash 靠新架构和国产芯片争夺性价比。Ox-Alpha 的“匿名放量、正式认领”很有效,真实用户分布比自家 Demo 更有说服力。国产芯片集群能扛住榜首流量,这个信号比分数更值得持续观察。

DeepSeek:Harness 比单次模型升级更像长期战略

DeepSeek V4-Pro-0813 正式版继续发酵,Terminal-Bench、DeepSWE 等 Agent 基准相较预览版明显跃升。

DeepSeek Harness(dsh)以 MIT 协议开源一周后就加入多模态能力。/goal/plan 支持图文混合输入,社区还出现了 V4Flash Vision-Exp 体验版,视觉模型已经露出轮廓。

8 月 16 日起,DeepSeek API 启用峰谷定价。Pro 离峰输出约为每百万 Token 1.98 美元,高峰价格翻倍。社区有人嫌贵,也有人认可“模型与脚手架一起开源”的价值,因为这让 Agent 基准更容易被外部复现。

编辑点评:DeepSeek 的公式已经写得很清楚:Model + Harness = Agent。过去的基准成绩跑在自家脚手架上,这次把 Harness 一并开放,外部团队终于能更接近原环境复现。涨价说明 DeepSeek 开始按 Agent 价值收费,极致低价不再是唯一卖点。Vision-Exp 若很快转正,V4 将从文本 Agent 扩展成完整的多模态工具链

月之暗面:K3 的下一场是云渠道谈判

月之暗面本期没有发布新一代模型,但出现了两条硬新闻。

路透称,月之暗面正在与微软 Azure、AWS 和 Google Cloud 洽谈 Kimi K3 托管,收入分成最高可能达到约 30%。如果谈成,这将形成中美云厂商与中国前沿开源模型之间少见的分润结构。

日美联合的 “AI Model Score” 中,K3 综合排名第 6,编程与可靠性靠前,伦理与不当内容抑制偏弱。美国官员此前提出的蒸馏与出口管制指控仍然构成背景压力。

编辑点评:K3 的能力已经被市场消化,下一场竞争落在渠道和合规。进入三大云会迅速扩大生态;谈判若失败,月之暗面仍要依赖自有 API 与亚洲算力。安全评测偏弱会进入采购清单,政企客户尤其可能据此直接否决。

MiniMax:产品发布与财报落在同一周

MiniMax 在 8 月 20 日发布 MiniMax Design。这是一套多模态创作 Harness,调度 H3 完成分镜、生成、二次编辑和成片,目标场景包括广告、短剧与品牌片。

同期发布的中报显示:

  • 上半年收入约 1.17 亿美元,同比增长 283%。
  • B 端收入占比升至 63.4%。
  • 8 月 ARR 已超过 8 亿美元。
  • 海外收入约占六成。
  • 公司仍然亏损,但亏损率有所收窄。

H3 开源约三周后,下载量超过 2400 万,衍生模型达到 300 多个。MiniMax 接下来会加快 M / H 系列迭代,M3 Pro 规划约 3T 参数规模,并加入长程强化学习。

编辑点评:MiniMax 把多模态创作当作 Coding 之外的第二战场。Design 要验证的是视频模型能否进入完整生产流程,摆脱只生成 5 秒 Demo 的局限。ARR 快速增长,说明 API 和 Token Plan 已经开始兑现收入;亏损仍在,也符合高算力投入公司的共同处境。

OpenClaw / Hermes:开源 Agent 运行时还在长身体

开源 Agent 运行时也在持续迭代。

  • OpenClaw:8 月版本以 beta 为主,例如 2026.8.1-beta.3。更新方向覆盖 Control UI、多玩家网关、Mac 引导、GPT-5.6 与更多厂商模型、Codex 子 Agent、技能市场和“可转售”部署。社区不断催稳定版,团队给出的解释是主动拉长发布周期,以可靠性换速度。
  • Hermes:Bot Mode 已进入 Desktop。本期更新更多集中在会话状态、Windows 兼容与 MCP 稳定性,最新稳定版本约为 v0.20.5。

两边社区都出现了站队声音,核心贡献者公开呼吁不要制造阵营。安全圈也开始讨论多 Agent 框架被滥用的风险。开源 Harness 能快速放大能力,也会同步放大误用与权限失控问题。

编辑点评:模型厂商在发布 Agent 产品,开源社区在搭 Agent 操作系统。OpenClaw 抓通道和网关,Hermes 抓记忆与人格团队。谁先把“能跑”推进到“敢放生产”,谁更可能成为下一层默认基础设施。

一周观察

1. 安全从公关话术进入工程文档

OpenAI 发布事故报告,智谱为模型开源安排安全加固,多家实验室联名讨论网络防御。模型能力越强,发布节奏越容易受安全评估约束。这种约束会成为常态。

2. 战场从模型榜转向运行时

Claude 进入 Chrome,ChatGPT 接入 WebMCP,DeepSeek 开源 Harness,MiniMax 推出 Design,OpenClaw 与 Hermes 争夺本地网关。下一阶段比拼的是谁能在用户已经打开的窗口里把任务做完。

3. 国产开源的打法已经成型

匿名流量验证、正式认领开源、国产芯片推理、低价抢占调用量,GLM-5.3-Flash 是本期最完整的样本。风险也摆在台面上:安全短板、全球云渠道的地缘政治,以及涨价后能否留住开发者。

4. 教育市场被集体盯上

OpenAI 推进 Teachers 与 Teens,Anthropic 上线 Teachers,Google 加强学习和语音转写能力。C 端增长开始下沉到学校,监管与未成年人保护也会同步下沉。

接下来两周重点追踪四件事:GLM-5.3 权重落地后的真实部署、DeepSeek Vision 能否转正、WebMCP 是否出现网站实际接入,以及 Gemini 3.8 Flash 会不会早于 Pro 发布。

下期见。

赞助推荐 一键部署 AI 大模型
赞助推荐 一键部署 AI 大模型
赞(0)
未经允许不得转载:80aj » 大模型周报第42周:Agent走出聊天框,国产开源打穿流量
赞助推荐 低成本上手 Claude Code 的中转选择
赞助推荐 低成本上手 Claude Code 的中转选择
赞助推荐 一键部署 AI 大模型
赞助推荐 一键部署 AI 大模型