
观察区间:2026.08.29-09.04。系列内部编号为第43期;该日期跨 ISO 第35与第36周,所以标题直接使用日期口径。
这一周的信息很多,真正值得记住的只有三条线:旗舰模型开始围绕长任务和电脑操作换代;网络安全能力从评测项目变成受控产品;中美厂商越来越愿意谈收入、成本和分发入口。
榜单仍然热闹,但竞争坐标已经移动。读完这一期,至少可以带走一个判断:选模型时只看“谁更聪明”越来越不够,产品入口、任务可靠性、单位成本和安全边界开始共同决定结果。
旗舰换代:模型开始争“谁更像员工”
Anthropic 在 9 月 1 日发布 Claude Fable 5.1。官方把它放在长程 agent、代码和知识工作的场景里,强调模型能处理跨应用、持续数小时的任务。API 定价是每百万输入 token 10 美元、输出 50 美元,缓存读取降到 0.25 美元。
这组信息比单个榜单分数更有用。它说明旗舰模型的卖点正在从一次回答,转向整段工作:读代码库、追踪目标、遇错恢复,再把交付物交给人审阅。模型能否稳定跑完一夜,开始比某项考试多拿两分更影响采购。
Google 的 Gemini 3.8 Flash 也已进入正式可用状态。官方文档列出 100 万 token 上下文、6.4 万 token 最大输出,并把长程软件工程、自动化 agent 和复杂企业流程写进定位。介绍期 API 价格是每百万输入 0.75 美元、输出 3.75 美元,2027 年起执行标准价 1.50/7.50 美元。
Google 的打法很清楚:用 Flash 的速度和价格承接大规模日常任务,再借搜索、办公套件、云平台和 Android 扩散。开发者未必会把它当成唯一旗舰,但分发优势可以把“偶尔试用”推成“默认可用”。
OpenAI 的 GPT-6 Astra 在本周获得大量公开报道,第三方评测页面也已出现对应条目。由于 OpenAI 官方发布页在核验时被访问保护拦截,原稿中的榜单分数、价格、补贴额度和“AGI 时代”等口号没有进入定稿。可以确认的趋势仍成立:OpenAI 正把电脑操作、浏览器执行和网络攻防放进旗舰竞争的中心。
眼下更稳妥的分工是:Claude 抢长任务可靠性,Gemini 抢性价比和分发,OpenAI 抢电脑操作与完整工作流。三家都想让模型像员工,只是“岗位说明书”不同。
Cyber 产品化:能力越强,开放方式越谨慎
网络安全过去常被写成 benchmark 的一列分数。本周的产品叙事发生了变化:厂商开始把攻防能力与访问资格、隔离环境、监控和责任边界绑在一起。
原稿提到 OpenAI、Google 和 Anthropic 都在把高风险能力交给受信任的防御组织。当前核验只完整确认了 Anthropic 对 Fable 5.1 的安全防护说明;OpenAI Daybreak、Google Cyber 版本及相关精确指标未取得足够的一手证据,因此没有作为新闻事实展开。
即便删去那些漂亮数字,方向也足够清晰。网络安全模型很难按普通 API 的方式全面放开。厂商更可能采用白名单、用途审查、隔离运行和更严格的日志留存。企业买到的会是一套带治理条件的能力,而非一个随手可调的“万能黑客助手”。
这会改变模型产品的竞争维度。安全团队关心的不只有检出率,还包括谁能访问、在哪运行、出了问题怎样追溯。高能力如果没有可解释的准入机制,反而更难进入政企采购。
商业化数字:实验室开始像上市公司说话
原稿给出了智谱和 MiniMax 中报、月之暗面递表、DeepSeek 收入与融资等大量数字。遗憾的是,本轮核验没能从港交所公告、公司财报或其他一手文件逐项确认这些金额。正式稿不复述未经审计的 ARR、亏损和估值数据。
数字暂时拿掉,主线依然成立。国内模型公司讨论的重点已经明显转向 API 调用、B 端收入、国产算力、开源分发和单位智能成本。模型发布承担两项任务:证明能力,也证明商业模式能承受推理账单。
月之暗面秘密递交 A1 的说法目前仍是市场传闻,公司据报道“不予置评”,港交所公开记录中尚未形成可核结论。它可以作为资本窗口的观察信号,不能写成已经完成的 IPO 动作。
DeepSeek 官方新闻页确认 V4-Flash-Vision-Exp 已进入 API,并新增图像输入。原稿中的开源权重体积、财务数据和融资估值未完成一手核验,因此删去。对开发者来说,确定的信息已经够用:DeepSeek 正把低成本文本模型向多模态工具调用推进。
商业化的压力也会反过来塑造产品。低价负责获客,旗舰负责利润,缓存、批处理、峰谷价和订阅套餐负责平衡算力。以后看一次模型发布,定价页和可用区域与 benchmark 同样重要。
Harness 在收编用户
模型层打得激烈,工作台层也在扩张。OpenClaw 2026.8.1 已在 GitHub 正式发布;原稿称它为“OpenClaw 2.0”,但正式版本号就是 2026.8.1,因此定稿按实际版本描述,也删掉了未能从发布页复核的贡献者和 PR 统计。
Hermes Agent v0.21.0 则在 8 月 31 日发布,代号 Pantheon。其发布说明确认 Bot Mode 已进入桌面端:agent 有独立名称和头像,可以在应用内协作,并接入浏览器等工具。开源 agent 正从“套一层 CLI”走向长期工作台。
这里有个经常被低估的现实:模型容易换,工作流很难换。团队把记忆、工具权限、自动化任务和审计记录接入某个 harness 后,迁移成本会快速上升。模型月卡决定本月用谁,harness 可能决定未来两年谁掌握入口。
安全也因此更重要。长期运行的 agent 能读文件、开浏览器、调用服务,默认配置是否克制,会直接影响系统能否从个人玩具进入企业环境。功能扩张越快,权限边界越要提前设计。
一周判断:预算正在重新分配
旗舰模型已经不满足于“回答得更好”,它们开始竞争完整任务。Cyber 能力进入受控交付,说明厂商在能力之外承担更多治理责任。商业化数字频繁出现,则说明资本市场和客户都在追问同一个问题:智能能不能持续卖出去。
近期选型可以按任务拆开:
- 长程写代码、改仓库:优先验证 Fable 5.1 的稳定性和成本。
- 大规模 agent 与企业流程:把 Gemini 3.8 Flash 放进性价比测试组。
- 电脑操作与浏览器执行:等待 Astra 的官方可用范围和价格在目标账户落地后再评估。
- 低成本图像理解:试用 DeepSeek V4-Flash-Vision-Exp,但保留质量与安全回归测试。
- 7×24 小助手:OpenClaw 与 Hermes 都值得看,先收紧权限,再接真实账号和生产数据。
下周最值得追踪的有三件事:Astra 的官方材料与真实开放范围、Fable 5.1 长任务的失败率、月之暗面递表传闻是否出现可核文件。到那时,再给数字下结论。







