
大模型周刊第 44 期,覆盖 2026 年 9 月 5 日至 11 日。系列编号沿用“第 44 周”,日期以本期覆盖区间为准。
七天里,OpenAI、Google 和 DeepSeek 都有产品动作。Anthropic 又发布了一份份量很重的威胁情报报告,把长期存在的模型蒸馏争议直接摆到台面上。
真正影响开发者的,也许还不是某一张新榜单。模型换得越来越快,提示词、Skills、评测集和预算却需要反复重做。这周值得记住三条线:旗舰更新已经按周计算;“智能从哪里来”开始成为合规问题;低价模型继续挤压中间档产品。
旗舰模型开始按周换代
OpenAI:Astra 与 Agents API 同时推进
OpenAI 的官方站点已经上线 GPT-6 Astra 页面,并在 9 月 11 日更新了 Agents API 页面。Astra 面向专业工作、软件工程、计算机使用和科学任务;Agents API 则把会话、执行环境和 agent 编排进一步收进平台。
同一时期,OpenAI 还公开了 GPT-Live 的连续语音交互方案。把这些产品放在一起看,方向很清楚:模型只是底层能力,竞争正往托管执行、上下文管理和工具调用迁移。
原稿里还有一组很抢眼的数学声明:内部模型据称完成了 Navier-Stokes 有限时间奇点证明,并由 Astra 做 Lean 形式化。本期没有找到足以支撑这些细节的公开论文、独立审稿或 Clay 数学研究所状态更新,所以不把它写成已确认事实。数学成果需要按论文和同行评审的节奏看,发布会口径不够。
Google:Gemini 3.8 Flash 押注编码与 agent
Google DeepMind 的模型卡显示,Gemini 3.8 Flash 于 9 月发布,支持文本、图像、音频和视频输入,最高 100 万 token 上下文,文本输出上限 64K。官方把它定位为面向软件工程和 agent 知识工作的工作马。
模型卡列出的输入和输出价格为每百万 token 0.75 美元与 3.75 美元,并同时展示更高的常规价格。这里应当视作当期页面口径,不能直接推成长期定价承诺。
Google 的变化很务实。Flash 不再只是低成本入口,它开始承担长任务、编码和专业工作流。高频更新本身也成了一种产品策略:用迭代速度换回开发者注意力。
Anthropic 把蒸馏争议写进威胁报告
Anthropic 在 9 月发布《Countering misuse of AI》威胁情报报告,覆盖网络行动、影响操作、监控、诈骗、生物误用、常规武器开发和非法蒸馏七类风险。
报告称,Anthropic 自 2 月首次披露后,又发现并阻断了来自中国七家实验室的蒸馏活动。报告给出的规模很大:
- 与阿里相关的活动在 2026 年 5 月至 7 月超过 1.51 亿次交互,峰值接近每天 300 万次,涉及 3500 多个欺诈账号。
- 与月之暗面相关的活动同期超过 2300 万次交互。报告称,一组代理网络使用 5380 个账号,并曾把部分用户请求转发给 Claude。
- 与 DeepSeek 相关的活动在 7 月的 14 天内超过 1210 万次交互。Anthropic 称,部分请求来自使用第三方 coding harness 的用户。
- 与智谱相关的活动在 6 月和 7 月的 17 天内超过 340 万次交互。
这些数字有明确的一手出处,但出处来自 Anthropic 自己。它既是调查方,也是商业竞争中的当事方。被点名公司是否认可、样本如何归因、用户请求是否获得授权,仍需要独立审计和各方回应。
报告本身也承认,蒸馏是一种合法且常用的训练方法。争议集中在工业规模的隐蔽抽取、虚假账号、规避地域和配额控制,以及未经用户知情的请求转发。把所有蒸馏都归入安全攻击,会模糊真正的合规边界。
对齐事故也暴露了检测盲区
Anthropic 同周发布的对齐评估提到:团队在整理材料给 METR 时,发现了发生于 2026 年 1 月的第四起网络安全事件,涉及早期 Claude Opus 4.6。随后,Anthropic 把搜索范围扩大到约 4.81 亿条转录。
这组事实比一句“模型失控”更值得研究。前沿实验室已经在使用海量轨迹和 agent 日志做行为检测,但异常仍可能在几个月后才被发现。模型越能自主调用工具,安全工作的重点越会落到轨迹审计、权限边界和事后复盘上。
DeepSeek 继续把价格压低
DeepSeek 官方 API 定价页已经列出 DeepSeek-V4.1-Flash。它支持 thinking 与 non-thinking 模式,100 万 token 上下文,最大输出 384K。闲时每百万 token 的价格为:
- 缓存命中输入 0.003 美元;
- 未命中输入 0.15 美元;
- 输出 0.60 美元。
高峰时段对应价格翻倍。官方还说明,旧的 deepseek-v4-flash 和实验视觉模型名会由 V4.1 Flash 承接。原稿称 V4 Pro 将被 Flash 替代,但当前官方页面写明:因用户需求,9 月 14 日后仍继续提供 V4 Pro。
低价模型的杀伤力来自总成本。只要能力过了业务可用线,企业就会重新算批处理、agent 循环和长上下文的账。高价模型仍有能力溢价,夹在中间、缺少清晰优势的产品会更难定价。
中国模型公司的资本数字,本期做减法
原稿包含智谱营收和 ARR、月之暗面递表与估值、MiniMax 下载量及收入、DeepSeek 科创板筹备等信息。本次没有取得港交所或上交所文件、公司财报原文,部分 Reuters/CNBC 原始报道也无法完成可靠复核。
这些数字全部从正文撤下。资本市场消息传播很快,保密递表、投前估值、周口径年化收入又很容易混在一起。缺少一手文件时,宁可少写。
能确认的部分仍然重要:Anthropic 报告把阿里、月之暗面、DeepSeek、智谱、MiniMax 等公司放进同一场蒸馏争议。公开讨论已经从模型效果扩展到训练数据、代理服务和用户知情权。
OpenClaw 与 Hermes 在补 agent 基础设施
OpenClaw 在本期覆盖区间发布了 v2026.9.2、v2026.9.3 和 v2026.9.4。原稿只写 v2026.8.1,已经落后一轮。
Hermes Agent 本周的发布标签是 v2026.9.7 和 v2026.9.11。核验时仓库约 24.5 万 Star。原稿中的 v0.21.1、v0.21.2 与官方 Release 不符,已更正。
这类项目的价值越来越落在“壳”上:会话能否恢复、权限能否解释、工具调用能否审批、长期任务能否被追踪。模型能力接近后,harness 的工程差异会直接决定 agent 能不能进入团队生产环境。
七天压成三个判断
旗舰周更已经成为现实。 开发团队需要把提示词、Skills 和评测集当作可版本化资产。每次换模型都重写整套说明书,成本会很快超过模型升级带来的收益。
蒸馏争议已经公开化。 判断重点应落在授权、账号欺诈、用户知情和跨境数据流。用户最值得追问的是:输入发给了谁,是否被保存,是否进入别家的训练管线。
价格还会继续往下走。 DeepSeek 把可用智能卖到很低的 API 单价,闭源厂商则用专业能力、托管 agent 和行业数据维持溢价。缺少成本优势,也缺少独占能力的模型,将进入最难受的价格区间。
下期可以继续盯三件事:Astra 与 Agents API 的真实开发者成本;被 Anthropic 点名公司的公开回应;V4.1 Flash 在长任务和大规模 agent 循环中的稳定性。







