跳到主要内容
赞助推荐 Claude Team 合租,少折腾账号
AI 大模型

大模型周报第44周:旗舰周更、蒸馏开战、价格再下探

10 分钟阅读阅读(6)
赞助推荐 团队协作里的 AI 办公工作台

大模型一周三条战线:旗舰周更、蒸馏开战、价格再下探 日报图文

大模型周刊第 44 期,覆盖 2026 年 9 月 5 日至 11 日。系列编号沿用“第 44 周”,日期以本期覆盖区间为准。

七天里,OpenAI、Google 和 DeepSeek 都有产品动作。Anthropic 又发布了一份份量很重的威胁情报报告,把长期存在的模型蒸馏争议直接摆到台面上。

赞助推荐 一人公司 · 创业装备库
赞助推荐 一人公司 · 创业装备库

真正影响开发者的,也许还不是某一张新榜单。模型换得越来越快,提示词、Skills、评测集和预算却需要反复重做。这周值得记住三条线:旗舰更新已经按周计算;“智能从哪里来”开始成为合规问题;低价模型继续挤压中间档产品。

旗舰模型开始按周换代

OpenAI:Astra 与 Agents API 同时推进

OpenAI 的官方站点已经上线 GPT-6 Astra 页面,并在 9 月 11 日更新了 Agents API 页面。Astra 面向专业工作、软件工程、计算机使用和科学任务;Agents API 则把会话、执行环境和 agent 编排进一步收进平台。

同一时期,OpenAI 还公开了 GPT-Live 的连续语音交互方案。把这些产品放在一起看,方向很清楚:模型只是底层能力,竞争正往托管执行、上下文管理和工具调用迁移。

原稿里还有一组很抢眼的数学声明:内部模型据称完成了 Navier-Stokes 有限时间奇点证明,并由 Astra 做 Lean 形式化。本期没有找到足以支撑这些细节的公开论文、独立审稿或 Clay 数学研究所状态更新,所以不把它写成已确认事实。数学成果需要按论文和同行评审的节奏看,发布会口径不够。

Google:Gemini 3.8 Flash 押注编码与 agent

Google DeepMind 的模型卡显示,Gemini 3.8 Flash 于 9 月发布,支持文本、图像、音频和视频输入,最高 100 万 token 上下文,文本输出上限 64K。官方把它定位为面向软件工程和 agent 知识工作的工作马。

模型卡列出的输入和输出价格为每百万 token 0.75 美元与 3.75 美元,并同时展示更高的常规价格。这里应当视作当期页面口径,不能直接推成长期定价承诺。

Google 的变化很务实。Flash 不再只是低成本入口,它开始承担长任务、编码和专业工作流。高频更新本身也成了一种产品策略:用迭代速度换回开发者注意力。

Anthropic 把蒸馏争议写进威胁报告

Anthropic 在 9 月发布《Countering misuse of AI》威胁情报报告,覆盖网络行动、影响操作、监控、诈骗、生物误用、常规武器开发和非法蒸馏七类风险。

报告称,Anthropic 自 2 月首次披露后,又发现并阻断了来自中国七家实验室的蒸馏活动。报告给出的规模很大:

  • 与阿里相关的活动在 2026 年 5 月至 7 月超过 1.51 亿次交互,峰值接近每天 300 万次,涉及 3500 多个欺诈账号。
  • 与月之暗面相关的活动同期超过 2300 万次交互。报告称,一组代理网络使用 5380 个账号,并曾把部分用户请求转发给 Claude。
  • 与 DeepSeek 相关的活动在 7 月的 14 天内超过 1210 万次交互。Anthropic 称,部分请求来自使用第三方 coding harness 的用户。
  • 与智谱相关的活动在 6 月和 7 月的 17 天内超过 340 万次交互。

这些数字有明确的一手出处,但出处来自 Anthropic 自己。它既是调查方,也是商业竞争中的当事方。被点名公司是否认可、样本如何归因、用户请求是否获得授权,仍需要独立审计和各方回应。

报告本身也承认,蒸馏是一种合法且常用的训练方法。争议集中在工业规模的隐蔽抽取、虚假账号、规避地域和配额控制,以及未经用户知情的请求转发。把所有蒸馏都归入安全攻击,会模糊真正的合规边界。

对齐事故也暴露了检测盲区

Anthropic 同周发布的对齐评估提到:团队在整理材料给 METR 时,发现了发生于 2026 年 1 月的第四起网络安全事件,涉及早期 Claude Opus 4.6。随后,Anthropic 把搜索范围扩大到约 4.81 亿条转录。

这组事实比一句“模型失控”更值得研究。前沿实验室已经在使用海量轨迹和 agent 日志做行为检测,但异常仍可能在几个月后才被发现。模型越能自主调用工具,安全工作的重点越会落到轨迹审计、权限边界和事后复盘上。

DeepSeek 继续把价格压低

DeepSeek 官方 API 定价页已经列出 DeepSeek-V4.1-Flash。它支持 thinking 与 non-thinking 模式,100 万 token 上下文,最大输出 384K。闲时每百万 token 的价格为:

  • 缓存命中输入 0.003 美元;
  • 未命中输入 0.15 美元;
  • 输出 0.60 美元。

高峰时段对应价格翻倍。官方还说明,旧的 deepseek-v4-flash 和实验视觉模型名会由 V4.1 Flash 承接。原稿称 V4 Pro 将被 Flash 替代,但当前官方页面写明:因用户需求,9 月 14 日后仍继续提供 V4 Pro。

低价模型的杀伤力来自总成本。只要能力过了业务可用线,企业就会重新算批处理、agent 循环和长上下文的账。高价模型仍有能力溢价,夹在中间、缺少清晰优势的产品会更难定价。

中国模型公司的资本数字,本期做减法

原稿包含智谱营收和 ARR、月之暗面递表与估值、MiniMax 下载量及收入、DeepSeek 科创板筹备等信息。本次没有取得港交所或上交所文件、公司财报原文,部分 Reuters/CNBC 原始报道也无法完成可靠复核。

这些数字全部从正文撤下。资本市场消息传播很快,保密递表、投前估值、周口径年化收入又很容易混在一起。缺少一手文件时,宁可少写。

能确认的部分仍然重要:Anthropic 报告把阿里、月之暗面、DeepSeek、智谱、MiniMax 等公司放进同一场蒸馏争议。公开讨论已经从模型效果扩展到训练数据、代理服务和用户知情权。

OpenClaw 与 Hermes 在补 agent 基础设施

OpenClaw 在本期覆盖区间发布了 v2026.9.2、v2026.9.3 和 v2026.9.4。原稿只写 v2026.8.1,已经落后一轮。

Hermes Agent 本周的发布标签是 v2026.9.7 和 v2026.9.11。核验时仓库约 24.5 万 Star。原稿中的 v0.21.1、v0.21.2 与官方 Release 不符,已更正。

这类项目的价值越来越落在“壳”上:会话能否恢复、权限能否解释、工具调用能否审批、长期任务能否被追踪。模型能力接近后,harness 的工程差异会直接决定 agent 能不能进入团队生产环境。

七天压成三个判断

旗舰周更已经成为现实。 开发团队需要把提示词、Skills 和评测集当作可版本化资产。每次换模型都重写整套说明书,成本会很快超过模型升级带来的收益。

蒸馏争议已经公开化。 判断重点应落在授权、账号欺诈、用户知情和跨境数据流。用户最值得追问的是:输入发给了谁,是否被保存,是否进入别家的训练管线。

价格还会继续往下走。 DeepSeek 把可用智能卖到很低的 API 单价,闭源厂商则用专业能力、托管 agent 和行业数据维持溢价。缺少成本优势,也缺少独占能力的模型,将进入最难受的价格区间。

下期可以继续盯三件事:Astra 与 Agents API 的真实开发者成本;被 Anthropic 点名公司的公开回应;V4.1 Flash 在长任务和大规模 agent 循环中的稳定性。

主要来源

赞助推荐 一键部署 AI 大模型
赞助推荐 一键部署 AI 大模型
赞(0)
未经允许不得转载:80aj » 大模型周报第44周:旗舰周更、蒸馏开战、价格再下探
赞助推荐 低成本上手 Claude Code 的中转选择
赞助推荐 低成本上手 Claude Code 的中转选择
赞助推荐 一键部署 AI 大模型
赞助推荐 一键部署 AI 大模型