《财经》杂志于 2025 年 7 月至 8 月自费订阅国内外主流大模型 Token 套餐,使用开源智能体框架 OpenCode 重复运行同一任务,统计谷歌 24 个季度财报中的 10 项财务指标,直至耗尽一周 Token 额度,再根据周额度估算套餐实际可用的月额度,最终计算出 1 亿 Token 的均价。测试结果显示,若只看按量付费价格,中国大模型确实更便宜;但对比各家订阅套餐后结论逆转:国内平台的 Token 单价反而更贵。差异体现在三方面:其一是额度本身差距巨大,阿里云 499 元套餐运行 Qwen3.8-Max 周额度仅 115M Token,而 1360 元的 Codex 套餐运行 GPT-5.6 Sol 周额度达 2543M Token,前者单 Token 价格约为后者的 8 倍;Kimi 699 元套餐运行 K3 模型周额度也仅 169M。其二是缓存命中率,阿里云套餐命中率不到 90%,Codex 超过 95%,而未命中 Token 的额度消耗通常是命中的十几倍。其三是输出占比,阿里云为 2.4%,Codex 仅 0.2%,输出占比越高意味着额度消耗越快。综合对比,国内套餐的 Token 单价全部高于美国,仅 DeepSeek-V4-Flash 的按量付费价格保持最低水平。
事件分析
此项测试的价值在于揭示了订阅套餐定价背后的真实成本结构。缓存命中率与输出占比并非单纯的统计数字:未命中缓存意味着请求需重新处理全部上下文,消耗放大十几倍,直接反映厂商在 KV Cache 管理与推理调度上的工程能力差异;输出占比 2.4% 对 0.2%,则说明模型的输出冗余度显著影响额度寿命。对个人开发者而言,按量付费与套餐制出现价格倒挂,意味着国内厂商的订阅定价更多面向企业批量采购场景,尚未针对重度个人用户优化。Agentic Coding 场景下高频长上下文调用放大了这一差距。后续值得关注的变量包括:国内厂商是否会调整套餐额度设计、提升缓存效率,是否会催生针对 C 端开发者的新一轮定价竞争,以及第三方基准测试能否常态化,从而让实际成本透明化并倒逼定价策略优化。
核心观点:按量便宜、套餐反贵的价格倒挂,暴露国内大模型厂商在推理成本控制与个人开发者商业化上的双重短板。
原文链接:V2EX 分享发现