近日,有开发者社区用户发现,DeepSeek 官方发布的性能对比图表中,关于 Terminal-Bench 2.1 的关键数据与其他公开来源存在显著差异。根据该用户展示的截图,在 DeepSeek V4 Pro 的官方对比图中,Claude Fable 5 (w/ fallback) 模型的得分被标记为 88.0。然而,在另一份被称为“GPT-5.6”的介绍页成本—分数图中,Claude Fable 5 对应的分数却显示为约 83.8,而在该图表中标记为 88.0 分的实际上是 Claude Mythos 5 模型。针对这一明显的数值出入,发帖者推测 DeepSeek 可能使用了自有的一套测试 Harness(测试工具套件/框架),从而导致评测环境不一致。目前,该数值差异引发了社区关于不同厂商间评测数据是否能直接进行横向比较的讨论,特别是关于 DeepSeek 图中显示的高分具体对应何种模型运行配置,仍需官方进一步澄清。
事件分析
这一事件揭示了当前大模型评测领域普遍存在的“基准游戏”现象。不同厂商在构建对比图表时,往往会采用特定的测试配置、提示词版本或后处理机制,导致即便是在同一基准测试名称下,得出的分数也缺乏严格的可比性。Terminal-Bench 旨在评估 AI 的编程与工具调用能力,其分数对测试环境的依赖性极高,细微的配置差异(如是否允许 Fallback 重试机制、采用何种沙箱环境)都可能导致数分的波动。这种信息不对称容易误导开发者对模型实际效能的判断。从行业发展趋势来看,随着 AI 编程工具的普及,市场正迫切需要更加透明、标准化的第三方评测体系,或者由社区主导的可复现测试框架,以减少厂商“自选赛道”带来的数据噪音,推动评测标准向客观化、公正化发展。
核心观点:厂商自定评测标准致使基准分数失真,建立透明可复现的第三方评估体系迫在眉睫。
原文链接:Linux.do