跳到主要内容
赞助推荐 Claude Team 合租,少折腾账号
>80aj_
前沿哨所

AI基准测试现罗生门:GPT-5.4跑分在Kimi与DeepSeek报告中为何迥异?

1 分钟阅读阅读(64)
赞助推荐 团队协作里的 AI 办公工作台

社区发现,在Kimi K2.6和DeepSeek-v4的技术报告中,针对同一标杆模型GPT-5.4的Terminal Bench 2.0跑分存在显著差异,数值分别为65.4和75.1,而同期对比的Gemini和Claude分数在两份报告中却保持一致。这一反常现象引发了外界对测试环境、提示词设置是否统一的强烈质疑。在“模型军备竞赛”日益激烈的当下,这种数据“打架”不仅暴露了AI行业缺乏统一、严格的评测基准标准,更引发了业界关于“刷榜”和数据真实性的深度担忧。

原文链接:Linux.do

赞助推荐 一人公司 · 创业装备库
赞助推荐 一人公司 · 创业装备库
赞助推荐 一键部署 AI 大模型
赞助推荐 一键部署 AI 大模型
赞(0)
未经允许不得转载:80aj » AI基准测试现罗生门:GPT-5.4跑分在Kimi与DeepSeek报告中为何迥异?
赞助推荐 低成本上手 Claude Code 的中转选择
赞助推荐 低成本上手 Claude Code 的中转选择
赞助推荐 一键部署 AI 大模型
赞助推荐 一键部署 AI 大模型