AI 数学评测基准 MathArena 近期发布研究,正式宣布传统的数学竞赛题已不再适合作为评估前沿大模型能力的有效基准。MathArena 曾于去年发布 Apex 和 Apex Shortlist 测试集,但随着技术的飞速发展,近期 GPT 5.5 已成功解决了 Apex 中的最后一道难题。鉴于该测试集发布已近一年,业界普遍怀疑存在数据污染风险,团队因此着手构建 Apex 第二代测试集。在筛选过程中,MathArena 选取了 176 道符合高难度标准的竞赛题,使用 Gemini 3.1 Pro 进行了严格测试。结果显示,Gemini 3.1 Pro 在四次尝试中全对 162 道题,其余 14 题也至少求解一次,没有任何一道题目能达到 Apex 最初的收录难度标准。MathArena 总结认为,对于侧重“最终答案”的竞赛题,前沿模型已表现出极高的通过率,这类题目已失去区分顶尖模型差异的能力。尽管竞赛题在追踪小型模型进展和评估学术新方法方面仍有价值,但针对前沿模型能力的基准测试必须转型。MathArena 建议未来的评估体系应侧重于证明评估、研究级数学以及正确性之外的性质,以更准确地衡量 AI 的推理深度。
事件分析
💡 核心观点:前沿模型让数学竞赛题彻底“退役”,AI 评估正从单一的答案正确率转向对推理过程、证明逻辑及研究级能力的深度考量。
原文链接:Linux.do





