OpenClaw发布的最新基准测试榜单引发了AI圈热议。该榜单基于标准化Agent任务完成率,结果显示GPT-5.3-codex、Gemini-3-flash-preview和MiniMax-m2.1位列前三。排名中出现了诸多“意外”:此前备受期待的Opus-4.6仅排在第八位,无缘前五;而Kimi-k2.5则表现抢眼,排名超过了Sonnet-4.5。这一数据为评估大模型在实际落地场景中的能力提供了新的参考维度。
OpenClaw发布的最新基准测试榜单引发了AI圈热议。该榜单基于标准化Agent任务完成率,结果显示GPT-5.3-codex、Gemini-3-flash-preview和MiniMax-m2.1位列前三。排名中出现了诸多“意外”:此前备受期待的Opus-4.6仅排在第八位,无缘前五;而Kimi-k2.5则表现抢眼,排名超过了Sonnet-4.5。这一数据为评估大模型在实际落地场景中的能力提供了新的参考维度。