谷歌正式发布了代号为 Gemini 3.6 Flash 的新模型,此次迭代的核心目标在于显著提升针对 AI Agent 任务的处理效率并大幅降低运行成本。然而,根据 Artificial Analysis 发布的最新综合智能指数显示,该模型得分仅为 50 分,与前代 Gemini 3.5 Flash 持平,并列榜单第 11 位,遗憾跌出前十名,而榜单第十名的最低门槛为 51 分,这意味着谷歌目前没有任何模型进入第一梯队。
具体数据显示,Gemini 3.6 Flash 在工程优化层面表现亮眼:模型的平均任务处理时间从 2.7 分钟缩短至 1.3 分钟,实现了近 50% 的提速;单项任务成本由 0.59 美元降至 0.50 美元。在模拟真实知识工作者场景的 GDPval-AA v2 测试中,其 Elo 评分从 1349 分增长至 1421 分。尽管在速度和成本上取得了显著优势,但该模型在其它评测项目上并未获得同步提升,综合智能分停滞不前。这一结果表明,谷歌此次升级倾向于通过牺牲部分推理上限来换取更高的性价比与响应速度,导致其在综合竞争力上从领跑者滑落为追赶者。
事件分析
💡 核心观点:谷歌为追求极致性价比而牺牲了模型智力上限,导致其在当前白热化的模型竞争中跌出第一梯队。
原文链接:Linux.do





