一位开发者在OpenClaw框架下深度实测了多款主流大模型在Agent场景的表现。测试发现,MiniMax 2.5虽有人情味但执行力较弱,智谱GLM 5逻辑能力强但缺乏温度,而Kimi k2.5凭借均衡的能力成为目前国产模型中的最优解。相比之下,Opus 4.6展现出碾压级的意图理解能力,其对指令的精准捕捉被评价为“非同代际的产物”。
实战测评:从MiniMax到Opus 4.6,国产大模型在Agent场景下的真实表现
未经允许不得转载:80aj » 实战测评:从MiniMax到Opus 4.6,国产大模型在Agent场景下的真实表现







