开源项目 Maka-agent 近日发布了一份基于 Terminal-Bench 2.1 的性能对比报告,展示了在完全相同的底层模型“Kimi K3”下,不同 Agent 架构带来的显著性能差异。在与 Kimi 官方的 KimiCode CLI 对比中,Maka 实现了 69.7% 的任务通过率,领先 KimiCode 的 59.6%;在困难题目子集中,优势更是扩大至 20%。若剔除网络超时因素,仅分析按时完成的任务,Maka 的通过率达到 95.1%,远超 KimiCode 的 85.7%,逼近该基准测试的历史最高分。Maka 团队深入剖析了领先原因:首先是独特的“上下文预算剪枝”机制,在保持性能不降反升的前提下节省了约 187 万 Token;其次是采用精简的工具面与 System Prompt,避免了官方版本 20KB 产品级 Prompt 带来的噪音干扰;最后是严格基于“跑分-看 Trace-改进”的 A/B 测试迭代流程。该项目已将完整报告及代码开源,供社区验证。
事件分析
💡 核心观点:模型底座决定下限,Agent 架构决定上限,工程化与 Prompt 优化带来的性能红利已不亚于模型本身的代际提升。
原文链接:Linux.do





