近期一项针对 AI 编程 Agent 的对比实验显示,市面上宣称能大幅节省 Token 的插件在实际复杂开发任务中效果微乎其微,甚至可能增加成本。该实验通过将 Rust 的 eza 工具重写为 Python 并通过 52 项测试,对比了无插件环境与 Ponytail、RTK 两款 Token 节省插件的表现。数据显示,表现最好的插件仅节省了 8.87% 的成本,而另一款插件反而增加了 7.18% 的成本,且节省幅度被巨大的组内波动所抵消。深入分析发现,在 140 次运行的数据中,缓存输入占据了总 Token 消耗的 96.46%,而模型输出仅占 0.38%。这意味着,即便完美压缩 90% 的输出内容,对整体任务成本的影响也不到 1%。作者指出,针对局部 Token 压缩的宣传存在误导性,行业应更关注“每个成功完成任务的总成本”这一指标,并综合考虑重复运行的方差、轮次和耗时等因素。
事件分析
💡 核心观点:在以缓存为主的长上下文任务中,局部 Token 压缩无法撼动总体成本,Agent 效率评估应从“省词”转向“任务成功率”。
原文链接:V2EX 分享发现





