近日,有开发者在技术社区分享了一项关于大模型API调用成本的实测观察,指出了在混合使用不同AI模型时存在的成本优化陷阱。该开发者发现,当试图通过Claude(Anthropic旗下模型)去调用OpenAI的Codex或相关接口时,系统提示上下文缓存利用率极低,导致每次请求几乎都要全额计费。相反,直接调用Codex或原生API接口时,缓存命中率则显著提升,大幅降低了使用成本,甚至出现了“几乎不收钱”的高效现象。
这一现象揭示了“上下文缓存”技术在复杂AI应用中的关键作用。在AI编程和智能体开发中,开发者经常需要让一个模型(如Claude)作为控制器去调用另一个模型(如OpenAI的代码生成模型)以完成特定任务。然而,这种跨模型的调用链路似乎破坏了API层面的缓存机制。上下文缓存原本是为了避免对重复的提示词进行重复计费,特别是在处理长文本或大型代码库时,能显著降低Token消耗。目前的观察表明,跨厂商或跨模型的“套壳”调用可能无法继承下游模型的原生缓存优势,导致中间层产生额外的Token损耗。这对于正在构建复合型AI Agent的开发者来说是一个重要的成本考量因素,提示在架构设计时需尽量减少不必要的跨模型转发,或寻找支持统一缓存标准的中间件方案。
事件分析
💡 核心观点:跨模型调用的缓存损耗揭示了AI生态的“隐性税”,统一上下文传输标准或将成为混合架构降本增效的下一个技术奇点。
原文链接:Linux.do





