近日,一位开发者在GitHub上曝出一起涉及AWS Bedrock与OpenAI Codex集成的严重计费异常问题。该开发者在实际使用中发现,当通过AWS Bedrock调用OpenAI的Codex模型时,系统出现了显著的缓存机制失效故障,导致实际成本激增至正常水平的10倍左右。
根据该开发者提交的技术细节,问题的核心在于Codex在AWS Bedrock环境下的读写缓存比率极其不合理,实测数据甚至低于5%。通常情况下,为了优化性能和降低Token消耗,系统应利用缓存机制减少重复的昂贵写入操作。然而,在该故障场景中,系统执行了大量昂贵且未被利用的缓存写入操作,这些写入操作本应服务于后续的读取调用,但由于缓存未命中或机制失效,这些资源被完全浪费。
这一故障直接导致了用户在使用AI编程辅助功能时,面临远超预期的API调用费用。尽管目前官方尚未发布正式修复补丁,但有开发者提出了一种临时解决方案,即将配置中的“web_search”功能设置为“disabled”,该操作 reportedly 解决了异常计费问题。此次事件暴露了在云平台集成大模型应用时,底层基础设施配置对成本控制的重要性,提醒开发者在使用托管AI服务时需密切关注计费细节。
事件分析
在产业影响方面,随着大模型深入生产环节,API调用成本已成为企业关注的痛点。10倍的计费误差足以摧毁一个项目的单位经济模型。这不仅是单纯的技术Bug,更凸显了FinOps(云财务管理)在AI领域的缺失。传统的云监控工具往往难以准确识别LLM特有的Token流转逻辑,开发者需要更精细的粒度来监控输入输出比率。
对于后续走向,预计AWS需协同优化Bedrock的缓存元数据处理,确保Cache Hit Rate处于合理区间。同时,这警示行业在构建AI Agent或编程辅助工具时,必须在客户端或网关层实施更严格的预算熔断机制。
核心观点:托管AI服务的“隐形”配置漏洞引发十倍计费灾难,揭示了LLM落地中成本监控与底层缓存机制优化的紧迫性。
原文链接:Hacker News