开发者警惕:AWS Bedrock 集成 OpenAI Codex 引发成本激增 10 倍

近日,一位开发者在GitHub上曝出一起涉及AWS Bedrock与OpenAI Codex集成的严重计费异常问题。该开发者在实际使用中发现,当通过AWS Bedrock调用OpenAI的Codex模型时,系统出现了显著的缓存机制失效故障,导致实际成本激增至正常水平的10倍左右。

根据该开发者提交的技术细节,问题的核心在于Codex在AWS Bedrock环境下的读写缓存比率极其不合理,实测数据甚至低于5%。通常情况下,为了优化性能和降低Token消耗,系统应利用缓存机制减少重复的昂贵写入操作。然而,在该故障场景中,系统执行了大量昂贵且未被利用的缓存写入操作,这些写入操作本应服务于后续的读取调用,但由于缓存未命中或机制失效,这些资源被完全浪费。

这一故障直接导致了用户在使用AI编程辅助功能时,面临远超预期的API调用费用。尽管目前官方尚未发布正式修复补丁,但有开发者提出了一种临时解决方案,即将配置中的“web_search”功能设置为“disabled”,该操作 reportedly 解决了异常计费问题。此次事件暴露了在云平台集成大模型应用时,底层基础设施配置对成本控制的重要性,提醒开发者在使用托管AI服务时需密切关注计费细节。

事件分析

技术架构层面看,此次事件反映了AI应用在云原生环境落地时的“黑盒”复杂性。AWS Bedrock作为全托管服务,虽然屏蔽了底层模型部署的繁琐,但也引入了新的中间层变量。Codex这类代码生成模型通常具有高度的上下文依赖性,其Token消耗对缓存策略极为敏感。此次读写缓存倒挂的现象,暗示了Bedrock在适配OpenAI模型接口时,可能存在提示词预处理或缓存键生成的逻辑缺陷。

在产业影响方面,随着大模型深入生产环节,API调用成本已成为企业关注的痛点。10倍的计费误差足以摧毁一个项目的单位经济模型。这不仅是单纯的技术Bug,更凸显了FinOps(云财务管理)在AI领域的缺失。传统的云监控工具往往难以准确识别LLM特有的Token流转逻辑,开发者需要更精细的粒度来监控输入输出比率。

对于后续走向,预计AWS需协同优化Bedrock的缓存元数据处理,确保Cache Hit Rate处于合理区间。同时,这警示行业在构建AI Agent或编程辅助工具时,必须在客户端或网关层实施更严格的预算熔断机制。

核心观点:托管AI服务的“隐形”配置漏洞引发十倍计费灾难,揭示了LLM落地中成本监控与底层缓存机制优化的紧迫性。

原文链接:Hacker News

C code80.ai · AI 编码 API 聚合 Claude / GPT 多模型统一接入,稳定不限速,按量计费,几行配置接入 Claude Code。 了解一下 ›

抢沙发

评论前必须登录!

立即登录   注册