近期一位开发者在排查 Codex 长任务执行故障时发现,开启 token_budget(token 预算)设置会导致严重的上下文丢失问题,建议暂时关闭该功能。此前开发者配置开启了 token_budget 并将阈值设为 30000 tokens,期望模型在达到预算时通过 new_context 功能进行上下文压缩以继续任务。然而实测数据显示,在 19 次 compact 操作中,有 9 次出现了模型直接“失忆”的现象,回复从具体的“下一步计划”突变为默认的“What would you like me to work on?”。检查记录发现,虽然新上下文保留了通用规则、环境信息和技能定义,但关键的当前任务、待办事项及检查点数据未能有效传递。开发者推测,这是因为 OpenAI 模型在训练阶段并未包含此类“即将压缩”的 steer prompt 场景,导致插入的压缩指令破坏了模型的连续性逻辑。鉴于该功能目前仍处于开发阶段,对于依赖长任务重度的用户,目前最稳妥的方案是将 enabled 设置为 false,以避免频繁的重复读文件和任务中断。
事件分析
此案例深刻揭示了当前基于大模型的 AI 编程助手在处理长上下文时的脆弱性。虽然 LLM 的上下文窗口日益扩大,但在实际工程应用中,如何无损地进行“滚动上下文”或“状态压缩”仍是未解难题。Token_budget 的失效本质上是通用大模型在面临“指令注入”与“推理连贯性”冲突时的表现:模型并未学会在系统强制切断并重置上下文时,精准地保留核心任务状态。这暴露了单纯依赖隐式上下文窗口的局限性,未来的 AI Agent 架构可能需要从单纯的 Prompt Engineering 转向更显式的“状态机”管理,即通过外挂数据库或结构化记忆来记录关键进度,而非寄希望于模型在压缩后的残缺上下文中还能“读懂”历史。
💡 核心观点:通用大模型在处理非训练分布内的系统级指令时存在盲区,AI Agent 的长周期稳定性需依赖显式的状态管理机制。
原文链接:Linux.do