近日,有开发者在技术社区反馈,在调用 OpenAI 下一代模型 GPT-5.5 时遇到了严重的静默截断问题。当设置推理强度为 xhigh(极高)档位并开启流式传输时,服务端虽然返回 HTTP 200 状态码且正常关闭连接,没有任何报错信息,但输出内容仅约 5 个 Token。整个请求在 1 秒内结束,导致客户端看似正常实则收到空响应。数据显示,该问题在 GPT-5.5 配合 xhigh 推理档位时的发生率约为 6%,且仅限该特定组合,而 GPT-5.4 在同等条件下运行 300 次均未复现。此外,该问题还存在偶发的“长挂起”变体,首 Token 延迟高达 10 至 14 分钟。经排查,已排除客户端超时、网关层限制、账号额度、Rate Limit 及输入长度过长等因素,推测这可能与上游服务端针对高算力推理模型的某种未公开超时保护机制有关。该现象对依赖流式 Token 推进状态的 Agent 类应用(如 OpenClaw)影响极大,极易导致任务流程非正常中断或卡死。
事件分析
💡 核心观点:高阶推理模型的静默截断暴露了算力成本与工程稳定性之间的矛盾,是阻碍 AI Agent 大规模落地的隐形陷阱。
原文链接:Linux.do





