OpenAI 推出 GPT-5.2 性能更新:推理栈优化,API 响应提速 40%
OpenAI 正式宣布针对 GPT-5.2 及 GPT-5.2-Codex 模型进行性能升级。通过深度优化底层推理栈,新版本在保持模型权重和架构完全不变的前提下,实现了 40% 的速度提升并显著降低了延迟。这一改进即刻对所有 API 开发者...
标签索引 / 第 2 页
这个标签下有 13 篇文章。按时间回看相关判断与实践记录。
标签精选
OpenAI 正式宣布针对 GPT-5.2 及 GPT-5.2-Codex 模型进行性能升级。通过深度优化底层推理栈,新版本在保持模型权重和架构完全不变的前提下,实现了 40% 的速度提升并显著降低了延迟。这一改进即刻对所有 API 开发者...
vLLM团队宣布完成向V1引擎的全面迁移,通过集成Wide-EP、双批次重叠(DBO)及专家并行负载均衡(EPLB)等优化,在H200集群上实现每GPU 2.2k tokens/s的吞吐量。这一显著性能提升解决了DeepSeek等稀疏MoE...
TL;DR 推理才是大模型的真正战场——训练一次,推理百万次。标准Attention的内存带宽成为瓶颈,Flash Attention通过Tiling技术让速度提升5倍;KV Cache让解码快10倍,但长上下文会吃掉几十GB显存;vLLM...