Kog AI 正式发布 Kog 推理引擎(KIE)技术预览,通过软件与硬件的深度协同设计,成功在标准数据中心 GPU 上实现了惊人的推理速度。在 8 张 AMD MI300X 显卡配置下,该引擎达到了每请求 3000 个 Token 的输出速度;在 8 张 NVIDIA H200 上也达到了 2100 Token/s。此次测试基于 20 亿参数的 2B 模型,且未使用量化、投机解码或剪枝等常见优化手段,纯粹通过底层软件工程挖掘硬件极限。Kog 指出,现有推理栈(如 PyTorch、Triton)在处理单请求低批次推理时,内核启动、CPU 调度和 GPU 同步等微秒级开销严重浪费了显存带宽。为此,Kog 采用了“单核”运行时和手写的 GPU 汇编代码,将采样逻辑完全移至 GPU 内部,消除了内核边界,并开发了针对硬件拓扑优化的 KCCL 通信库。这种对延迟的极致优化对 AI Agent 尤为关键,因为自主智能体的工作流(检查、规划、编码、测试)高度依赖顺序生成速度,每秒 3000 Token 的速度意味着原本需要数分钟的生成任务可压缩至几十秒内完成。Kog 预计,随着显存带宽的增长和引擎的成熟,该技术将支持大型第三方 MoE 模型(如 DeepSeek、Kimi)在标准硬件上达到 1000-5000 Token/s 的速度,从而打破专用推理芯片的速度垄断。
事件分析
💡 核心观点:推理速度的瓶颈在于软件栈而非硬件本身,通过底层深度优化挖掘标准 GPU 的显存带宽极限,将成为 AI Agent 实现实时响应的关键路径。
原文链接:Hacker News





