本文详细记录了在AMD MI300X加速器上部署DeepSeek-V4-Flash模型的全过程。尽管MI300X在硬件规格上拥有192GB HBM3显存和具有竞争力的FP8算力,且价格仅为NVIDIA H100的一半,但长期以来其软件生态的缺失限制了应用。作者团队在vLLM框架下解决了多重技术难题:首先是FP8数据格式不兼容问题,MI300X采用的旧版fnuz标准与主流OCP标准存在偏差,导致计算数值偏差两倍;其次是AMD核心库AITER对DeepSeek V4特有的稀疏注意力机制和CDNA3架构支持不足,团队通过重写内核和回退机制解决了核心计算路径的缺失;此外还针对HIP图记录和MoE路由中的动态张量分配问题进行了深度优化。最终结果显示,经过修补后的MI300X不仅运行稳定,且在显存容量和现货供应上具备显著优势,证明了AMD硬件在克服软件壁垒后的高性价比潜力。
事件分析
💡 核心观点:AI编程浪潮降低了底层适配成本,正助力AMD凭借硬件性价比逐步瓦解Nvidia的生态护城河。
原文链接:Hacker News





