一位开发者在AMD DevCloud平台的MI300X GPU Droplet上,对DeepSeek-V4-Flash-0731模型进行了系统性推理性能实测。部署基于GitHub开源仓库完成,测试使用llmperf基准工具,覆盖基线、长上下文、压力测试及384K超长上下文等七种场景。基线场景(并发2)下,首token延迟均值0.37秒,解码速度110.2 tok/s,错误率0%;并发提升至128时,吞吐达333.3 req/min,但单请求首token延迟升至7.36秒,解码速度降至13.7 tok/s。长上下文场景(输入约2000 token)prefill速度达2883 tok/s。最受关注的是384K超长上下文测试:单并发下首token延迟约42秒,prefill速度高达7576 tok/s,但10个目标请求仅完成2个;5并发版本测试未能正常结束。模型加载约耗时10分钟,作者认为192G显存运行该模型略显吃紧,若采用256G显存的MI325X,小团队使用将较为充裕,而192G运行1M上下文难度较大。全部已完成请求的错误率为0%,作者同时附上了GPU监控截图与完整测试结果文件供社区参考。
事件分析
本次测试的价值在于提供了AMD旗舰卡运行最新开源模型的公开一手数据,填补了ROCm生态推理基准信息的空白。从数据看,MI300X在低并发场景已接近实用水准,但高并发下解码速度明显衰减,且384K上下文测试出现请求大量未完成的情况,长上下文下的稳定性与显存余量仍存疑。对产业而言,大显存容量是AMD对抗英伟达的核心筹码,MI300X的192G已可承载头部开源模型的超长上下文推理,若MI325X等后继型号将容量提升至256G,其在长上下文推理市场的竞争力将进一步增强。后续值得关注的方向包括:更大显存卡型的同条件复测、1M上下文场景能否跑通,以及vLLM、SGLang等主流推理框架对Instinct系列优化的持续进展。
核心观点:显存容量正成为大模型推理的第一性资源,AMD以192G大卡切入,能否撼动英伟达取决于ROCm生态的成熟速度。
原文链接:Linux.do