一位开发者在技术社区分享了使用华为昇腾910C四节点集群部署Kimi-K3大模型时遇到的严重故障。该集群配置包含4个节点,总计64张NPU卡(4TB HBM),运行Huawei Cloud EulerOS 2.0及配套的CANN 9.0.1软件栈。在严格按照官方教程使用vLLM-Ascend框架部署Kimi-K3-w4a8模型时,系统在profile_run阶段崩溃。报错信息显示NPU图编译器出现“unsorted double linked list corrupted”错误,且dmesg日志中频繁出现`devmm`内存释放竞态错误,提示`Va can’t free, is used by rts`。为了排查故障,开发者进行了对照实验,结果显示同环境下运行Qwen3-8B和Qwen3-30B-A3B(MoE架构)均能正常输出,排除了硬件故障和MoE架构通用兼容性问题。开发者因此怀疑该故障与Kimi-K3模型的特定体量或底层内存分配机制有关,目前尚无明确解决方案。
事件分析
💡 核心观点:国产AI算力软硬件协同仍存在特定场景下的“兼容性盲区”,底层驱动与编译器在处理复杂大模型时的稳定性是制约其大规模落地的关键短板。
原文链接:Linux.do





