开源推理框架llama.cpp发布重要更新,正式引入了对智谱GLM-5.2模型架构的完整支持,并专门针对该模型新增了NextN/MTP推测解码(Speculative Decoding)功能。此次更新要求llama.cpp版本在b10174以上,用户可通过启用 `–spec-type draft-mtp` 参数来激活加速模式。在技术实现层面,更新涉及对GLM-5.2特有的张量加载方式、混合注意力(MLA)KV缓存机制以及Sigmoid门控MoE架构的深度适配,特别是优化了NVFP4量化下的算子处理。推测解码技术通过利用轻量级模型提前预测Token,大幅减少了主模型昂贵的计算步骤。根据社区实测数据,在配备三张NVIDIA RTX 5090显卡的工作站上,运行约240GB权重的GLM-5.2 Q2量化版本时,解码阶段获得了15%至20%的显著性能提升。这一改进不仅有效降低了本地运行千亿参数级大模型的资源门槛,也标志着开源社区在混合专家(MoE)模型推理优化上的重要突破。
事件分析
💡 核心观点:llama.cpp对GLM-5.2的底层优化与推测解码支持,有效打破了本地大模型推理的性能瓶颈。
原文链接:Linux.do





