Qwen团队即将发布下一代模型Qwen3-Next,采用创新的混合注意力架构和高达1:50的高稀疏MoE技术。首款模型Qwen3-Next-80B-A3B虽总参数800亿,但仅激活30亿,性能超越Qwen3-32B且训练成本不到十分之一。得益于多标记预测(MTP)等优化,其在长上下文场景下推理吞吐量提升超10倍。目前,Transformers、vLLM、SGLang等主流框架已完成代码合并支持。
Qwen3-Next新架构发布:混合注意力+超稀疏MoE,推理提速10倍
未经允许不得转载:80aj » Qwen3-Next新架构发布:混合注意力+超稀疏MoE,推理提速10倍







