蚂蚁集团旗下百灵大模型团队于 8 月 8 日宣布正式开源新一代原生混合推理模型 Ling-3.0-flash。该模型采用 1240 亿(124B)总参数、51 亿(5.1B)激活参数的 MoE(混合专家)架构,旨在通过稀疏化激活策略,在保证模型智能水平的同时,大幅降低推理计算成本。官方同步开源了基础版本以及 FP8、FP4、INT4 等多个量化版本,以适应不同的硬件环境。针对开发者与企业用户的差异化需求,官方提供了三种落地部署方案:面向快速迭代的云端 API 调用,平均输出速度达 353 tokens/s;面向数据隐私安全的单机私有化部署,在单台 NVIDIA DGX Spark 上即可完成端到端推理;以及面向高并发、低延迟场景的高性能部署,在指定 GPU 配置下平均输出速率突破 1100 tokens/s。根据 AA Intelligence Index 的数据,Ling-3.0-flash 在保持高智能水平的同时,加权平均调用成本约为 0.04 美元,解码时间约 1.4 分钟,成功进入“智能水平—任务成本”与“智能水平—任务耗时”的双重优势区域。目前该模型已在 Hugging Face 和 ModelScope 平台上线,且在 8 月 31 日前 API 调用享有 2.5 折优惠。
事件分析
💡 核心观点:蚂蚁通过开源高性能 MoE 模型,试图在推理成本与响应速度的平衡点上建立行业新标杆,加速 AI Agent 应用落地。
原文链接:Linux.do





