云聚 AI Token Plan 满 199 减 35 元
port:80 AI Junkie
AI 重度玩家的工程笔记本

蚂蚁集团开源 Ling-3.0-flash:124B 参数 MoE 架构,推理速度突破 1100 tokens/s

云聚 AI Token Plan 满 199 减 35 元

蚂蚁集团旗下百灵大模型团队于 8 月 8 日宣布正式开源新一代原生混合推理模型 Ling-3.0-flash。该模型采用 1240 亿(124B)总参数、51 亿(5.1B)激活参数的 MoE(混合专家)架构,旨在通过稀疏化激活策略,在保证模型智能水平的同时,大幅降低推理计算成本。官方同步开源了基础版本以及 FP8、FP4、INT4 等多个量化版本,以适应不同的硬件环境。针对开发者与企业用户的差异化需求,官方提供了三种落地部署方案:面向快速迭代的云端 API 调用,平均输出速度达 353 tokens/s;面向数据隐私安全的单机私有化部署,在单台 NVIDIA DGX Spark 上即可完成端到端推理;以及面向高并发、低延迟场景的高性能部署,在指定 GPU 配置下平均输出速率突破 1100 tokens/s。根据 AA Intelligence Index 的数据,Ling-3.0-flash 在保持高智能水平的同时,加权平均调用成本约为 0.04 美元,解码时间约 1.4 分钟,成功进入“智能水平—任务成本”与“智能水平—任务耗时”的双重优势区域。目前该模型已在 Hugging Face 和 ModelScope 平台上线,且在 8 月 31 日前 API 调用享有 2.5 折优惠。

事件分析

Ling-3.0-flash 的开源标志着头部大厂在 MoE(混合专家)架构领域的工程化实践日益成熟。该模型的核心竞争力在于通过 124B 总参数配合仅 5.1B 激活参数的设计,显著降低了推理显存占用和算力开销,这对推动大模型在端侧及私有化场景的落地具有实质性意义。特别是针对单机推理和高吞吐量(1100 tokens/s)的优化,直接回应了当前 Agent(智能体)应用对实时交互的强需求,有望加速 AI 在金融、客服等对延迟敏感行业的渗透。此外,提供多种量化版本(INT4/FP4)并明确支持 NVIDIA DGX 硬件,显示了蚂蚁集团在构建软硬件协同生态上的野心,试图通过低成本、高性能的开源权重争夺开发者生态。

💡 核心观点:蚂蚁通过开源高性能 MoE 模型,试图在推理成本与响应速度的平衡点上建立行业新标杆,加速 AI Agent 应用落地。

阿里云 OPC 一人公司创业装备库

原文链接:Linux.do

阿里云函数计算 一键部署 AI 大模型
赞(0)
未经允许不得转载:80aj » 蚂蚁集团开源 Ling-3.0-flash:124B 参数 MoE 架构,推理速度突破 1100 tokens/s
赞助推荐 FreeModel.dev Claude Code 中转
阿里云函数计算 一键部署 AI 大模型