云聚 AI Token Plan 满 199 减 35 元
port:80 AI Junkie
AI 重度玩家的工程笔记本
DigitalOcean 开发者云

小米Mimo大模型API最高降价99%,利用SGLang技术实现成本突破

云聚 AI Token Plan 满 199 减 35 元

5月27日,小米旗下大模型分发平台Mimo宣布针对MiMo-V2.5系列API进行重大更新,永久性降低服务价格并优化计费体系。相比原始API定价,新定价最高降幅达99%,且不再区分输入长度。此次调整的核心动力源自技术层面的突破,官方表示基于SGLang HiCache技术完整支持SWA(滑动窗口注意力)机制,成功将KV Cache在GPU显存、CPU内存及SSD等多级存储间的数据搬运量降低至优化前的近1/7,可缓存Token数量提升至近5倍。同时,通过优化专家并行方案和输入长度分桶策略,集群输入吞吐能力显著提升。在新的Token Plan计费体系下,费用改为Credits模式,区分输入缓存命中情况。官方估算在95%的缓存命中率下,用户实际获得的Token用量将提升至原来的5至8倍。新套餐价格从每月39元至659元不等,对应的API额度均高于实际支付金额,这意味着大模型推理服务的边际成本正在因工程化优化而急剧下降。

事件分析

此次小米Mimo的大幅降价并非简单的市场营销行为,而是底层推理框架工程化优化的直接结果。通过引入SGLang HiCache并优化KV Cache的多级存储调度,小米有效解决了大模型推理中显存带宽和吞吐量的瓶颈。这表明当前大模型API市场的竞争已进入深水区,单纯依靠算力堆叠的竞争模式正在向追求极致推理效率的技术竞争转变。SWA技术的应用和多级存储策略的落地,意味着在不增加硬件投入的前提下,通过软件层面的架构创新同样能带来数量级的成本优势。这种技术驱动的成本下降,将加速大模型技术在各类应用场景中的普及,并可能迫使其他云服务商跟进类似的底层技术优化,从而推动整个行业的基础设施价格进入下行通道。

💡 核心观点:大模型API价格战已从营销补贴转向技术降本,底层推理框架的工程优化成为控制核心成本的关键竞争力。

阿里云 OPC 一人公司创业装备库

原文链接:Linux.do

阿里云函数计算 一键部署 AI 大模型
赞(0)
未经允许不得转载:80aj » 小米Mimo大模型API最高降价99%,利用SGLang技术实现成本突破
赞助推荐 FoxCode Claude Code 稳定中转
阿里云函数计算 一键部署 AI 大模型

GLM Claude Code · 国产平替不封号

官方 Claude Code 又涨价又要 KYC,封号还得重配环境?智谱 GLM 兼容 Claude Code,稳定不封号、价格友好,注册后把现有 Claude Code 工作流直接切过来继续用。

立即体验 GLM查看套餐价格