5月27日,小米旗下大模型分发平台Mimo宣布针对MiMo-V2.5系列API进行重大更新,永久性降低服务价格并优化计费体系。相比原始API定价,新定价最高降幅达99%,且不再区分输入长度。此次调整的核心动力源自技术层面的突破,官方表示基于SGLang HiCache技术完整支持SWA(滑动窗口注意力)机制,成功将KV Cache在GPU显存、CPU内存及SSD等多级存储间的数据搬运量降低至优化前的近1/7,可缓存Token数量提升至近5倍。同时,通过优化专家并行方案和输入长度分桶策略,集群输入吞吐能力显著提升。在新的Token Plan计费体系下,费用改为Credits模式,区分输入缓存命中情况。官方估算在95%的缓存命中率下,用户实际获得的Token用量将提升至原来的5至8倍。新套餐价格从每月39元至659元不等,对应的API额度均高于实际支付金额,这意味着大模型推理服务的边际成本正在因工程化优化而急剧下降。
事件分析
💡 核心观点:大模型API价格战已从营销补贴转向技术降本,底层推理框架的工程优化成为控制核心成本的关键竞争力。
原文链接:Linux.do





