针对近期小米MIMO服务推出的新版Token计费策略,社区作者基于具体数据模型进行了深度量化分析,揭示了新旧套餐在不同使用场景下的实际价值差异。旧版Plan采用“输入/缓存/输出”一视同仁的计费方式,被批评为缺乏对缓存机制的考量,导致Token消耗过快。新版Plan则引入了分级计费机制,对缓存命中、未命中输入及输出设置了差异化的费率(v2.5模型分别为2/100/200 credits)。通过设定Agent对话、翻译批处理、生成密集等典型工作负载及极端边界条件进行测算,数据显示新Plan呈现出严重的两极分化。在Agent/对话场景中,得益于95%以上的缓存命中率,实际可用Token量提升了5至8倍,Pro档位提升甚至达到6倍以上;但在翻译、摘要等低命中率的批处理场景中,由于未命中输入和输出成本高昂,实际可用Token量仅为此前的30%至45%,出现了显著的“套餐缩水”。这一数据表明,小米的新定价策略旨在通过价格杠杆引导用户向高缓存复用的长上下文应用迁移,对于无状态或单轮调用的开发者而言,成本压力反而增大。
事件分析
💡 核心观点:新计费策略本质上是利用价格杠杆筛选高价值业务,利好Agent长上下文应用,但对低缓存场景构成了隐性涨价。
原文链接:Linux.do





