云聚 AI Token Plan 满 199 减 35 元
port:80 AI Junkie
AI 重度玩家的工程笔记本
DigitalOcean 开发者云

小米大模型服务引入精细化Credits计费规则,AI Agent长上下文成本分析引关注

云聚 AI Token Plan 满 199 减 35 元

近日,针对小米最新更新的Token Plan订阅服务,科技社区对其计费逻辑进行了深入解读,澄清了Credit与Token之间的实际换算关系。此前市场普遍认为的“1 Credit = 1 Token(普通版)”或“2 Credit = 1 Token(Pro版)”的简单线性换算已被新的复杂规则所取代。根据最新披露的官方文档,小米大模型(V2.5及V2.5-Pro)采用了三段式计费标准,将消耗场景细分为“命中缓存”、“未命中缓存”和“输出”三列。以MiLM V2.5普通版为例,其费率分别为每Token消耗2、100和200个Credits;而Pro版的费率则更高。基于这一新规则,用户对定价99元/月的Standard套餐(含110亿Credits)进行了实际效能测算。在模拟典型AI Agent任务场景(5000 Token输入命中缓存 + 1000 Token输出)时,该套餐约可执行5500轮任务;若输入未命中缓存,执行次数则降至约4400轮。这一数据揭示了一个核心事实:在小MiLM的计费体系中,是否命中缓存对成本控制有着近百倍的影响,直接决定了AI应用在实际运行中的边际成本高低。

事件分析

此次计费规则的调整并非简单的价格变动,而是反映了大模型服务商对推理成本结构精细化管理的趋势。采用三段式计费(缓存命中、未命中、输出)表明,高昂的GPU推理成本迫使厂商将技术优化压力传导给开发者。特别是高达200倍的输出与缓存输入差价,凸显了KV Cache(键值缓存)技术在长上下文场景下的经济价值。对于旨在构建AI Agent或RAG(检索增强生成)应用的开发者而言,单纯关注Token总数已不再适用,优化Prompt以命中缓存将成为控制成本的关键技术点。小米通过“Credits”这一中间层货币,不仅隔离了底层硬件波动对用户价格的直接冲击,也为未来灵活调整不同推理阶段的费率预留了空间。从行业角度看,这种基于“缓存/计算/输出”的分层计费模式,有望成为国内大模型API服务的行业标配。

💡 核心观点:小米通过引入差异化的Credits计费模型,验证了长上下文缓存技术在降低AI Agent边际成本中的核心价值。

阿里云 OPC 一人公司创业装备库

原文链接:Linux.do

阿里云函数计算 一键部署 AI 大模型
赞(0)
未经允许不得转载:80aj » 小米大模型服务引入精细化Credits计费规则,AI Agent长上下文成本分析引关注
赞助推荐 FoxCode Claude Code 稳定中转
阿里云函数计算 一键部署 AI 大模型

GLM Claude Code · 国产平替不封号

官方 Claude Code 又涨价又要 KYC,封号还得重配环境?智谱 GLM 兼容 Claude Code,稳定不封号、价格友好,注册后把现有 Claude Code 工作流直接切过来继续用。

立即体验 GLM查看套餐价格