近日,有开发者在技术社区实测了阿里的一款名为“marco-mini-instruct”的大模型。该模型总参数量达17.3B,但激活参数仅为0.86B,显露出混合专家(MoE)架构的特征。令人惊讶的是,在完全不使用GPU、仅依靠纯CPU的环境下,该模型达到了47 token/s的推理速度。这种速度在本地CPU运行大模型领域相当亮眼,表明了优化的巨大潜力。不过,测试者也发现该模型在某些具体任务(如天气卡片生成、精准翻译)上表现不佳,功能尚存局限。这一实测为关注本地化大模型部署的用户提供了有价值的参考。
实测阿里大模型纯CPU推理:17.3B参数跑出47 token/s,MoE架构潜力显现
未经允许不得转载:80aj » 实测阿里大模型纯CPU推理:17.3B参数跑出47 token/s,MoE架构潜力显现
相关推荐
无需联网也能翻译?独立开发者推出“秒译”App,探索端侧AI隐私新边界
Chrome浏览器AI功能被指“偷吃”4GB存储,教你如何找回空间
挑战云端隐私痛点:开发者推出 iPhone 全离线 AI 实时翻译 App NonetPlay
小参数大能耐:ZAYA1-8B数学能力匹敌DeepSeek-R1,AMD入局引发热议
GitHub开源新星:香港大学团队推出超轻量级个人AI智能体Nanobot
DeepSeek V4 Pro 真假难辨?社区热议如何鉴别“满血版”与精简版
谷歌 Chrome 被曝在用户不知情下静默安装 4GB 本地 AI 模型
440MB模型吊打谷歌?Hy-MT极致量化实测惊艳,展现端侧AI新潜力