边缘数据库公司 SQLite AI 近日宣布开源其名为 WASTE 的推理引擎,实现了在仅配备 64GB 内存的 MacBook Pro 上运行完整的 Kimi K3 大模型。Kimi K3 拥有 2.78 万亿参数,通常需要巨大的服务器级显存资源,而 WASTE 通过创新的架构设计打破了这一硬件限制。该引擎在未采用任何模型蒸馏或剪枝技术的情况下,保留了模型的全部层级和 8 万多个专家网络。其核心策略是将约 27GB 的模型主干数据驻留在系统内存中,将庞大的专家权重数据存储在内置 SSD 上。推理过程中,系统利用内存映射 I/O 技术,仅在生成每个 Token 时从 NVMe 硬盘读取当前激活调用的专家权重,从而实现对 1TB 转换后模型的高效调度。在量化方面,WASTE 将原本采用 MXFP4 的专家权重重新量化至 3-bit,并将模型主干压缩至 4-bit 和 8-bit。虽然受限于硬盘读取速度,其生成速度约为每秒 0.49 至 0.54 个 Token,但这一成果标志着在消费级硬件上本地运行超大规模 MoE 模型成为可能。
事件分析
💡 核心观点:消费级硬件运行万亿参数模型成为现实,WASTE 开启了“以存算显”的 AI 推理新范式。
原文链接:Linux.do





