云聚 AI Token Plan 满 199 减 35 元
port:80 AI Junkie
AI 重度玩家的工程笔记本

64GB MacBook 跑通 2.8万亿参数 Kimi K3:SQLite AI 开源 WASTE 推理引擎

云聚 AI Token Plan 满 199 减 35 元

边缘数据库公司 SQLite AI 近日宣布开源其名为 WASTE 的推理引擎,实现了在仅配备 64GB 内存的 MacBook Pro 上运行完整的 Kimi K3 大模型。Kimi K3 拥有 2.78 万亿参数,通常需要巨大的服务器级显存资源,而 WASTE 通过创新的架构设计打破了这一硬件限制。该引擎在未采用任何模型蒸馏或剪枝技术的情况下,保留了模型的全部层级和 8 万多个专家网络。其核心策略是将约 27GB 的模型主干数据驻留在系统内存中,将庞大的专家权重数据存储在内置 SSD 上。推理过程中,系统利用内存映射 I/O 技术,仅在生成每个 Token 时从 NVMe 硬盘读取当前激活调用的专家权重,从而实现对 1TB 转换后模型的高效调度。在量化方面,WASTE 将原本采用 MXFP4 的专家权重重新量化至 3-bit,并将模型主干压缩至 4-bit 和 8-bit。虽然受限于硬盘读取速度,其生成速度约为每秒 0.49 至 0.54 个 Token,但这一成果标志着在消费级硬件上本地运行超大规模 MoE 模型成为可能。

事件分析

WASTE 引擎的技术价值在于重新定义了突破 AI 内存墙的工程路径。随着大模型参数量呈现指数级增长,单纯依靠堆叠高带宽显存(HBM)的成本变得极其昂贵且不可持续,而高性能 NVMe SSD 的容量与带宽优势使其成为理想的算力扩展层级。WASTE 充分利用了混合专家(MoE)架构“稀疏激活”的特性,即在推理时仅调用极少部分专家,从而巧妙地将数据读取压力从系统总线转移至存储设备。这种“计算存储”范式虽然目前的生成速度较慢,但为在有限资源的边缘设备或个人电脑上部署千亿乃至万亿级模型提供了极具潜力的解决方案。未来,随着 PCIe 6.0 等高速接口的普及以及 SSD 读写性能的进一步提升,这种利用本地硬盘虚拟显存的技术有望显著缩小端侧模型与云端集群服务之间的性能差距。

💡 核心观点:消费级硬件运行万亿参数模型成为现实,WASTE 开启了“以存算显”的 AI 推理新范式。

阿里云 OPC 一人公司创业装备库

原文链接:Linux.do

阿里云函数计算 一键部署 AI 大模型
赞(0)
未经允许不得转载:80aj » 64GB MacBook 跑通 2.8万亿参数 Kimi K3:SQLite AI 开源 WASTE 推理引擎
赞助推荐 FreeModel.dev Claude Code 中转
阿里云函数计算 一键部署 AI 大模型