一项名为 Deltafin 的开源实验项目展示了如何在 Apple Silicon Mac(特别是 M1 Max 64GB 版本)上运行 Moonshot AI 的 Kimi K3 模型。该模型拥有 2.8 万亿参数,采用了混合专家(MoE)架构,其总权重约为 1.56 TB,远超消费级硬件的内存和存储容量。Deltafin 通过利用 MoE 架构的特性——即每生成一个 Token 仅调用极小一部分专家——从而突破硬件限制。项目提供两种运行模式:一种是占用约 1.7 TB 空间的“完全模式”,将所有专家数据存储在本地;另一种是占用约 215 GB 的“流式模式”,按需从 Hugging Face CDN 加载专家数据并进行本地缓存。虽然受限于硬件带宽,生成速度较慢(在 M1 Max 上约为 16 秒/Token),但该项目通过 Fused MXFP4 内核、Metal 优化和 N-gram 推测解码等技术,实现了精确且可复现的推理结果。此外,Deltafin 还内置了兼容 OpenAI API 的服务器,允许现有的聊天界面和编码代理通过简单的配置更改直接调用本地运行的 K3 模型,这为在受限硬件环境下研究超大模型行为提供了新的可能性。
事件分析
💡 核心观点:通过流式加载与 MoE 架构的深度结合,该项目打破了算力垄断,证明了消费级设备运行万亿参数模型在工程上的可行性。
原文链接:Hacker News





