开发者 Andrey Mikhaylov 在 GitHub 发布了开源项目 TurboFieldfare,这是一个专为 Apple Silicon 设计的高效推理引擎。该项目通过纯 Swift 和 Metal 构建的自定义运行时,成功在仅需约 2GB 内存的情况下运行 260 亿参数的 Gemma 4 26B-A4B 模型。其核心技术在于利用了稀疏混合专家架构的特性:仅在内存中保留约 1.35GB 的核心权重和 KV Cache,并根据推理需求实时从 SSD 流式传输所需的专家权重。这一创新机制使得即使是仅配备 8GB 统一内存的基础款 M2 MacBook Air 也能流畅运行该模型。该项目提供了完整的原生 macOS 应用、命令行工具及本地 OpenAI 兼容服务器,实测显示 M2 芯片解码速度为 5-6 tok/s,而 M5 Pro 可达 31-35 tok/s。TurboFieldfare 不仅是对内存昂贵的现状的工程回应,更展示了 MoE 模型在边缘设备上的巨大潜力。
事件分析
💡 核心观点:通过 SSD 流式传输 MoE 专家权重,该项目巧妙打破了内存墙,让消费级 Mac 具备运行超大参数模型的能力。
原文链接:Hacker News





