云聚 AI Token Plan 满 199 减 35 元
port:80 AI Junkie
AI 重度玩家的工程笔记本

Swift + Metal 黑科技:开源项目 TurboFieldfare 让 26B 大模型跑进 2GB 内存

云聚 AI Token Plan 满 199 减 35 元

开发者 Andrey Mikhaylov 在 GitHub 发布了开源项目 TurboFieldfare,这是一个专为 Apple Silicon 设计的高效推理引擎。该项目通过纯 Swift 和 Metal 构建的自定义运行时,成功在仅需约 2GB 内存的情况下运行 260 亿参数的 Gemma 4 26B-A4B 模型。其核心技术在于利用了稀疏混合专家架构的特性:仅在内存中保留约 1.35GB 的核心权重和 KV Cache,并根据推理需求实时从 SSD 流式传输所需的专家权重。这一创新机制使得即使是仅配备 8GB 统一内存的基础款 M2 MacBook Air 也能流畅运行该模型。该项目提供了完整的原生 macOS 应用、命令行工具及本地 OpenAI 兼容服务器,实测显示 M2 芯片解码速度为 5-6 tok/s,而 M5 Pro 可达 31-35 tok/s。TurboFieldfare 不仅是对内存昂贵的现状的工程回应,更展示了 MoE 模型在边缘设备上的巨大潜力。

事件分析

此项目展示了针对特定架构进行底层优化的巨大优势。不同于 llama.cpp 或 MLX 等通用框架,TurboFieldfare 针对 Gemma 4 的 MoE 结构量身定制了 I/O 和计算管线。通过主动从 SSD 预取活跃专家并计算共享分支,它巧妙地将“内存墙”转化为“存储墙”,利用现代 SSD 的高吞吐量弥补了统一内存容量的不足。这证明了在消费级硬件上运行大模型并不单纯依赖硬件堆料,软件架构层面的“流式计算”能极大扩展硬件的算力边界。这对于推动高性能 AI 在资源受限设备上的普及具有重要意义,也为移动端大模型部署提供了新的设计思路。

💡 核心观点:通过 SSD 流式传输 MoE 专家权重,该项目巧妙打破了内存墙,让消费级 Mac 具备运行超大参数模型的能力。

阿里云 OPC 一人公司创业装备库

原文链接:Hacker News

阿里云函数计算 一键部署 AI 大模型
赞(0)
未经允许不得转载:80aj » Swift + Metal 黑科技:开源项目 TurboFieldfare 让 26B 大模型跑进 2GB 内存
赞助推荐 FreeModel.dev Claude Code 中转
阿里云函数计算 一键部署 AI 大模型