TurboFieldfare:把 26B 模型塞进 8GB Mac 内存的真正解法不是量化,是 SSD 流
分类:ai-products · AI coding 边缘化 时间:2026-07-29 Show HN 信源:GitHub drumih/turbo-fieldfare 仓库(Apache-2.0)、HN 讨论、devaitoolkit/explainx 实测
数字先把话说满
| 项目 | 数值 |
|---|---|
| 模型 | Gemma 4 26B-A4B IT(26B 总参,每 token 激活约 3.88B) |
| 进程占用 RSS | 约 2 GB |
| 磁盘占用 | 约 14.3 GB(MLX affine 4-bit) |
| M2 8GB MacBook Air | 5.1–6.3 tok/s decode |
| M5 Pro 24GB | 31–35 tok/s decode |
| HN 热度 | 671 点,234 评论(7-29 当日 Show HN 第一) |
核心想法
不是把 26B 模型量化到 2GB(做不到),也不是 mmap 整个 GGUF 文件(页面错误太多)。TurboFieldfare 把 MoE 的”共享主干”和”被路由选中的专家”分开处理:
– 共享主干 1.35 GB + FP16 KV cache 常驻内存。
– 每个 token 路由出来的若干专家(约 16 个 slot 的 LFU cache)从 SSD 用 pread 显式预读进 Metal 可见的 buffer。
– GPU 在跑共享分支的同时,CPU I/O 在后台把下一批专家塞进 buffer。
– 完全用 Swift 6.2 + Metal 4 写,没有用 MLX 也没有用 llama.cpp。
为什么这条工程路线重要
1. 它是模型特定的,不是”通用推理引擎”。作者明确说不打算支持别的模型,整个 runtime 锁死 Gemma 4 26B-A4B 一种。这跟 llama.cpp / MLX 那种”什么模型都跑”的策略是反着来的。代价是只能支持一个模型,收益是每一种优化都是手工针对这个模型调出来的——Hugging Face pin 的 revision、流式下载、Metal kernel 全部按 Gemma 的层结构写。
2. M1 / M2 入门机型真的能跑。8GB 内存的 MacBook Air 是 2026 H2 全球销量最大的 Mac 机型。TurboFieldfare 让这个机器第一次能跑 26B 量级模型。M4 Max 64GB 社区跑出 48 tok/s,因为大内存让 page cache 装得下更多专家,OS 文件缓存开始起作用。
3. macOS 26 + Metal 4 + Apple10 GPU 家族有一条 2.4× 加速的 prefill 路径(官方文档)。M1 装 macOS 15 也能编译运行,但少了这条 prefill 加速,token/s 会掉一档。
4. 可作为 OpenAI 兼容的 loopback 服务。仓库里 TurboFieldfareServer 起一个 OpenAI Chat Completions 协议兼容的本地端点。任何写好的 Claude/Codex/Cursor 客户端配置 base_url 指过去就能用,不需要改业务代码。
限制
– 仅限 Apple Silicon。Intel Mac 没有 unified memory 架构,没有 Metal 4,prefill 路径走不通。 – 5 tok/s 离 Claude API 还有 5–10 倍差距,做”实时 IDE 补全”不够,做”离线 chat + 长文档分析 + 隐私敏感摘要”够用。 – 不支持图像、音频、视频输入。仅 text-only(loopback 服务可声明 function tools,模型返回 tool call,由客户端负责执行)。 – macOS 26 是硬性要求。Apple10 GPU 家族才享受 prefill 加速。 – 长期 SSD 读写的健康度:作者声明”读不伤 NAND”,但持续 24 小时 decode 会让无风扇的 MacBook Air 明显发热。
怎么用
git clone https://github.com/drumih/turbo-fieldfare.git cd turbo-fieldfare swift build -c release .build/release/TurboFieldfareMac # 启动 Mac app,按 UI 走”Download”和”Load Model”
或起 OpenAI 兼容服务
.build/release/TurboFieldfareServer
第一次启动 Swift Package Manager 会编译 Swift 6.2 依赖,大约 5–10 分钟。下载模型(streaming,从 Hugging Face 拉的特定 revision)大约 15 GB,再加 1–2 分钟。
推断的产业意义
7-29 同期有 Deltafin 项目让 M1 Max 跑 Kimi K3 2.8T(0.0687 tok/s,那个数字是负向指标,没有实用价值,但证明了思路)。TurboFieldfare 是同期”消费级硬件跑大模型”风潮里第一个把 26B 真的跑到 5 tok/s 的实现。
M 系列 Mac 8GB 入门机 + 5 tok/s 26B 模型 = 个人 AI coding 工作站的最低成本起跑线。Cursor、Continue、Cline 这些 AI coding 客户端如果支持 OpenAI 兼容 base_url 切换,本地推理模型会从”凑合玩玩”变成”日常可依赖”。
下一步看 M5/M6 普及周期。如果 Apple 把 unified memory 拉低到 12GB 起售,26B 模型在 5 tok/s 上可能再翻一倍。
原文链接: – https://github.com/drumih/turbo-fieldfare – https://www.explainx.ai/blog/turbofieldfare-gemma-4-2gb-ram-apple-silicon-july-2026 – https://devaitoolkit.com/blog/can-gemma-4-26b-really-run-in-2-gb-ram
