24GB Mac mini 能跑多大的本地大模型?内存账、实测速度与提速方案汇总
24GB Mac mini 能跑多大的本地大模型?内存账、实测速度与提速方案汇总
直接回答:24GB 统一内存的上限是 27B 级模型的 4-bit 量化——不是理论推算,我们在一台 M4 丐版 Mac mini 上把 Qwen3.8-27B(4-bit,模型本体约 15GB)连同 2B 草稿模型完整跑通,峰值内存 19.4GB,前提是关掉浏览器等大内存应用。速度上,纯自回归 6.5 tok/s"勉强能看",开投机解码后 11.7-12.2 tok/s 接近正常阅读速度。
这篇是本站 Mac mini 本地部署系列的汇总页:内存账怎么算、每个参数量级什么体验、三条提速路线哪条真有用,每个结论都链接到对应的完整实测。
一、内存账:24GB 实际能给模型多少
统一内存是 CPU/GPU 共享的,系统本身和常驻应用要吃掉一块。我们的实测经验:给模型和推理栈留出 19-20GB 是可行的,但需要主动关闭大应用;常驻 Chrome + IDE 的日常状态下,安全预算在 16GB 左右。
模型文件体积的估算公式(含格式开销,依据见量化专文):
体积 ≈ 参数量 × 每参数字节数(Q4_K_M 约 0.6 字节,Q6_K 约 0.8,Q8_0 约 1.06)
在此之上还要加 KV cache(随上下文长度线性增长)和运行时开销。按这笔账,各量级在 24GB 上的处境:
| 模型量级 | 推荐量化 | 模型体积 | 24GB 上的体验 |
|---|---|---|---|
| 7-9B | Q8_0 / Q6_K | 6-10GB | 舒适区:高量化档 + 长上下文 + 不用关应用 |
| 13-14B | Q6_K / Q5_K_M | 8-11GB | 从容:还有余量给长上下文 |
| 20B 级 | Q5 / Q4 | 11-14GB | 可行:适度控制上下文长度 |
| 27-32B | Q4_K_M / 4-bit | 15-18GB | 天花板:能跑,需关大应用、控上下文(27B 实测峰值 19.4GB) |
| 70B+ | — | Q4 也要 40GB+ | 跑不动,别试了 |
一个反直觉的提醒:内存不够时,降量化不如换小模型。27B 压到 Q2 的概率分布已经严重变形,通常不如 14B 的 Q5——这背后的数据见量化精度损失专文。
二、速度预期:瓶颈是内存带宽,不是算力
本地 LLM 解码是内存带宽瓶颈型任务:每生成一个 token 都要把全部激活权重从内存搬一遍。M4 丐版带宽 120GB/s,M4 Pro 是 273GB/s——同样的模型,Pro 版绝对速度会明显更高;但加速比类结论(下节)由算法决定,跨机型通用。
M4 丐版 + Qwen3.8-27B 4-bit 的定案数字(三轮复测,波动 5% 以内):
- 纯自回归:6.5 tok/s——读起来要等字蹦
- 投机解码(DFlash 2 草稿模型):11.7-12.2 tok/s,稳定 1.8-1.9x——接近正常阅读速度
参数量减半速度大约翻倍(带宽瓶颈的直接推论),7-9B 模型在这台机器上可以跑到流畅对话毫无压力的速度。
三、三条提速路线的真实效果(全部同机实测)
路线 1:DFlash 2 投机解码——推荐,1.8-1.9x ✅
用 2B 草稿模型给 27B 主模型提候选、主模型批量验证,数学上无损。实测从 6.5 提到 11.7-12.2 tok/s。注意两个坑:量化模型 block-size 别超过 5(官方悬崖警告实测坐实:block-size 8 崩到 1.11x);草稿模型用 4-bit 而不是 8-bit(草稿只负责提候选,高精度换不来接受率,反而拖慢出稿)。
👉 完整部署命令与三轮数据:24G Mac mini 跑 Qwen3.8-27B + DFlash 2:实测 1.8x
路线 2:Qwen3.8 原生 MTP——省内存但更慢 ⚠️
Qwen3.8 自带的 MTP(多 token 预测)头理论上免草稿模型。同机对照实测:内存省了 3GB,速度反而降了 24%——当前 MLX 实现下不划算,除非你卡在内存临界点上宁慢勿爆。
👉 对照数据:Qwen3.8 原生 MTP vs DFlash 2 同机对照
路线 3:换 llama.cpp 跑投机解码——此路不通 ❌
同一台机器、同一个 DFlash 2 草稿:MLX 上加速 1.9x,llama.cpp 上反而减速 50% 还 OOM。Apple Silicon 上想吃投机解码红利,目前留在 MLX 生态。
👉 复现过程与原因分析:同一个 DFlash 2:MLX 加速、llama.cpp 减速
四、常见问题 FAQ
丐版 M4 Mac mini(24GB)跑 27B 值不值?
值,但要认清定位:11-12 tok/s 是"流畅阅读"不是"秒回",且要关大应用。如果预算允许,同容量下 M4 Pro 的 273GB/s 带宽能把绝对速度再抬一倍以上;如果只是想要流畅的日常本地助手,7-14B 模型在丐版上体验反而更从容。
几台丐版 Mac mini 组集群能跑更大的模型吗?
技术上存在此类方案(exo 等分布式推理项目),但我们没有实测过,不给数字。原理上要泼冷水:解码本就是带宽瓶颈,跨机通信(哪怕雷电口)远慢于统一内存,集群通常解决"装得下"而非"跑得快"。单机 24GB 已能装下 27B 4-bit,为更大模型组集群前建议先算清通信开销。
16GB 的 Mac mini 能跑什么?
按第一节的公式扣掉系统开销,舒适区是 7-9B(Q5/Q6),14B Q4 是天花板。27B 就别想了。
需要装 CUDA/显卡驱动吗?
不需要。Apple Silicon 走 Metal,MLX 和 llama.cpp 都原生支持,pip install mlx-lm 或 brew install llama.cpp 即可开跑。
上下文开多长合适?
KV cache 随上下文线性吃内存。27B 在 24GB 上的实测是"控制在数千 token 量级、峰值 19.4GB";跑 7-9B 时可以放开到几万 token。具体数字随模型结构差异较大,以推理框架打印的峰值内存为准。


