工具大全
AI 教程作者:Coocon2026年9月4日5 次阅读约 4 分钟阅读

24GB Mac mini 能跑多大的本地大模型?内存账、实测速度与提速方案汇总

24GB Mac mini 能跑多大的本地大模型?内存账、实测速度与提速方案汇总

直接回答:24GB 统一内存的上限是 27B 级模型的 4-bit 量化——不是理论推算,我们在一台 M4 丐版 Mac mini 上把 Qwen3.8-27B(4-bit,模型本体约 15GB)连同 2B 草稿模型完整跑通,峰值内存 19.4GB,前提是关掉浏览器等大内存应用。速度上,纯自回归 6.5 tok/s"勉强能看",开投机解码后 11.7-12.2 tok/s 接近正常阅读速度。

这篇是本站 Mac mini 本地部署系列的汇总页:内存账怎么算、每个参数量级什么体验、三条提速路线哪条真有用,每个结论都链接到对应的完整实测。

一、内存账:24GB 实际能给模型多少

统一内存是 CPU/GPU 共享的,系统本身和常驻应用要吃掉一块。我们的实测经验:给模型和推理栈留出 19-20GB 是可行的,但需要主动关闭大应用;常驻 Chrome + IDE 的日常状态下,安全预算在 16GB 左右。

模型文件体积的估算公式(含格式开销,依据见量化专文):

体积 ≈ 参数量 × 每参数字节数(Q4_K_M 约 0.6 字节,Q6_K 约 0.8,Q8_0 约 1.06)

在此之上还要加 KV cache(随上下文长度线性增长)和运行时开销。按这笔账,各量级在 24GB 上的处境:

模型量级 推荐量化 模型体积 24GB 上的体验
7-9B Q8_0 / Q6_K 6-10GB 舒适区:高量化档 + 长上下文 + 不用关应用
13-14B Q6_K / Q5_K_M 8-11GB 从容:还有余量给长上下文
20B 级 Q5 / Q4 11-14GB 可行:适度控制上下文长度
27-32B Q4_K_M / 4-bit 15-18GB 天花板:能跑,需关大应用、控上下文(27B 实测峰值 19.4GB)
70B+ Q4 也要 40GB+ 跑不动,别试了

一个反直觉的提醒:内存不够时,降量化不如换小模型。27B 压到 Q2 的概率分布已经严重变形,通常不如 14B 的 Q5——这背后的数据见量化精度损失专文

二、速度预期:瓶颈是内存带宽,不是算力

本地 LLM 解码是内存带宽瓶颈型任务:每生成一个 token 都要把全部激活权重从内存搬一遍。M4 丐版带宽 120GB/s,M4 Pro 是 273GB/s——同样的模型,Pro 版绝对速度会明显更高;但加速比类结论(下节)由算法决定,跨机型通用。

M4 丐版 + Qwen3.8-27B 4-bit 的定案数字(三轮复测,波动 5% 以内):

  • 纯自回归:6.5 tok/s——读起来要等字蹦
  • 投机解码(DFlash 2 草稿模型):11.7-12.2 tok/s,稳定 1.8-1.9x——接近正常阅读速度

参数量减半速度大约翻倍(带宽瓶颈的直接推论),7-9B 模型在这台机器上可以跑到流畅对话毫无压力的速度。

三、三条提速路线的真实效果(全部同机实测)

路线 1:DFlash 2 投机解码——推荐,1.8-1.9x ✅

用 2B 草稿模型给 27B 主模型提候选、主模型批量验证,数学上无损。实测从 6.5 提到 11.7-12.2 tok/s。注意两个坑:量化模型 block-size 别超过 5(官方悬崖警告实测坐实:block-size 8 崩到 1.11x);草稿模型用 4-bit 而不是 8-bit(草稿只负责提候选,高精度换不来接受率,反而拖慢出稿)。

👉 完整部署命令与三轮数据:24G Mac mini 跑 Qwen3.8-27B + DFlash 2:实测 1.8x

路线 2:Qwen3.8 原生 MTP——省内存但更慢 ⚠️

Qwen3.8 自带的 MTP(多 token 预测)头理论上免草稿模型。同机对照实测:内存省了 3GB,速度反而降了 24%——当前 MLX 实现下不划算,除非你卡在内存临界点上宁慢勿爆。

👉 对照数据:Qwen3.8 原生 MTP vs DFlash 2 同机对照

路线 3:换 llama.cpp 跑投机解码——此路不通 ❌

同一台机器、同一个 DFlash 2 草稿:MLX 上加速 1.9x,llama.cpp 上反而减速 50% 还 OOM。Apple Silicon 上想吃投机解码红利,目前留在 MLX 生态。

👉 复现过程与原因分析:同一个 DFlash 2:MLX 加速、llama.cpp 减速

四、常见问题 FAQ

丐版 M4 Mac mini(24GB)跑 27B 值不值?

值,但要认清定位:11-12 tok/s 是"流畅阅读"不是"秒回",且要关大应用。如果预算允许,同容量下 M4 Pro 的 273GB/s 带宽能把绝对速度再抬一倍以上;如果只是想要流畅的日常本地助手,7-14B 模型在丐版上体验反而更从容。

几台丐版 Mac mini 组集群能跑更大的模型吗?

技术上存在此类方案(exo 等分布式推理项目),但我们没有实测过,不给数字。原理上要泼冷水:解码本就是带宽瓶颈,跨机通信(哪怕雷电口)远慢于统一内存,集群通常解决"装得下"而非"跑得快"。单机 24GB 已能装下 27B 4-bit,为更大模型组集群前建议先算清通信开销。

16GB 的 Mac mini 能跑什么?

按第一节的公式扣掉系统开销,舒适区是 7-9B(Q5/Q6),14B Q4 是天花板。27B 就别想了。

需要装 CUDA/显卡驱动吗?

不需要。Apple Silicon 走 Metal,MLX 和 llama.cpp 都原生支持,pip install mlx-lmbrew install llama.cpp 即可开跑。

上下文开多长合适?

KV cache 随上下文线性吃内存。27B 在 24GB 上的实测是"控制在数千 token 量级、峰值 19.4GB";跑 7-9B 时可以放开到几万 token。具体数字随模型结构差异较大,以推理框架打印的峰值内存为准。

系列文章索引

相关文章

大模型量化到底损失多少精度?Q8 到 Q2 一张表说清,附 GGUF 怎么选

4-bit 量化会让模型变笨吗?Q3 还能不能用?本文基于 llama.cpp 官方对 Llama-3-8B 全量化档位的 PPL/KLD 实测数据,把 Q8_0 到 IQ1_S 每一档的精度损失讲清楚,给出'内存装得下的前提下选最高档'的具体选择路径,并回答 Q4 与 Q8 差多少、imatrix 有什么用、1.58-bit 是怎么回事等高频问题。

qwenapple-silicon+5
ai-tutorials2026年9月4日7 min
7
同一台 24G Mac mini、同一个 DFlash 2:MLX 上加速 1.9x,llama.cpp 上减速 50% 还 OOM

同一台 24G Mac mini、同一个 DFlash 2:MLX 上加速 1.9x,llama.cpp 上减速 50% 还 OOM

投机解码三部曲第三篇。llama.cpp 合并了 DFlash 2 支持、官方还发了配套 GGUF 草稿模型,理论上这是比外挂 MLX 更顺手的路线——实测结果是全配置净减速:官方推荐的 n-max 7 在 24G 机器上可复现 Metal OOM,能跑起来的 n-max 3 散文掉一半(6.0 → 3.0 tok/s),代码接受率高达 83.8% 也还亏 23%。同一个算法、同一台机器,MLX 栈是 1.8–1.9x。用真实数据算清一笔账:这条栈上每个投机步实测均摊 0.77 秒,就算接受率 100% 也追不回本。

qwendflash+6
ai-tutorials2026年9月3日7 min
20
24G Mac mini 实测 Qwen3.8 原生 MTP:内存省了 3GB,速度反而降了 24%——与 DFlash 2 同机对照

24G Mac mini 实测 Qwen3.8 原生 MTP:内存省了 3GB,速度反而降了 24%——与 DFlash 2 同机对照

上一篇 DFlash 2 实测结尾预告过的路线:Qwen3.8 自带训练好的 MTP 多 token 预测头,llama.cpp 已支持直接挂载,不需要额外 2B 草稿模型。这次在同一台 24G Mac mini M4 上把它跑通并与 DFlash 2 正面对照:内存确实更省(峰值 16.0GB vs 19.4GB),但速度是净减速——散文 6.0 → 4.5 tok/s(-24%),代码也没赚。同机 DFlash 2 是 1.8–1.9x 加速。差距不在草稿质量(接受率 59–85% 很健康),在 Metal 后端:batch 8 解码摊薄实测只有 1.13x,验证 3 行草稿的代价≈3 次完整前向,草稿再准也赚不回来。

qwenapple-silicon+6
ai-tutorials2026年9月2日8 min
41
把家里的 Mac mini 变成 24 小时在线的 Claude Code 工作站:claudecodeui + SSH 反向隧道,手机浏览器随时接管

把家里的 Mac mini 变成 24 小时在线的 Claude Code 工作站:claudecodeui + SSH 反向隧道,手机浏览器随时接管

家里的 Mac mini 常年开机跑 Claude Code,人在外面怎么用浏览器接管会话?这是一套上线一周、每天在用的真实方案:claudecodeui 做 Web 界面(选型对比了官方 Web 版、ttyd、code-server),SSH 反向隧道把它推到 VPS,nginx 加 TLS 和登录限流反代成一个普通网址。附完整配置、真实运行数据(隧道五天零掉线、内存 170MB)、上线一周就踩到并自己修掉的 <synthetic> 占位符 bug,以及「为什么不用 Tailscale」的正反论证。

claude-codeclaude-code-lab+7
claude2026年8月29日10 min
210