Mac mini M4 24GB 能跑什么本地大模型?
Mac mini M4 24GB 以推荐量化、16K 上下文估算,最大能跑到 Nemotron 3.5 Lightning (30B-A3B)(30B,约需 16.4 GB);清单中 5 个模型可从容运行。按 120GB/s 内存带宽,解码速度理论上限 ≈ 带宽 ÷ 权重体积,实测通常是上限的 70%~85%。本页含 9 条本站在这台机器上的一手实测(tok/s、峰值内存,均可在原文复核)。数据核实于 2026-10-03。
规格:24GB · 120GB/s · 本站主力测试机(M4 基础版 10 核 GPU,macOS 26.3)
一手实测9 条
本站在这台机器上用真实模型文件测得;每行可点进原文复核命令、版本与完整读数。
| 模型 | 量化 / 推理栈 | 配置 | 解码 tok/s | 预填充 | 峰值内存 | 来源 |
|---|---|---|---|---|---|---|
| Qwen3.8-27B | 4-bit (MLX) MLX | 纯自回归基线,3 轮 | 6.4–6.5 | — | — | 原文 2026-08-29 |
| Qwen3.8-27B | 4-bit (MLX) MLX | DFlash 2 草稿模型(2B,4-bit)投机解码,block-size 3 block-size 8 掉到 1.11x;草稿用 8-bit 反而更慢(1.62x) | 11.6–12.21.8–1.9x | — | 19.4GB | 原文 2026-08-29 |
| Qwen3.8-27B | UD-Q4_K_S (GGUF, 15.4GB) llama.cpp b96806d (Metal) | 纯自回归基线(散文 / 代码) | 5.9–6 | — | 15.4GB | 原文 2026-09-02 |
| Qwen3.8-27B | UD-Q4_K_S (GGUF) llama.cpp b96806d (Metal) | 原生 MTP 头投机解码,n-max 2 散文 -24%、代码 -4%:在 Metal 上是净减速 | 4.5–5.70.76–0.96x | — | 16GB | 原文 2026-09-02 |
| Qwen3.8-27B | UD-Q4_K_S (GGUF) llama.cpp b96806d (Metal) | DFlash 2 GGUF 草稿(1.14GB),n-max 3 官方推荐 n-max 7 在 8K 上下文下 Metal OOM,可复现 | 3–4.60.5–0.77x | — | — | 原文 2026-09-03 |
| Qwen3.8-27B | UD-Q4_K_S (GGUF) llama.cpp llama-server b11376 | 默认参数(--fit 压到 30K 上下文,4 槽) | 6.3 | 56 | — | 原文 2026-10-03 |
| Qwen3.8-27B | UD-Q4_K_S (GGUF, 自导入) Ollama 0.35.1 | 默认参数(上下文 4096) Ollama 0.35 的推理进程就是自带的 llama-server,同参数下速度一致 | 6.3 | 57 | — | 原文 2026-10-03 |
| Qwen3 4B | Q4_K_M (GGUF) llama.cpp llama-server b11376 | 默认参数(--fit 开到 101K 上下文,4 槽) 4 路并发时每路 11.6 tok/s、总吞吐 40.9 tok/s | 36.5 | 376 | — | 原文 2026-10-03 |
| Qwen3 4B | Q4_K_M (GGUF, 官方库 qwen3:4b) Ollama 0.35.1 | 默认参数(上下文 4096,单槽排队) 超长 prompt 会被静默截到 2050 token,日志仅一行 WARN | 36.3 | 367 | — | 原文 2026-10-03 |
可运行模型清单(推荐量化,16K 上下文)
从容 = 占用 ≤ 65% 内存;贴上限 = ≤ 82%(macOS 默认只给 GPU 约 2/3~3/4 统一内存,阈值按本站 24GB 实测校准);需降量化 = 推荐档塞不下但更低档位能塞。理论上限 = 120GB/s ÷ 权重体积,单请求解码不会快于此值。
| 模型 | 量化 | 需求 | 结论 | 解码上限 tok/s |
|---|---|---|---|---|
| Qwen3-4B | Q4_K_M (GGUF) | 6.0 GB | 从容 | ≤ 53 |
| Qwen3.5-9B | Q4_K_M (GGUF) | 7.5 GB | 从容 | ≤ 22 |
| Llama 3.1 8B | Q4_K_M (GGUF) | 8.0 GB | 从容 | ≤ 26 |
| Qwen3-14B | Q4_K_M (GGUF) | 12.4 GB | 从容 | ≤ 14 |
| gpt-oss-20B | MXFP4 | 12.6 GB | 从容 | ≤ 12 |
| Nemotron 3.5 Lightning (30B-A3B) | NVFP4 | 16.4 GB | 贴上限 | ≤ 8.1 |
| Gemma 4 26B-A4B | Q4_K_M (GGUF) | 16.5 GB | 贴上限 | ≤ 8.2 |
| Qwen3.8-27B | Q4_K_M (GGUF) | 17.3 GB | 贴上限 | ≤ 7.8 |
| Mistral Small 3.x 24B | Q4_K_M (GGUF) | 17.6 GB | 贴上限 | ≤ 8.8 |
| GLM-4.7-Flash (30B-A3B) | Q3_K_M (GGUF) | 16.0 GB | 需降量化 | ≤ 8.8 |
| Qwen3-Coder-30B-A3B | Q3_K_M (GGUF) | 16.4 GB | 需降量化 | ≤ 9.0 |
| Gemma 4 31B | Q3_K_M (GGUF) | 16.5 GB | 需降量化 | ≤ 8.8 |
| Qwen3.6-35B-A3B | Q3_K_M (GGUF) | 17.6 GB | 需降量化 | ≤ 7.6 |
| Qwen3-32B | Q3_K_M (GGUF) | 19.5 GB | 需降量化 | ≤ 8.6 |
| Gemma 3 27B | Q2_K (GGUF) | 18.1 GB | 需降量化 | ≤ 14 |
| Llama 3.3 70B | Q4_K_M (GGUF) | 47.9 GB | 跑不动 | — |
| gpt-oss-120B | MXFP4 | 63.5 GB | 跑不动 | — |
| Mistral Leanstral 1.5 (119B-A6B MoE) | Q4_K_M (GGUF) | 73.4 GB | 跑不动 | — |
| Qwen3.8-Flash-Next (180B MoE) | Q4_K_M (GGUF) | 111 GB | 跑不动 | — |
| Qwen3-235B-A22B | Q4_K_M (GGUF) | 147 GB | 跑不动 | — |
| DeepSeek V4 Flash (304B MoE) | Q4_K_M (GGUF) | 187 GB | 跑不动 | — |
| GLM-4.5 (355B MoE) | Q4_K_M (GGUF) | 224 GB | 跑不动 | — |
| DeepSeek V3 / R1 (671B MoE) | Q4_K_M (GGUF) | 413 GB | 跑不动 | — |
| GLM-5.3 (753B MoE) | Q4_K_M (GGUF) | 463 GB | 跑不动 | — |
| Kimi K2 (1T MoE) | Q4_K_M (GGUF) | 631 GB | 跑不动 | — |
| DeepSeek V4 Pro (1.6T MoE) | Q4_K_M (GGUF) | 983 GB | 跑不动 | — |
| Kimi K3 (2.8T MoE) | MXFP4 | 1.46 TB | 跑不动 | — |
你在 Mac mini M4 24GB 上测过?
把模型、量化、推理栈版本、tok/s、峰值内存发给我们,核对后会署名收录到这一页。只收带命令或日志的一手读数。
提交实测读数FAQ
Mac mini M4 24GB 最大能跑多大的本地大模型?
按推荐量化、16K 上下文估算,上限是 Nemotron 3.5 Lightning (30B-A3B)(约需 16.4 GB,占 24GB 的 68%)。macOS 默认只允许约 2/3~3/4 的统一内存给 GPU,贴近上限时需调高 iogpu.wired_limit_mb 并关闭大内存应用。
Mac mini M4 24GB 跑哪些模型体验最好?
占用不超过 16GB 的模型可以开长上下文且不用关应用,例如 gpt-oss-20B、Qwen3.5-9B、Qwen3-14B、Llama 3.1 8B。
Mac mini M4 24GB 跑本地模型每秒能出多少 token?
单请求解码主要受内存带宽限制:理论上限 ≈ 120GB/s ÷ 权重体积。例如 15GB 的 27B 4-bit 模型上限约 8.0 tok/s,实测通常是上限的 70%~85%;投机解码(草稿模型)可再提 1.5~2 倍。
表里的数字是实测还是估算?
「能跑什么」表是规划级估算(与显存计算器同一公式);「一手实测」表是本站在这台机器上用真实模型文件测出的读数,每行都链接到原文,可复核。