工具大全
LLM 显存计算器

RTX 5090 32GB 能跑什么本地大模型?

RTX 5090 32GB 以推荐量化、16K 上下文估算,最大能跑到 Qwen3.6-35B-A3B(36B,约需 22.4 GB);清单中 14 个模型可从容运行。按 1792GB/s 内存带宽,解码速度理论上限 ≈ 带宽 ÷ 权重体积,实测通常是上限的 70%~85%。本站尚未在这台机器上实测,欢迎提交你的读数。数据核实于 2026-10-03。

规格:32GB · 1792GB/s

可运行模型清单(推荐量化,16K 上下文)

从容 = 占用 ≤ 75% 内存;贴上限 = ≤ 92%;需降量化 = 推荐档塞不下但更低档位能塞。理论上限 = 1792GB/s ÷ 权重体积,单请求解码不会快于此值。

模型量化需求结论解码上限 tok/s
Qwen3-4BQ4_K_M (GGUF)6.0 GB从容≤ 789
Qwen3.5-9BQ4_K_M (GGUF)7.5 GB从容≤ 325
Llama 3.1 8BQ4_K_M (GGUF)8.0 GB从容≤ 394
Qwen3-14BQ4_K_M (GGUF)12.4 GB从容≤ 213
gpt-oss-20BMXFP412.6 GB从容≤ 173
Nemotron 3.5 Lightning (30B-A3B)NVFP416.4 GB从容≤ 121
Gemma 4 26B-A4BQ4_K_M (GGUF)16.5 GB从容≤ 122
Qwen3.8-27BQ4_K_M (GGUF)17.3 GB从容≤ 117
Mistral Small 3.x 24BQ4_K_M (GGUF)17.6 GB从容≤ 131
GLM-4.7-Flash (30B-A3B)Q4_K_M (GGUF)20.1 GB从容≤ 101
Qwen3-Coder-30B-A3BQ4_K_M (GGUF)20.3 GB从容≤ 103
Gemma 4 31BQ4_K_M (GGUF)20.5 GB从容≤ 101
Qwen3.6-35B-A3BQ4_K_M (GGUF)22.4 GB从容≤ 88
Qwen3-32BQ4_K_M (GGUF)23.7 GB从容≤ 99
Gemma 3 27BQ4_K_M (GGUF)24.6 GB贴上限≤ 117
Llama 3.3 70BQ4_K_M (GGUF)47.9 GB跑不动—
gpt-oss-120BMXFP463.5 GB跑不动—
Mistral Leanstral 1.5 (119B-A6B MoE)Q4_K_M (GGUF)73.4 GB跑不动—
Qwen3.8-Flash-Next (180B MoE)Q4_K_M (GGUF)111 GB跑不动—
Qwen3-235B-A22BQ4_K_M (GGUF)147 GB跑不动—
DeepSeek V4 Flash (304B MoE)Q4_K_M (GGUF)187 GB跑不动—
GLM-4.5 (355B MoE)Q4_K_M (GGUF)224 GB跑不动—
DeepSeek V3 / R1 (671B MoE)Q4_K_M (GGUF)413 GB跑不动—
GLM-5.3 (753B MoE)Q4_K_M (GGUF)463 GB跑不动—
Kimi K2 (1T MoE)Q4_K_M (GGUF)631 GB跑不动—
DeepSeek V4 Pro (1.6T MoE)Q4_K_M (GGUF)983 GB跑不动—
Kimi K3 (2.8T MoE)MXFP41.46 TB跑不动—

你在 RTX 5090 32GB 上测过?

把模型、量化、推理栈版本、tok/s、峰值内存发给我们,核对后会署名收录到这一页。只收带命令或日志的一手读数。

提交实测读数

FAQ

RTX 5090 32GB 最大能跑多大的本地大模型?

按推荐量化、16K 上下文估算,上限是 Qwen3.6-35B-A3B(约需 22.4 GB,占 32GB 的 70%)。显卡上系统和显示会占 0.5~1GB,另外 llama.cpp / vLLM 的 CUDA graph 与激活缓冲也要留余量。

RTX 5090 32GB 跑哪些模型体验最好?

占用不超过 24GB 的模型可以开长上下文且不用关应用,例如 gpt-oss-20B、Nemotron 3.5 Lightning (30B-A3B)、Qwen3.6-35B-A3B、Qwen3-Coder-30B-A3B。

RTX 5090 32GB 跑本地模型每秒能出多少 token?

单请求解码主要受内存带宽限制:理论上限 ≈ 1792GB/s ÷ 权重体积。例如 15GB 的 27B 4-bit 模型上限约 119 tok/s,实测通常是上限的 70%~85%;投机解码(草稿模型)可再提 1.5~2 倍。

表里的数字是实测还是估算?

「能跑什么」表是规划级估算(与显存计算器同一公式);「一手实测」表是本站在这台机器上用真实模型文件测出的读数,每行都链接到原文,可复核。

其他机器能跑什么