趋近智
NVIDIA RTX PRO 4000 Blackwell SFF (24GB) 配备 24 GB 专用显存与 432 GB/s 显存带宽,支持 CUDA 和 TensorRT-LLM 运行环境,可进行全精度与量化大模型推理。
总显存
24 GB
可用显存上限
24 GB
显存带宽
432 GB/s
最大推理模型级别
32B 模型 (Q4)
热设计功耗
70W
随上下文长度增长的显存需求评估。当曲线超过参考线时将导致显存不足(OOM)。
量化精度:
主流开源大模型在 NVIDIA RTX PRO 4000 Blackwell SFF (24GB) 上的推理速度、显存兼容性与生成吞吐表现。
排序:
上下文长度:
KV 缓存:
显卡数量:
| 排名 | 模型 | 参数量 | 量化精度 | 预估 TPS | TTFT | 可运行 |
|---|---|---|---|---|---|---|
#33 | Qwen 3.8 27B | 27B | INT4 | 22 tok/s | ~3.1s | |
#48 | Agnes 3.0 Flash | 33B | INT4 | 19 tok/s | ~3.7s | |
#72 | K2 Horizon MoVA 36B A4B | 36B (4B active) | INT4 | 87 tok/s | ~659 ms | |
#83 | Qwen3.5-27B | 27B | INT4 | 22 tok/s | ~3.1s | |
#92 | Sarvam-30B | 32B (2.4B active) | INT4 | 119 tok/s | ~424 ms | |
#94 | Qwen3.6 35B A3B | 35B (3B active) | INT4 | 102 tok/s | ~537 ms | |
#96 | Muse Glimmer 30B | 30B | INT4 | 20 tok/s | ~3.4s | |
#100 | Phi-4 Reasoning Plus | 14B | INT4 Q8 | 30 tok/s 20 tok/s | ~1.6s ~1.6s | |
#101 | MiMo V2 Flash | 15B (309B active) | INT4 Q8 | 2 tok/s 1 tok/s | ~33.6s ~36.9s | |
#108 | Gemma 4 26B A4B | 25.2B (3.8B active) | INT4 | 98 tok/s | ~555 ms | |
#109 | Gemma 4 12B | 11.95B | INT4 Q8 | 34 tok/s 23 tok/s | ~1.4s ~1.4s | |
#113 | Qwen3.5-9B | 9B | INT4 Q8 FP16 | 59 tok/s 36 tok/s 18 tok/s | ~1.1s ~1.1s ~1.2s | |
#114 | Qwen3.5-35B-A3B | 35B (3B active) | INT4 | 102 tok/s | ~537 ms | |
#118 | K2 Horizon 7B | 7B | INT4 Q8 FP16 | 72 tok/s 44 tok/s 24 tok/s | ~825 ms ~833 ms ~852 ms | |
#128 | NVIDIA Nemotron 3 Nano 30B-A3B | 3.5B (30B active) | INT4 Q8 FP16 | 19 tok/s 11 tok/s 6 tok/s | ~3.3s ~3.3s ~3.4s | |
#129 | Gemma 4 31B | 30.7B | INT4 | 20 tok/s | ~3.5s | |
#131 | Nemotron 3.5 Lightning | 30B (3B active) | INT4 | 40 tok/s | ~542 ms | |
#132 | Qwen3.5-4B | 4B | INT4 Q8 FP16 | 108 tok/s 71 tok/s 40 tok/s | ~486 ms ~491 ms ~502 ms | |
#133 | Qwen3-30B-A3B | 30B (3B active) | INT4 | 108 tok/s | ~485 ms | |
#136 | GPT-OSS 20B | 21B (3.6B active) | INT4 | 47 tok/s | ~531 ms | |
#146 | Granite 4.2 8B | 8B | INT4 Q8 FP16 | 65 tok/s 40 tok/s 21 tok/s | ~937 ms ~947 ms ~969 ms | |
#150 | Gemma 4 E4B | 8B | INT4 Q8 FP16 | 65 tok/s 40 tok/s 21 tok/s | ~937 ms ~947 ms ~969 ms | |
#151 | Nemotron 3.5 Lightning 30B A3B | 30B (3B active) | INT4 | 108 tok/s | ~485 ms | |
#153 | Qwen3-32B | 32B | INT4 | 19 tok/s | ~3.6s | |
#156 | GLM-4 | 32B | INT4 | 13 tok/s | ~4.3s | |
#158 | GLM-4V | 9B | INT4 Q8 FP16 | 42 tok/s 29 tok/s 16 tok/s | ~1.1s ~1.1s ~1.2s | |
#159 | Gemma 3 27B | 27B | INT4 | 22 tok/s | ~3.1s | |
#160 | Phi-4 | 14B | INT4 Q8 | 40 tok/s 24 tok/s | ~1.6s ~1.6s | |
#162 | DeepSeek-R1 32B | 32B | INT4 | 20 tok/s | ~3.6s | |
#164 | Qwen2.5-32B | 32B | INT4 | 19 tok/s | ~3.6s | |
#168 | Magistral Small | 24B | INT4 | 19 tok/s | ~2.8s | |
#169 | OLMo 3 7B Think | 7B | INT4 Q8 FP16 | 52 tok/s 36 tok/s 21 tok/s | ~830 ms ~838 ms ~857 ms | |
#170 | OLMo 3.1 32B Instruct | 32B | INT4 | 13 tok/s | ~4.3s | |
#172 | DeepSeek-R1 14B | 14B | INT4 Q8 | 42 tok/s 24 tok/s | ~1.6s ~1.6s | |
#173 | Ministral 3 14B | 14B | INT4 Q8 | 30 tok/s 20 tok/s | ~1.6s ~1.6s | |
#177 | Gemma 3 12B | 12B | INT4 Q8 FP16 | 46 tok/s 27 tok/s 13 tok/s | ~1.4s ~1.4s ~1.7s | |
#180 | OLMo 3 32B Base | 32B | INT4 | 13 tok/s | ~4.3s | |
#181 | Mistral-Small-2501 | 24B | INT4 | 25 tok/s | ~2.7s | |
#182 | Ministral 3 8B | 8B | INT4 Q8 FP16 | 47 tok/s 32 tok/s 18 tok/s | ~943 ms ~953 ms ~1.1s | |
#183 | Qwen3.5-2B | 2B | INT4 Q8 FP16 | 162 tok/s 116 tok/s 71 tok/s | ~261 ms ~263 ms ~269 ms | |
#184 | MiniCPM5-2B | 2B | INT4 Q8 FP16 | 162 tok/s 116 tok/s 71 tok/s | ~261 ms ~263 ms ~269 ms | |
#185 | Qwen2.5-14B | 14B | INT4 Q8 | 40 tok/s 24 tok/s | ~1.6s ~1.6s | |
#186 | Gemma 2 27B | 27B | INT4 | 22 tok/s | ~3.1s | |
#187 | OLMo 3.1 32B Think | 32B | INT4 | 13 tok/s | ~4.3s | |
#188 | Gemma 4 E2B | 5.1B | INT4 Q8 FP16 | 92 tok/s 58 tok/s 32 tok/s | ~610 ms ~616 ms ~630 ms | |
#189 | Qwen3-4B | 4B | INT4 Q8 FP16 | 108 tok/s 71 tok/s 40 tok/s | ~486 ms ~491 ms ~502 ms | |
#190 | DeepSeek-R1 8B | 8B | INT4 Q8 FP16 | 67 tok/s 40 tok/s 21 tok/s | ~937 ms ~947 ms ~969 ms | |
#193 | Ministral 3 3B | 3B | INT4 Q8 FP16 | 87 tok/s 67 tok/s 43 tok/s | ~377 ms ~380 ms ~388 ms | |
#195 | Qwen3-14B | 14B | INT4 Q8 | 40 tok/s 24 tok/s | ~1.6s ~1.6s | |
#197 | Gemma 2 9B | 9B | INT4 Q8 FP16 | 59 tok/s 36 tok/s 18 tok/s | ~1.1s ~1.1s ~1.2s | |
#198 | Qwen2.5-7B | 7B | INT4 Q8 FP16 | 72 tok/s 44 tok/s 24 tok/s | ~825 ms ~833 ms ~852 ms | |
#199 | Qwen3-8B | 8B | INT4 Q8 FP16 | 65 tok/s 40 tok/s 21 tok/s | ~937 ms ~947 ms ~969 ms | |
#200 | Gemma 3 4B | 4B | INT4 Q8 FP16 | 108 tok/s 71 tok/s 40 tok/s | ~486 ms ~491 ms ~502 ms | |
#201 | DeepSeek-R1 7B | 7B | INT4 Q8 FP16 | 74 tok/s 45 tok/s 24 tok/s | ~824 ms ~833 ms ~852 ms | |
#202 | Llama 3.1 8B | 8B | INT4 Q8 FP16 | 65 tok/s 40 tok/s 21 tok/s | ~937 ms ~947 ms ~969 ms | |
#204 | Qwen3-1.7B | 1.7B | INT4 Q8 FP16 | 177 tok/s 129 tok/s 81 tok/s | ~224 ms ~226 ms ~231 ms | |
#205 | Command R | 35B | INT4 | 12 tok/s | ~4.7s | |
#206 | Gemma 3 270M | 0.27B | INT4 Q8 FP16 | 285 tok/s 263 tok/s 220 tok/s | ~41 ms ~41 ms ~42 ms | |
#208 | Llama 3 8B | 8B | INT4 Q8 FP16 | 65 tok/s 40 tok/s 21 tok/s | ~937 ms ~947 ms ~969 ms | |
#209 | Qwen3-0.6B | 0.6B | INT4 Q8 FP16 | 268 tok/s 224 tok/s 164 tok/s | ~83 ms ~84 ms ~85 ms | |
#210 | Phi-4-Mini | 3.8B | INT4 Q8 FP16 | 112 tok/s 74 tok/s 42 tok/s | ~463 ms ~468 ms ~478 ms | |
#212 | Ministral-8B-2410 | 8B | INT4 Q8 FP16 | 65 tok/s 40 tok/s 21 tok/s | ~937 ms ~947 ms ~969 ms | |
#213 | DeepSeek-R1 1.5B | 1.5B | INT4 Q8 FP16 | 188 tok/s 140 tok/s 89 tok/s | ~199 ms ~201 ms ~205 ms | |
#214 | Llama 3.2 3B | 3B | INT4 Q8 FP16 | 130 tok/s 88 tok/s 51 tok/s | ~373 ms ~377 ms ~385 ms | |
#215 | Qwen3.5-0.8B | 0.8B | INT4 Q8 FP16 | 244 tok/s 197 tok/s 138 tok/s | ~110 ms ~111 ms ~113 ms | |
#216 | Phi-3-mini | 3.8B | INT4 Q8 FP16 | 112 tok/s 74 tok/s 42 tok/s | ~463 ms ~468 ms ~478 ms | |
#217 | Gemma 3n E2B IT | 6B (2B active) | INT4 Q8 FP16 | 87 tok/s 74 tok/s 53 tok/s | ~283 ms ~285 ms ~291 ms | |
#218 | Mistral-7B-Instruct-v0.1 | 7.3B | INT4 Q8 FP16 | 70 tok/s 43 tok/s 23 tok/s | ~858 ms ~867 ms ~887 ms | |
#219 | Llama 3.2 1B | 1B | INT4 Q8 FP16 | 223 tok/s 176 tok/s 119 tok/s | ~138 ms ~139 ms ~142 ms | |
#220 | Gemma 2 2B | 2B | INT4 Q8 FP16 | 162 tok/s 116 tok/s 71 tok/s | ~261 ms ~263 ms ~269 ms | |
#221 | Phi-3-medium | 14B | INT4 Q8 | 40 tok/s 24 tok/s | ~1.6s ~1.6s | |
#222 | OLMo 3 7B Instruct | 7B | INT4 Q8 FP16 | 52 tok/s 36 tok/s 21 tok/s | ~830 ms ~838 ms ~857 ms | |
#223 | Yi-34B | 34B | INT4 | 13 tok/s | ~4.5s | |
#224 | Qwen2-7B | 7B | INT4 Q8 FP16 | 72 tok/s 44 tok/s 24 tok/s | ~825 ms ~833 ms ~852 ms | |
#225 | Phi-3-small | 7B | INT4 Q8 FP16 | 72 tok/s 44 tok/s 24 tok/s | ~825 ms ~833 ms ~852 ms | |
#226 | Gemma 3 1B | 1B | INT4 Q8 FP16 | 223 tok/s 176 tok/s 119 tok/s | ~138 ms ~139 ms ~142 ms | |
#227 | Mistral-7B-Instruct-v0.2 | 7.3B | INT4 Q8 FP16 | 70 tok/s 43 tok/s 23 tok/s | ~858 ms ~867 ms ~887 ms | |
#229 | Gemma 1 7B | 7B | INT4 Q8 FP16 | 52 tok/s 36 tok/s 21 tok/s | ~830 ms ~838 ms ~857 ms | |
#230 | Gemma 1 2B | 2B | INT4 Q8 FP16 | 173 tok/s 121 tok/s 73 tok/s | ~260 ms ~263 ms ~268 ms | |
#231 | ChatGLM3-6B | 6B | INT4 Q8 FP16 | 57 tok/s 41 tok/s 25 tok/s | ~717 ms ~724 ms ~740 ms | |
#232 | ChatGLM2-6B | 6B | INT4 Q8 FP16 | 57 tok/s 41 tok/s 25 tok/s | ~717 ms ~724 ms ~740 ms | |
#233 | ChatGLM-6B | 6B | INT4 Q8 FP16 | 57 tok/s 41 tok/s 25 tok/s | ~717 ms ~724 ms ~740 ms | |
未上榜模型(按推理速度排序) | ||||||
- | Qwen2-0.5B | 0.5B | INT4 Q8 FP16 | 282 tok/s 240 tok/s 181 tok/s | ~70 ms ~70 ms ~72 ms | |
- | Qwen2.5-0.5B | 0.5B | INT4 Q8 FP16 | 282 tok/s 240 tok/s 181 tok/s | ~70 ms ~70 ms ~72 ms | |
- | ERNIE-4.5-0.3B | 0.3B | INT4 Q8 FP16 | 277 tok/s 253 tok/s 210 tok/s | ~45 ms ~45 ms ~46 ms | |
- | ERNIE-4.5-0.3B-Base | 0.3B | INT4 Q8 FP16 | 277 tok/s 253 tok/s 210 tok/s | ~45 ms ~45 ms ~46 ms | |
- | Falcon-1B | 1B | INT4 Q8 FP16 | 235 tok/s 182 tok/s 122 tok/s | ~138 ms ~139 ms ~142 ms | |
- | Falcon3-1B | 1B | INT4 Q8 FP16 | 223 tok/s 176 tok/s 119 tok/s | ~138 ms ~139 ms ~142 ms | |
- | Qwen2-1.5B | 1.5B | INT4 Q8 FP16 | 188 tok/s 140 tok/s 89 tok/s | ~199 ms ~201 ms ~205 ms | |
- | Qwen2.5-1.5B | 1.5B | INT4 Q8 FP16 | 188 tok/s 140 tok/s 89 tok/s | ~199 ms ~201 ms ~205 ms | |
- | Spark X2.5 1.7B | 1.7B | INT4 Q8 FP16 | 177 tok/s 129 tok/s 81 tok/s | ~224 ms ~226 ms ~231 ms | |
- | Hy-MT2 1.8B | 1.8B | INT4 Q8 FP16 | 172 tok/s 125 tok/s 77 tok/s | ~235 ms ~238 ms ~243 ms | |
- | Falcon-3B | 3B | INT4 Q8 FP16 | 138 tok/s 91 tok/s 52 tok/s | ~372 ms ~376 ms ~384 ms | |
- | CroissantLLM Base | 1.3B | INT4 Q8 FP16 | 135 tok/s 114 tok/s 81 tok/s | ~176 ms ~178 ms ~181 ms | |
- | Phi-1 | 1.3B | INT4 Q8 FP16 | 135 tok/s 114 tok/s 81 tok/s | ~176 ms ~178 ms ~181 ms | |
- | Phi-1.5 | 1.3B | INT4 Q8 FP16 | 135 tok/s 114 tok/s 81 tok/s | ~176 ms ~178 ms ~181 ms | |
- | DeepSeek-R1 3B | 3B | INT4 Q8 FP16 | 132 tok/s 89 tok/s 51 tok/s | ~373 ms ~376 ms ~385 ms | |
- | Falcon3-3B | 3B | INT4 Q8 FP16 | 130 tok/s 88 tok/s 51 tok/s | ~373 ms ~377 ms ~385 ms | |
- | Qwen2.5-3B | 3B | INT4 Q8 FP16 | 130 tok/s 88 tok/s 51 tok/s | ~373 ms ~377 ms ~385 ms | |
- | ERNIE-4.5-21B-A3B | 21B (3B active) | INT4 Q8 | 114 tok/s 73 tok/s | ~454 ms ~537 ms | |
- | ERNIE-4.5-21B-A3B-Base | 21B (3B active) | INT4 Q8 | 114 tok/s 73 tok/s | ~454 ms ~537 ms | |
- | ERNIE-4.5-VL-28B-A3B | 28B (3B active) | INT4 | 110 tok/s | ~478 ms | |
- | ERNIE-4.5-VL-28B-A3B-Base | 28B (3B active) | INT4 | 110 tok/s | ~478 ms | |
- | Hy-MT2 30B A3B | 30B (3B active) | INT4 | 108 tok/s | ~485 ms | |
- | Spark X2.5 4B | 4B | INT4 Q8 FP16 | 108 tok/s 71 tok/s 40 tok/s | ~486 ms ~491 ms ~502 ms | |
- | Phi-2 | 2.7B | INT4 Q8 FP16 | 91 tok/s 72 tok/s 47 tok/s | ~343 ms ~346 ms ~353 ms | |
- | MaLLaM-3B | 3B | INT4 Q8 FP16 | 87 tok/s 67 tok/s 43 tok/s | ~377 ms ~380 ms ~388 ms | |
- | SmolLM3 3B | 3B | INT4 Q8 FP16 | 87 tok/s 67 tok/s 43 tok/s | ~377 ms ~380 ms ~388 ms | |
- | Falcon-7B | 7B | INT4 Q8 FP16 | 75 tok/s 46 tok/s 24 tok/s | ~824 ms ~833 ms ~852 ms | |
- | Falcon3-7B | 7B | INT4 Q8 FP16 | 72 tok/s 44 tok/s 24 tok/s | ~825 ms ~833 ms ~852 ms | |
- | Hy-MT2 7B | 7B | INT4 Q8 FP16 | 72 tok/s 44 tok/s 24 tok/s | ~825 ms ~833 ms ~852 ms | |
- | Mistral-7B-v0.1 | 7.3B | INT4 Q8 FP16 | 70 tok/s 43 tok/s 23 tok/s | ~858 ms ~867 ms ~887 ms | |
- | LensVLM 9B | 9B | INT4 Q8 FP16 | 59 tok/s 36 tok/s 18 tok/s | ~1.1s ~1.1s ~1.2s | |
- | MiMo V2.6 Distill Qwen 9B | 9B | INT4 Q8 FP16 | 59 tok/s 36 tok/s 18 tok/s | ~1.1s ~1.1s ~1.2s | |
- | ChatGLM3-6B-32K | 6B | INT4 Q8 FP16 | 57 tok/s 41 tok/s 25 tok/s | ~717 ms ~724 ms ~740 ms | |
- | Yi-6B | 6B | INT4 Q8 FP16 | 57 tok/s 41 tok/s 25 tok/s | ~717 ms ~724 ms ~740 ms | |
- | Falcon3-10B | 10B | INT4 Q8 FP16 | 54 tok/s 32 tok/s 16 tok/s | ~1.2s ~1.2s ~1.3s | |
- | Kimi-VL-A3B-Instruct | 16B (3B active) | INT4 Q8 | 54 tok/s 45 tok/s | ~446 ms ~487 ms | |
- | Falcon2-11B | 11B | INT4 Q8 FP16 | 52 tok/s 30 tok/s 14 tok/s | ~1.3s ~1.3s ~1.5s | |
- | Hunyuan Lite | 7B | INT4 Q8 FP16 | 52 tok/s 36 tok/s 21 tok/s | ~830 ms ~838 ms ~857 ms | |
- | OLMo 3 7B Base | 7B | INT4 Q8 FP16 | 52 tok/s 36 tok/s 21 tok/s | ~830 ms ~838 ms ~857 ms | |
- | SEA-LION-7B | 7.1B | INT4 Q8 FP16 | 51 tok/s 36 tok/s 21 tok/s | ~841 ms ~850 ms ~869 ms | |
- | SEA-LION-7B-Instruct | 7.1B | INT4 Q8 FP16 | 51 tok/s 36 tok/s 21 tok/s | ~841 ms ~850 ms ~869 ms | |
- | Sahabat-AI-Llama3-8B-Instruct | 8B | INT4 Q8 FP16 | 47 tok/s 32 tok/s 18 tok/s | ~943 ms ~953 ms ~1.1s | |
- | Typhoon-2-8B | 8B | INT4 Q8 FP16 | 47 tok/s 32 tok/s 18 tok/s | ~943 ms ~953 ms ~1.1s | |
- | GLM-4-9B | 9B | INT4 Q8 FP16 | 42 tok/s 29 tok/s 16 tok/s | ~1.1s ~1.1s ~1.2s | |
- | GLM-4-9B-Chat | 9B | INT4 Q8 FP16 | 42 tok/s 29 tok/s 16 tok/s | ~1.1s ~1.1s ~1.2s | |
- | GLM-4-9B-Chat-1M | 9B | INT4 Q8 FP16 | 42 tok/s 29 tok/s 16 tok/s | ~1.1s ~1.1s ~1.2s | |
- | Sahabat-AI-Gemma2-9B | 9.2B | INT4 Q8 FP16 | 42 tok/s 29 tok/s 16 tok/s | ~1.1s ~1.1s ~1.2s | |
- | Sahabat-AI-Gemma2-9B-Instruct | 9.2B | INT4 Q8 FP16 | 42 tok/s 29 tok/s 16 tok/s | ~1.1s ~1.1s ~1.2s | |
- | Yi-9B | 9B | INT4 Q8 FP16 | 42 tok/s 29 tok/s 16 tok/s | ~1.1s ~1.1s ~1.2s | |
- | GreenMind-14B-R1 | 14B | INT4 Q8 | 30 tok/s 20 tok/s | ~1.6s ~1.6s | |
- | Falcon-40B | 40B | INT4 | 15 tok/s | ~4.9s | |
不同量化精度下可运行的最大模型参数级别。
上下文长度:
4位量化
32B 模型
8位精度
14B 模型
16位全精度
8B 模型
本地模型训练与适配器微调支持能力。
微调上下文:
QLoRA
32B 模型
LoRA
14B 模型
全参数微调
3B 模型
NVIDIA RTX PRO 4000 Blackwell SFF (24GB) 上的最佳量化精度与运行规格建议。
最佳推理区间
适合在全精度或 Q8 精度下运行 14B 模型,以及在 Q4 精度下搭配最高 32k 上下文运行 32B 模型。
显存带宽与推理速率
具备 432 GB/s 聚合带宽,单批次推理处于显存带宽受限模式。8B Q4 模型预估生成速度约 96 tok/s,70B Q4 模型预估生成速度约 11 tok/s。
Assistant
在线