趋近智
NVIDIA RTX PRO 4000 Blackwell (24GB) 配备 24 GB 专用显存与 672 GB/s 显存带宽,支持 CUDA 和 TensorRT-LLM 运行环境,可进行全精度与量化大模型推理。
总显存
24 GB
可用显存上限
24 GB
显存带宽
672 GB/s
最大推理模型级别
32B 模型 (Q4)
热设计功耗
145W
随上下文长度增长的显存需求评估。当曲线超过参考线时将导致显存不足(OOM)。
量化精度:
主流开源大模型在 NVIDIA RTX PRO 4000 Blackwell (24GB) 上的推理速度、显存兼容性与生成吞吐表现。
排序:
上下文长度:
KV 缓存:
显卡数量:
| 排名 | 模型 | 参数量 | 量化精度 | 预估 TPS | TTFT | 可运行 |
|---|---|---|---|---|---|---|
#33 | Qwen 3.8 27B | 27B | INT4 | 34 tok/s | ~1.9s | |
#48 | Agnes 3.0 Flash | 33B | INT4 | 28 tok/s | ~2.3s | |
#72 | K2 Horizon MoVA 36B A4B | 36B (4B active) | INT4 | 119 tok/s | ~400 ms | |
#83 | Qwen3.5-27B | 27B | INT4 | 34 tok/s | ~1.9s | |
#92 | Sarvam-30B | 32B (2.4B active) | INT4 | 157 tok/s | ~259 ms | |
#94 | Qwen3.6 35B A3B | 35B (3B active) | INT4 | 136 tok/s | ~327 ms | |
#96 | Muse Glimmer 30B | 30B | INT4 | 31 tok/s | ~2.1s | |
#100 | Phi-4 Reasoning Plus | 14B | INT4 Q8 | 44 tok/s 30 tok/s | ~987 ms ~998 ms | |
#101 | MiMo V2 Flash | 15B (309B active) | INT4 Q8 | 3 tok/s 2 tok/s | ~20.3s ~22.3s | |
#108 | Gemma 4 26B A4B | 25.2B (3.8B active) | INT4 | 133 tok/s | ~338 ms | |
#109 | Gemma 4 12B | 11.95B | INT4 Q8 | 50 tok/s 34 tok/s | ~846 ms ~855 ms | |
#113 | Qwen3.5-9B | 9B | INT4 Q8 FP16 | 84 tok/s 53 tok/s 27 tok/s | ~638 ms ~645 ms ~716 ms | |
#114 | Qwen3.5-35B-A3B | 35B (3B active) | INT4 | 136 tok/s | ~327 ms | |
#118 | K2 Horizon 7B | 7B | INT4 Q8 FP16 | 101 tok/s 65 tok/s 36 tok/s | ~501 ms ~506 ms ~519 ms | |
#128 | NVIDIA Nemotron 3 Nano 30B-A3B | 3.5B (30B active) | INT4 Q8 FP16 | 29 tok/s 17 tok/s 9 tok/s | ~2.0s ~2.0s ~2.1s | |
#129 | Gemma 4 31B | 30.7B | INT4 | 30 tok/s | ~2.1s | |
#131 | Nemotron 3.5 Lightning | 30B (3B active) | INT4 | 58 tok/s | ~330 ms | |
#132 | Qwen3.5-4B | 4B | INT4 Q8 FP16 | 145 tok/s 99 tok/s 59 tok/s | ~296 ms ~299 ms ~306 ms | |
#133 | Qwen3-30B-A3B | 30B (3B active) | INT4 | 145 tok/s | ~296 ms | |
#136 | GPT-OSS 20B | 21B (3.6B active) | INT4 | 68 tok/s | ~324 ms | |
#146 | Granite 4.2 8B | 8B | INT4 Q8 FP16 | 92 tok/s 58 tok/s 32 tok/s | ~569 ms ~575 ms ~589 ms | |
#150 | Gemma 4 E4B | 8B | INT4 Q8 FP16 | 92 tok/s 58 tok/s 32 tok/s | ~569 ms ~575 ms ~589 ms | |
#151 | Nemotron 3.5 Lightning 30B A3B | 30B (3B active) | INT4 | 145 tok/s | ~296 ms | |
#153 | Qwen3-32B | 32B | INT4 | 29 tok/s | ~2.2s | |
#156 | GLM-4 | 32B | INT4 | 20 tok/s | ~2.6s | |
#158 | GLM-4V | 9B | INT4 Q8 FP16 | 62 tok/s 44 tok/s 25 tok/s | ~642 ms ~649 ms ~721 ms | |
#159 | Gemma 3 27B | 27B | INT4 | 34 tok/s | ~1.9s | |
#160 | Phi-4 | 14B | INT4 Q8 | 59 tok/s 36 tok/s | ~981 ms ~993 ms | |
#162 | DeepSeek-R1 32B | 32B | INT4 | 30 tok/s | ~2.2s | |
#164 | Qwen2.5-32B | 32B | INT4 | 29 tok/s | ~2.2s | |
#168 | Magistral Small | 24B | INT4 | 29 tok/s | ~1.7s | |
#169 | OLMo 3 7B Think | 7B | INT4 Q8 FP16 | 74 tok/s 53 tok/s 32 tok/s | ~504 ms ~510 ms ~522 ms | |
#170 | OLMo 3.1 32B Instruct | 32B | INT4 | 20 tok/s | ~2.6s | |
#172 | DeepSeek-R1 14B | 14B | INT4 Q8 | 61 tok/s 36 tok/s | ~981 ms ~992 ms | |
#173 | Ministral 3 14B | 14B | INT4 Q8 | 44 tok/s 30 tok/s | ~987 ms ~998 ms | |
#177 | Gemma 3 12B | 12B | INT4 Q8 FP16 | 67 tok/s 41 tok/s 20 tok/s | ~844 ms ~854 ms ~1.0s | |
#180 | OLMo 3 32B Base | 32B | INT4 | 20 tok/s | ~2.6s | |
#181 | Mistral-Small-2501 | 24B | INT4 | 37 tok/s | ~1.7s | |
#182 | Ministral 3 8B | 8B | INT4 Q8 FP16 | 68 tok/s 48 tok/s 27 tok/s | ~573 ms ~579 ms ~642 ms | |
#183 | Qwen3.5-2B | 2B | INT4 Q8 FP16 | 203 tok/s 154 tok/s 100 tok/s | ~160 ms ~162 ms ~165 ms | |
#184 | MiniCPM5-2B | 2B | INT4 Q8 FP16 | 203 tok/s 154 tok/s 100 tok/s | ~160 ms ~162 ms ~165 ms | |
#185 | Qwen2.5-14B | 14B | INT4 Q8 | 59 tok/s 36 tok/s | ~981 ms ~993 ms | |
#186 | Gemma 2 27B | 27B | INT4 | 34 tok/s | ~1.9s | |
#187 | OLMo 3.1 32B Think | 32B | INT4 | 20 tok/s | ~2.6s | |
#188 | Gemma 4 E2B | 5.1B | INT4 Q8 FP16 | 125 tok/s 83 tok/s 48 tok/s | ~371 ms ~375 ms ~384 ms | |
#189 | Qwen3-4B | 4B | INT4 Q8 FP16 | 145 tok/s 99 tok/s 59 tok/s | ~296 ms ~299 ms ~306 ms | |
#190 | DeepSeek-R1 8B | 8B | INT4 Q8 FP16 | 94 tok/s 59 tok/s 32 tok/s | ~569 ms ~575 ms ~589 ms | |
#193 | Ministral 3 3B | 3B | INT4 Q8 FP16 | 120 tok/s 95 tok/s 63 tok/s | ~231 ms ~233 ms ~238 ms | |
#195 | Qwen3-14B | 14B | INT4 Q8 | 59 tok/s 36 tok/s | ~981 ms ~993 ms | |
#197 | Gemma 2 9B | 9B | INT4 Q8 FP16 | 84 tok/s 53 tok/s 27 tok/s | ~638 ms ~645 ms ~716 ms | |
#198 | Qwen2.5-7B | 7B | INT4 Q8 FP16 | 101 tok/s 65 tok/s 36 tok/s | ~501 ms ~506 ms ~519 ms | |
#199 | Qwen3-8B | 8B | INT4 Q8 FP16 | 92 tok/s 58 tok/s 32 tok/s | ~569 ms ~575 ms ~589 ms | |
#200 | Gemma 3 4B | 4B | INT4 Q8 FP16 | 145 tok/s 99 tok/s 59 tok/s | ~296 ms ~299 ms ~306 ms | |
#201 | DeepSeek-R1 7B | 7B | INT4 Q8 FP16 | 104 tok/s 66 tok/s 36 tok/s | ~500 ms ~506 ms ~518 ms | |
#202 | Llama 3.1 8B | 8B | INT4 Q8 FP16 | 92 tok/s 58 tok/s 32 tok/s | ~569 ms ~575 ms ~589 ms | |
#204 | Qwen3-1.7B | 1.7B | INT4 Q8 FP16 | 217 tok/s 168 tok/s 112 tok/s | ~138 ms ~139 ms ~142 ms | |
#205 | Command R | 35B | INT4 | 19 tok/s | ~2.8s | |
#206 | Gemma 3 270M | 0.27B | INT4 Q8 FP16 | 311 tok/s 293 tok/s 257 tok/s | ~28 ms ~28 ms ~29 ms | |
#208 | Llama 3 8B | 8B | INT4 Q8 FP16 | 92 tok/s 58 tok/s 32 tok/s | ~569 ms ~575 ms ~589 ms | |
#209 | Qwen3-0.6B | 0.6B | INT4 Q8 FP16 | 298 tok/s 261 tok/s 205 tok/s | ~53 ms ~54 ms ~55 ms | |
#210 | Phi-4-Mini | 3.8B | INT4 Q8 FP16 | 149 tok/s 103 tok/s 61 tok/s | ~283 ms ~286 ms ~292 ms | |
#212 | Ministral-8B-2410 | 8B | INT4 Q8 FP16 | 92 tok/s 58 tok/s 32 tok/s | ~569 ms ~575 ms ~589 ms | |
#213 | DeepSeek-R1 1.5B | 1.5B | INT4 Q8 FP16 | 228 tok/s 180 tok/s 122 tok/s | ~123 ms ~124 ms ~127 ms | |
#214 | Llama 3.2 3B | 3B | INT4 Q8 FP16 | 169 tok/s 121 tok/s 74 tok/s | ~228 ms ~230 ms ~236 ms | |
#215 | Qwen3.5-0.8B | 0.8B | INT4 Q8 FP16 | 278 tok/s 237 tok/s 178 tok/s | ~69 ms ~70 ms ~71 ms | |
#216 | Phi-3-mini | 3.8B | INT4 Q8 FP16 | 149 tok/s 103 tok/s 61 tok/s | ~283 ms ~286 ms ~292 ms | |
#217 | Gemma 3n E2B IT | 6B (2B active) | INT4 Q8 FP16 | 119 tok/s 103 tok/s 76 tok/s | ~174 ms ~175 ms ~179 ms | |
#218 | Mistral-7B-Instruct-v0.1 | 7.3B | INT4 Q8 FP16 | 98 tok/s 63 tok/s 35 tok/s | ~521 ms ~527 ms ~539 ms | |
#219 | Llama 3.2 1B | 1B | INT4 Q8 FP16 | 260 tok/s 216 tok/s 157 tok/s | ~86 ms ~87 ms ~89 ms | |
#220 | Gemma 2 2B | 2B | INT4 Q8 FP16 | 203 tok/s 154 tok/s 100 tok/s | ~160 ms ~162 ms ~165 ms | |
#221 | Phi-3-medium | 14B | INT4 Q8 | 59 tok/s 36 tok/s | ~981 ms ~993 ms | |
#222 | OLMo 3 7B Instruct | 7B | INT4 Q8 FP16 | 74 tok/s 53 tok/s 32 tok/s | ~504 ms ~510 ms ~522 ms | |
#223 | Yi-34B | 34B | INT4 | 19 tok/s | ~2.7s | |
#224 | Qwen2-7B | 7B | INT4 Q8 FP16 | 101 tok/s 65 tok/s 36 tok/s | ~501 ms ~506 ms ~519 ms | |
#225 | Phi-3-small | 7B | INT4 Q8 FP16 | 101 tok/s 65 tok/s 36 tok/s | ~501 ms ~506 ms ~519 ms | |
#226 | Gemma 3 1B | 1B | INT4 Q8 FP16 | 260 tok/s 216 tok/s 157 tok/s | ~86 ms ~87 ms ~89 ms | |
#227 | Mistral-7B-Instruct-v0.2 | 7.3B | INT4 Q8 FP16 | 98 tok/s 63 tok/s 35 tok/s | ~521 ms ~527 ms ~539 ms | |
#229 | Gemma 1 7B | 7B | INT4 Q8 FP16 | 74 tok/s 53 tok/s 32 tok/s | ~504 ms ~510 ms ~522 ms | |
#230 | Gemma 1 2B | 2B | INT4 Q8 FP16 | 214 tok/s 159 tok/s 102 tok/s | ~160 ms ~162 ms ~165 ms | |
#231 | ChatGLM3-6B | 6B | INT4 Q8 FP16 | 82 tok/s 60 tok/s 37 tok/s | ~436 ms ~440 ms ~451 ms | |
#232 | ChatGLM2-6B | 6B | INT4 Q8 FP16 | 82 tok/s 60 tok/s 37 tok/s | ~436 ms ~440 ms ~451 ms | |
#233 | ChatGLM-6B | 6B | INT4 Q8 FP16 | 82 tok/s 60 tok/s 37 tok/s | ~436 ms ~440 ms ~451 ms | |
未上榜模型(按推理速度排序) | ||||||
- | Qwen2-0.5B | 0.5B | INT4 Q8 FP16 | 308 tok/s 275 tok/s 221 tok/s | ~45 ms ~46 ms ~46 ms | |
- | Qwen2.5-0.5B | 0.5B | INT4 Q8 FP16 | 308 tok/s 275 tok/s 221 tok/s | ~45 ms ~46 ms ~46 ms | |
- | ERNIE-4.5-0.3B | 0.3B | INT4 Q8 FP16 | 304 tok/s 285 tok/s 248 tok/s | ~30 ms ~30 ms ~31 ms | |
- | ERNIE-4.5-0.3B-Base | 0.3B | INT4 Q8 FP16 | 304 tok/s 285 tok/s 248 tok/s | ~30 ms ~30 ms ~31 ms | |
- | Falcon-1B | 1B | INT4 Q8 FP16 | 270 tok/s 223 tok/s 160 tok/s | ~86 ms ~87 ms ~89 ms | |
- | Falcon3-1B | 1B | INT4 Q8 FP16 | 260 tok/s 216 tok/s 157 tok/s | ~86 ms ~87 ms ~89 ms | |
- | Qwen2-1.5B | 1.5B | INT4 Q8 FP16 | 228 tok/s 180 tok/s 122 tok/s | ~123 ms ~124 ms ~127 ms | |
- | Qwen2.5-1.5B | 1.5B | INT4 Q8 FP16 | 228 tok/s 180 tok/s 122 tok/s | ~123 ms ~124 ms ~127 ms | |
- | Spark X2.5 1.7B | 1.7B | INT4 Q8 FP16 | 217 tok/s 168 tok/s 112 tok/s | ~138 ms ~139 ms ~142 ms | |
- | Hy-MT2 1.8B | 1.8B | INT4 Q8 FP16 | 213 tok/s 164 tok/s 108 tok/s | ~145 ms ~147 ms ~150 ms | |
- | Falcon-3B | 3B | INT4 Q8 FP16 | 177 tok/s 125 tok/s 75 tok/s | ~228 ms ~230 ms ~235 ms | |
- | CroissantLLM Base | 1.3B | INT4 Q8 FP16 | 175 tok/s 151 tok/s 112 tok/s | ~110 ms ~110 ms ~113 ms | |
- | Phi-1 | 1.3B | INT4 Q8 FP16 | 175 tok/s 151 tok/s 112 tok/s | ~110 ms ~110 ms ~113 ms | |
- | Phi-1.5 | 1.3B | INT4 Q8 FP16 | 175 tok/s 151 tok/s 112 tok/s | ~110 ms ~110 ms ~113 ms | |
- | DeepSeek-R1 3B | 3B | INT4 Q8 FP16 | 171 tok/s 122 tok/s 74 tok/s | ~228 ms ~230 ms ~236 ms | |
- | Falcon3-3B | 3B | INT4 Q8 FP16 | 169 tok/s 121 tok/s 74 tok/s | ~228 ms ~230 ms ~236 ms | |
- | Qwen2.5-3B | 3B | INT4 Q8 FP16 | 169 tok/s 121 tok/s 74 tok/s | ~228 ms ~230 ms ~236 ms | |
- | ERNIE-4.5-21B-A3B | 21B (3B active) | INT4 Q8 | 151 tok/s 101 tok/s | ~277 ms ~327 ms | |
- | ERNIE-4.5-21B-A3B-Base | 21B (3B active) | INT4 Q8 | 151 tok/s 101 tok/s | ~277 ms ~327 ms | |
- | ERNIE-4.5-VL-28B-A3B | 28B (3B active) | INT4 | 146 tok/s | ~291 ms | |
- | ERNIE-4.5-VL-28B-A3B-Base | 28B (3B active) | INT4 | 146 tok/s | ~291 ms | |
- | Hy-MT2 30B A3B | 30B (3B active) | INT4 | 145 tok/s | ~296 ms | |
- | Spark X2.5 4B | 4B | INT4 Q8 FP16 | 145 tok/s 99 tok/s 59 tok/s | ~296 ms ~299 ms ~306 ms | |
- | Phi-2 | 2.7B | INT4 Q8 FP16 | 125 tok/s 101 tok/s 68 tok/s | ~210 ms ~212 ms ~217 ms | |
- | MaLLaM-3B | 3B | INT4 Q8 FP16 | 120 tok/s 95 tok/s 63 tok/s | ~231 ms ~233 ms ~238 ms | |
- | SmolLM3 3B | 3B | INT4 Q8 FP16 | 120 tok/s 95 tok/s 63 tok/s | ~231 ms ~233 ms ~238 ms | |
- | Falcon-7B | 7B | INT4 Q8 FP16 | 105 tok/s 66 tok/s 37 tok/s | ~500 ms ~506 ms ~518 ms | |
- | Falcon3-7B | 7B | INT4 Q8 FP16 | 101 tok/s 65 tok/s 36 tok/s | ~501 ms ~506 ms ~519 ms | |
- | Hy-MT2 7B | 7B | INT4 Q8 FP16 | 101 tok/s 65 tok/s 36 tok/s | ~501 ms ~506 ms ~519 ms | |
- | Mistral-7B-v0.1 | 7.3B | INT4 Q8 FP16 | 98 tok/s 63 tok/s 35 tok/s | ~521 ms ~527 ms ~539 ms | |
- | LensVLM 9B | 9B | INT4 Q8 FP16 | 84 tok/s 53 tok/s 27 tok/s | ~638 ms ~645 ms ~716 ms | |
- | MiMo V2.6 Distill Qwen 9B | 9B | INT4 Q8 FP16 | 84 tok/s 53 tok/s 27 tok/s | ~638 ms ~645 ms ~716 ms | |
- | ChatGLM3-6B-32K | 6B | INT4 Q8 FP16 | 82 tok/s 60 tok/s 37 tok/s | ~436 ms ~440 ms ~451 ms | |
- | Yi-6B | 6B | INT4 Q8 FP16 | 82 tok/s 60 tok/s 37 tok/s | ~436 ms ~440 ms ~451 ms | |
- | Falcon3-10B | 10B | INT4 Q8 FP16 | 78 tok/s 48 tok/s 25 tok/s | ~706 ms ~714 ms ~793 ms | |
- | Kimi-VL-A3B-Instruct | 16B (3B active) | INT4 Q8 | 78 tok/s 65 tok/s | ~273 ms ~297 ms | |
- | Falcon2-11B | 11B | INT4 Q8 FP16 | 75 tok/s 45 tok/s 22 tok/s | ~774 ms ~783 ms ~939 ms | |
- | Hunyuan Lite | 7B | INT4 Q8 FP16 | 74 tok/s 53 tok/s 32 tok/s | ~504 ms ~510 ms ~522 ms | |
- | OLMo 3 7B Base | 7B | INT4 Q8 FP16 | 74 tok/s 53 tok/s 32 tok/s | ~504 ms ~510 ms ~522 ms | |
- | SEA-LION-7B | 7.1B | INT4 Q8 FP16 | 74 tok/s 53 tok/s 32 tok/s | ~511 ms ~516 ms ~529 ms | |
- | SEA-LION-7B-Instruct | 7.1B | INT4 Q8 FP16 | 74 tok/s 53 tok/s 32 tok/s | ~511 ms ~516 ms ~529 ms | |
- | Sahabat-AI-Llama3-8B-Instruct | 8B | INT4 Q8 FP16 | 68 tok/s 48 tok/s 27 tok/s | ~573 ms ~579 ms ~642 ms | |
- | Typhoon-2-8B | 8B | INT4 Q8 FP16 | 68 tok/s 48 tok/s 27 tok/s | ~573 ms ~579 ms ~642 ms | |
- | GLM-4-9B | 9B | INT4 Q8 FP16 | 62 tok/s 44 tok/s 25 tok/s | ~642 ms ~649 ms ~721 ms | |
- | GLM-4-9B-Chat | 9B | INT4 Q8 FP16 | 62 tok/s 44 tok/s 25 tok/s | ~642 ms ~649 ms ~721 ms | |
- | GLM-4-9B-Chat-1M | 9B | INT4 Q8 FP16 | 62 tok/s 44 tok/s 25 tok/s | ~642 ms ~649 ms ~721 ms | |
- | Yi-9B | 9B | INT4 Q8 FP16 | 62 tok/s 44 tok/s 25 tok/s | ~642 ms ~649 ms ~721 ms | |
- | Sahabat-AI-Gemma2-9B | 9.2B | INT4 Q8 FP16 | 61 tok/s 43 tok/s 24 tok/s | ~656 ms ~663 ms ~736 ms | |
- | Sahabat-AI-Gemma2-9B-Instruct | 9.2B | INT4 Q8 FP16 | 61 tok/s 43 tok/s 24 tok/s | ~656 ms ~663 ms ~736 ms | |
- | GreenMind-14B-R1 | 14B | INT4 Q8 | 44 tok/s 30 tok/s | ~987 ms ~998 ms | |
- | Falcon-40B | 40B | INT4 | 23 tok/s | ~3.0s | |
不同量化精度下可运行的最大模型参数级别。
上下文长度:
4位量化
32B 模型
8位精度
14B 模型
16位全精度
8B 模型
本地模型训练与适配器微调支持能力。
微调上下文:
QLoRA
32B 模型
LoRA
14B 模型
全参数微调
3B 模型
NVIDIA RTX PRO 4000 Blackwell (24GB) 上的最佳量化精度与运行规格建议。
最佳推理区间
适合在全精度或 Q8 精度下运行 14B 模型,以及在 Q4 精度下搭配最高 32k 上下文运行 32B 模型。
显存带宽与推理速率
具备 672 GB/s 聚合带宽,单批次推理处于显存带宽受限模式。8B Q4 模型预估生成速度约 149 tok/s,70B Q4 模型预估生成速度约 18 tok/s。
Assistant
在线