趋近智
NVIDIA RTX 4500 Blackwell (32GB) 配备 32 GB 专用显存与 896 GB/s 显存带宽,支持 CUDA 和 TensorRT-LLM 运行环境,可进行全精度与量化大模型推理。
总显存
32 GB
可用显存上限
32 GB
显存带宽
896 GB/s
最大推理模型级别
32B 模型 (Q4)
热设计功耗
175W
随上下文长度增长的显存需求评估。当曲线超过参考线时将导致显存不足(OOM)。
量化精度:
主流开源大模型在 NVIDIA RTX 4500 Blackwell (32GB) 上的推理速度、显存兼容性与生成吞吐表现。
排序:
上下文长度:
KV 缓存:
显卡数量:
| 排名 | 模型 | 参数量 | 量化精度 | 预估 TPS | TTFT | 可运行 |
|---|---|---|---|---|---|---|
#33 | Qwen 3.8 27B | 27B | INT4 Q8 | 44 tok/s 24 tok/s | ~1.5s ~1.6s | |
#48 | Agnes 3.0 Flash | 33B | INT4 | 37 tok/s | ~1.8s | |
#72 | K2 Horizon MoVA 36B A4B | 36B (4B active) | INT4 | 150 tok/s | ~293 ms | |
#83 | Qwen3.5-27B | 27B | INT4 Q8 | 44 tok/s 24 tok/s | ~1.5s ~1.6s | |
#92 | Sarvam-30B | 32B (2.4B active) | INT4 | 184 tok/s | ~206 ms | |
#94 | Qwen3.6 35B A3B | 35B (3B active) | INT4 | 169 tok/s | ~239 ms | |
#96 | Muse Glimmer 30B | 30B | INT4 Q8 | 40 tok/s 21 tok/s | ~1.6s ~1.9s | |
#100 | Phi-4 Reasoning Plus | 14B | INT4 Q8 FP16 | 56 tok/s 39 tok/s 20 tok/s | ~781 ms ~789 ms ~944 ms | |
#101 | MiMo V2 Flash | 15B (309B active) | INT4 Q8 | 4 tok/s 2 tok/s | ~16.0s ~16.2s | |
#108 | Gemma 4 26B A4B | 25.2B (3.8B active) | INT4 Q8 | 158 tok/s 112 tok/s | ~268 ms ~293 ms | |
#109 | Gemma 4 12B | 11.95B | INT4 Q8 FP16 | 64 tok/s 44 tok/s 25 tok/s | ~669 ms ~676 ms ~750 ms | |
#113 | Qwen3.5-9B | 9B | INT4 Q8 FP16 | 104 tok/s 67 tok/s 37 tok/s | ~505 ms ~510 ms ~522 ms | |
#114 | Qwen3.5-35B-A3B | 35B (3B active) | INT4 | 169 tok/s | ~239 ms | |
#118 | K2 Horizon 7B | 7B | INT4 Q8 FP16 | 124 tok/s 82 tok/s 47 tok/s | ~397 ms ~401 ms ~410 ms | |
#128 | NVIDIA Nemotron 3 Nano 30B-A3B | 3.5B (30B active) | INT4 Q8 FP16 | 38 tok/s 23 tok/s 12 tok/s | ~1.6s ~1.6s ~1.6s | |
#129 | Gemma 4 31B | 30.7B | INT4 Q8 | 39 tok/s 20 tok/s | ~1.7s ~2.0s | |
#131 | Nemotron 3.5 Lightning | 30B (3B active) | INT4 | 78 tok/s | ~242 ms | |
#132 | Qwen3.5-4B | 4B | INT4 Q8 FP16 | 171 tok/s 122 tok/s 74 tok/s | ~235 ms ~238 ms ~243 ms | |
#133 | Qwen3-30B-A3B | 30B (3B active) | INT4 Q8 | 171 tok/s 119 tok/s | ~235 ms ~277 ms | |
#136 | GPT-OSS 20B | 21B (3.6B active) | INT4 Q8 | 86 tok/s 71 tok/s | ~257 ms ~280 ms | |
#146 | Granite 4.2 8B | 8B | INT4 Q8 FP16 | 113 tok/s 74 tok/s 42 tok/s | ~450 ms ~455 ms ~466 ms | |
#150 | Gemma 4 E4B | 8B | INT4 Q8 FP16 | 113 tok/s 74 tok/s 42 tok/s | ~450 ms ~455 ms ~466 ms | |
#151 | Nemotron 3.5 Lightning 30B A3B | 30B (3B active) | INT4 Q8 | 171 tok/s 119 tok/s | ~235 ms ~277 ms | |
#153 | Qwen3-32B | 32B | INT4 | 38 tok/s | ~1.7s | |
#155 | Mistral Large 3 | 41B (675B active) | INT4 | 2 tok/s | ~41.0s | |
#156 | GLM-4 | 32B | INT4 | 30 tok/s | ~1.7s | |
#158 | GLM-4V | 9B | INT4 Q8 FP16 | 78 tok/s 56 tok/s 34 tok/s | ~508 ms ~513 ms ~525 ms | |
#159 | Gemma 3 27B | 27B | INT4 Q8 | 44 tok/s 24 tok/s | ~1.5s ~1.6s | |
#160 | Phi-4 | 14B | INT4 Q8 FP16 | 75 tok/s 46 tok/s 24 tok/s | ~776 ms ~785 ms ~870 ms | |
#162 | DeepSeek-R1 32B | 32B | INT4 Q8 | 39 tok/s 20 tok/s | ~1.7s ~2.1s | |
#164 | Qwen2.5-32B | 32B | INT4 | 38 tok/s | ~1.7s | |
#168 | Magistral Small | 24B | INT4 Q8 | 37 tok/s 23 tok/s | ~1.3s ~1.4s | |
#169 | OLMo 3 7B Think | 7B | INT4 Q8 FP16 | 93 tok/s 68 tok/s 42 tok/s | ~399 ms ~403 ms ~413 ms | |
#170 | OLMo 3.1 32B Instruct | 32B | INT4 | 30 tok/s | ~1.7s | |
#172 | DeepSeek-R1 14B | 14B | INT4 Q8 FP16 | 77 tok/s 47 tok/s 24 tok/s | ~776 ms ~784 ms ~870 ms | |
#173 | Ministral 3 14B | 14B | INT4 Q8 FP16 | 56 tok/s 39 tok/s 20 tok/s | ~781 ms ~789 ms ~944 ms | |
#177 | Gemma 3 12B | 12B | INT4 Q8 FP16 | 85 tok/s 53 tok/s 29 tok/s | ~668 ms ~675 ms ~691 ms | |
#180 | OLMo 3 32B Base | 32B | INT4 | 30 tok/s | ~1.7s | |
#181 | Mistral-Small-2501 | 24B | INT4 Q8 | 48 tok/s 27 tok/s | ~1.3s ~1.4s | |
#182 | Ministral 3 8B | 8B | INT4 Q8 FP16 | 85 tok/s 62 tok/s 37 tok/s | ~453 ms ~458 ms ~468 ms | |
#183 | Qwen3.5-2B | 2B | INT4 Q8 FP16 | 229 tok/s 180 tok/s 122 tok/s | ~128 ms ~129 ms ~132 ms | |
#184 | MiniCPM5-2B | 2B | INT4 Q8 FP16 | 229 tok/s 180 tok/s 122 tok/s | ~128 ms ~129 ms ~132 ms | |
#185 | Qwen2.5-14B | 14B | INT4 Q8 FP16 | 75 tok/s 46 tok/s 24 tok/s | ~776 ms ~785 ms ~870 ms | |
#186 | Gemma 2 27B | 27B | INT4 Q8 | 44 tok/s 24 tok/s | ~1.5s ~1.6s | |
#187 | OLMo 3.1 32B Think | 32B | INT4 | 30 tok/s | ~1.7s | |
#188 | Gemma 4 E2B | 5.1B | INT4 Q8 FP16 | 150 tok/s 103 tok/s 61 tok/s | ~295 ms ~298 ms ~304 ms | |
#189 | Qwen3-4B | 4B | INT4 Q8 FP16 | 171 tok/s 122 tok/s 74 tok/s | ~235 ms ~238 ms ~243 ms | |
#190 | DeepSeek-R1 8B | 8B | INT4 Q8 FP16 | 116 tok/s 75 tok/s 42 tok/s | ~450 ms ~455 ms ~466 ms | |
#193 | Ministral 3 3B | 3B | INT4 Q8 FP16 | 144 tok/s 117 tok/s 80 tok/s | ~183 ms ~185 ms ~189 ms | |
#195 | Qwen3-14B | 14B | INT4 Q8 FP16 | 75 tok/s 46 tok/s 24 tok/s | ~776 ms ~785 ms ~870 ms | |
#196 | Kimi Linear 48B A3B Instruct | 48B (3B active) | INT4 | 60 tok/s | ~306 ms | |
#197 | Gemma 2 9B | 9B | INT4 Q8 FP16 | 104 tok/s 67 tok/s 37 tok/s | ~505 ms ~510 ms ~522 ms | |
#198 | Qwen2.5-7B | 7B | INT4 Q8 FP16 | 124 tok/s 82 tok/s 47 tok/s | ~397 ms ~401 ms ~410 ms | |
#199 | Qwen3-8B | 8B | INT4 Q8 FP16 | 113 tok/s 74 tok/s 42 tok/s | ~450 ms ~455 ms ~466 ms | |
#200 | Gemma 3 4B | 4B | INT4 Q8 FP16 | 171 tok/s 122 tok/s 74 tok/s | ~235 ms ~238 ms ~243 ms | |
#201 | DeepSeek-R1 7B | 7B | INT4 Q8 FP16 | 126 tok/s 83 tok/s 47 tok/s | ~397 ms ~401 ms ~410 ms | |
#202 | Llama 3.1 8B | 8B | INT4 Q8 FP16 | 113 tok/s 74 tok/s 42 tok/s | ~450 ms ~455 ms ~466 ms | |
#204 | Qwen3-1.7B | 1.7B | INT4 Q8 FP16 | 242 tok/s 195 tok/s 136 tok/s | ~111 ms ~112 ms ~114 ms | |
#205 | Command R | 35B | INT4 | 28 tok/s | ~1.9s | |
#206 | Gemma 3 270M | 0.27B | INT4 Q8 FP16 | 324 tok/s 309 tok/s 279 tok/s | ~24 ms ~24 ms ~24 ms | |
#208 | Llama 3 8B | 8B | INT4 Q8 FP16 | 113 tok/s 74 tok/s 42 tok/s | ~450 ms ~455 ms ~466 ms | |
#209 | Qwen3-0.6B | 0.6B | INT4 Q8 FP16 | 313 tok/s 282 tok/s 231 tok/s | ~44 ms ~44 ms ~45 ms | |
#210 | Phi-4-Mini | 3.8B | INT4 Q8 FP16 | 175 tok/s 126 tok/s 77 tok/s | ~225 ms ~227 ms ~232 ms | |
#211 | Mixtral-8x7B-v0.1 | 46.7B (7B active) | INT4 | 106 tok/s | ~498 ms | |
#212 | Ministral-8B-2410 | 8B | INT4 Q8 FP16 | 113 tok/s 74 tok/s 42 tok/s | ~450 ms ~455 ms ~466 ms | |
#213 | DeepSeek-R1 1.5B | 1.5B | INT4 Q8 FP16 | 253 tok/s 206 tok/s 147 tok/s | ~99 ms ~100 ms ~102 ms | |
#214 | Llama 3.2 3B | 3B | INT4 Q8 FP16 | 196 tok/s 145 tok/s 92 tok/s | ~182 ms ~183 ms ~187 ms | |
#215 | Qwen3.5-0.8B | 0.8B | INT4 Q8 FP16 | 297 tok/s 260 tok/s 204 tok/s | ~56 ms ~57 ms ~58 ms | |
#216 | Phi-3-mini | 3.8B | INT4 Q8 FP16 | 175 tok/s 126 tok/s 77 tok/s | ~225 ms ~227 ms ~232 ms | |
#217 | Gemma 3n E2B IT | 6B (2B active) | INT4 Q8 FP16 | 144 tok/s 126 tok/s 95 tok/s | ~139 ms ~140 ms ~142 ms | |
#218 | Mistral-7B-Instruct-v0.1 | 7.3B | INT4 Q8 FP16 | 121 tok/s 79 tok/s 45 tok/s | ~413 ms ~417 ms ~427 ms | |
#219 | Llama 3.2 1B | 1B | INT4 Q8 FP16 | 281 tok/s 241 tok/s 183 tok/s | ~70 ms ~70 ms ~72 ms | |
#220 | Gemma 2 2B | 2B | INT4 Q8 FP16 | 229 tok/s 180 tok/s 122 tok/s | ~128 ms ~129 ms ~132 ms | |
#221 | Phi-3-medium | 14B | INT4 Q8 FP16 | 75 tok/s 46 tok/s 24 tok/s | ~776 ms ~785 ms ~870 ms | |
#222 | OLMo 3 7B Instruct | 7B | INT4 Q8 FP16 | 93 tok/s 68 tok/s 42 tok/s | ~399 ms ~403 ms ~413 ms | |
#223 | Yi-34B | 34B | INT4 | 28 tok/s | ~1.8s | |
#224 | Qwen2-7B | 7B | INT4 Q8 FP16 | 124 tok/s 82 tok/s 47 tok/s | ~397 ms ~401 ms ~410 ms | |
#225 | Phi-3-small | 7B | INT4 Q8 FP16 | 124 tok/s 82 tok/s 47 tok/s | ~397 ms ~401 ms ~410 ms | |
#226 | Gemma 3 1B | 1B | INT4 Q8 FP16 | 281 tok/s 241 tok/s 183 tok/s | ~70 ms ~70 ms ~72 ms | |
#227 | Mistral-7B-Instruct-v0.2 | 7.3B | INT4 Q8 FP16 | 121 tok/s 79 tok/s 45 tok/s | ~413 ms ~417 ms ~427 ms | |
#229 | Gemma 1 7B | 7B | INT4 Q8 FP16 | 93 tok/s 68 tok/s 42 tok/s | ~399 ms ~403 ms ~413 ms | |
#230 | Gemma 1 2B | 2B | INT4 Q8 FP16 | 239 tok/s 186 tok/s 125 tok/s | ~128 ms ~129 ms ~132 ms | |
#231 | ChatGLM3-6B | 6B | INT4 Q8 FP16 | 102 tok/s 76 tok/s 47 tok/s | ~345 ms ~349 ms ~357 ms | |
#232 | ChatGLM2-6B | 6B | INT4 Q8 FP16 | 102 tok/s 76 tok/s 47 tok/s | ~345 ms ~349 ms ~357 ms | |
#233 | ChatGLM-6B | 6B | INT4 Q8 FP16 | 102 tok/s 76 tok/s 47 tok/s | ~345 ms ~349 ms ~357 ms | |
未上榜模型(按推理速度排序) | ||||||
- | Qwen2-0.5B | 0.5B | INT4 Q8 FP16 | 322 tok/s 294 tok/s 246 tok/s | ~37 ms ~38 ms ~38 ms | |
- | Qwen2.5-0.5B | 0.5B | INT4 Q8 FP16 | 322 tok/s 294 tok/s 246 tok/s | ~37 ms ~38 ms ~38 ms | |
- | ERNIE-4.5-0.3B | 0.3B | INT4 Q8 FP16 | 318 tok/s 303 tok/s 270 tok/s | ~25 ms ~26 ms ~26 ms | |
- | ERNIE-4.5-0.3B-Base | 0.3B | INT4 Q8 FP16 | 318 tok/s 303 tok/s 270 tok/s | ~25 ms ~26 ms ~26 ms | |
- | Falcon-1B | 1B | INT4 Q8 FP16 | 290 tok/s 247 tok/s 187 tok/s | ~69 ms ~70 ms ~71 ms | |
- | Falcon3-1B | 1B | INT4 Q8 FP16 | 281 tok/s 241 tok/s 183 tok/s | ~70 ms ~70 ms ~72 ms | |
- | Qwen2-1.5B | 1.5B | INT4 Q8 FP16 | 253 tok/s 206 tok/s 147 tok/s | ~99 ms ~100 ms ~102 ms | |
- | Qwen2.5-1.5B | 1.5B | INT4 Q8 FP16 | 253 tok/s 206 tok/s 147 tok/s | ~99 ms ~100 ms ~102 ms | |
- | Spark X2.5 1.7B | 1.7B | INT4 Q8 FP16 | 242 tok/s 195 tok/s 136 tok/s | ~111 ms ~112 ms ~114 ms | |
- | Hy-MT2 1.8B | 1.8B | INT4 Q8 FP16 | 238 tok/s 190 tok/s 131 tok/s | ~116 ms ~117 ms ~120 ms | |
- | Falcon-3B | 3B | INT4 Q8 FP16 | 204 tok/s 149 tok/s 94 tok/s | ~181 ms ~183 ms ~187 ms | |
- | CroissantLLM Base | 1.3B | INT4 Q8 FP16 | 201 tok/s 177 tok/s 136 tok/s | ~88 ms ~89 ms ~90 ms | |
- | Phi-1 | 1.3B | INT4 Q8 FP16 | 201 tok/s 177 tok/s 136 tok/s | ~88 ms ~89 ms ~90 ms | |
- | Phi-1.5 | 1.3B | INT4 Q8 FP16 | 201 tok/s 177 tok/s 136 tok/s | ~88 ms ~89 ms ~90 ms | |
- | DeepSeek-R1 3B | 3B | INT4 Q8 FP16 | 198 tok/s 146 tok/s 93 tok/s | ~182 ms ~183 ms ~187 ms | |
- | Falcon3-3B | 3B | INT4 Q8 FP16 | 196 tok/s 145 tok/s 92 tok/s | ~182 ms ~183 ms ~187 ms | |
- | Qwen2.5-3B | 3B | INT4 Q8 FP16 | 196 tok/s 145 tok/s 92 tok/s | ~182 ms ~183 ms ~187 ms | |
- | ERNIE-4.5-21B-A3B | 21B (3B active) | INT4 Q8 | 177 tok/s 136 tok/s | ~220 ms ~222 ms | |
- | ERNIE-4.5-21B-A3B-Base | 21B (3B active) | INT4 Q8 | 177 tok/s 136 tok/s | ~220 ms ~222 ms | |
- | ERNIE-4.5-VL-28B-A3B | 28B (3B active) | INT4 Q8 | 172 tok/s 126 tok/s | ~231 ms ~252 ms | |
- | ERNIE-4.5-VL-28B-A3B-Base | 28B (3B active) | INT4 Q8 | 172 tok/s 126 tok/s | ~231 ms ~252 ms | |
- | Hy-MT2 30B A3B | 30B (3B active) | INT4 Q8 | 171 tok/s 119 tok/s | ~235 ms ~277 ms | |
- | Spark X2.5 4B | 4B | INT4 Q8 FP16 | 171 tok/s 122 tok/s 74 tok/s | ~235 ms ~238 ms ~243 ms | |
- | Phi-2 | 2.7B | INT4 Q8 FP16 | 150 tok/s 123 tok/s 86 tok/s | ~167 ms ~169 ms ~172 ms | |
- | MaLLaM-3B | 3B | INT4 Q8 FP16 | 144 tok/s 117 tok/s 80 tok/s | ~183 ms ~185 ms ~189 ms | |
- | SmolLM3 3B | 3B | INT4 Q8 FP16 | 144 tok/s 117 tok/s 80 tok/s | ~183 ms ~185 ms ~189 ms | |
- | Falcon-7B | 7B | INT4 Q8 FP16 | 128 tok/s 84 tok/s 47 tok/s | ~396 ms ~401 ms ~410 ms | |
- | Falcon3-7B | 7B | INT4 Q8 FP16 | 124 tok/s 82 tok/s 47 tok/s | ~397 ms ~401 ms ~410 ms | |
- | Hy-MT2 7B | 7B | INT4 Q8 FP16 | 124 tok/s 82 tok/s 47 tok/s | ~397 ms ~401 ms ~410 ms | |
- | Mistral-7B-v0.1 | 7.3B | INT4 Q8 FP16 | 121 tok/s 79 tok/s 45 tok/s | ~413 ms ~417 ms ~427 ms | |
- | LensVLM 9B | 9B | INT4 Q8 FP16 | 104 tok/s 67 tok/s 37 tok/s | ~505 ms ~510 ms ~522 ms | |
- | MiMo V2.6 Distill Qwen 9B | 9B | INT4 Q8 FP16 | 104 tok/s 67 tok/s 37 tok/s | ~505 ms ~510 ms ~522 ms | |
- | ChatGLM3-6B-32K | 6B | INT4 Q8 FP16 | 102 tok/s 76 tok/s 47 tok/s | ~345 ms ~349 ms ~357 ms | |
- | Yi-6B | 6B | INT4 Q8 FP16 | 102 tok/s 76 tok/s 47 tok/s | ~345 ms ~349 ms ~357 ms | |
- | Falcon3-10B | 10B | INT4 Q8 FP16 | 97 tok/s 61 tok/s 34 tok/s | ~559 ms ~565 ms ~578 ms | |
- | Kimi-VL-A3B-Instruct | 16B (3B active) | INT4 Q8 | 97 tok/s 86 tok/s | ~216 ms ~218 ms | |
- | Falcon2-11B | 11B | INT4 Q8 FP16 | 94 tok/s 58 tok/s 32 tok/s | ~613 ms ~619 ms ~634 ms | |
- | Hunyuan Lite | 7B | INT4 Q8 FP16 | 93 tok/s 68 tok/s 42 tok/s | ~399 ms ~403 ms ~413 ms | |
- | OLMo 3 7B Base | 7B | INT4 Q8 FP16 | 93 tok/s 68 tok/s 42 tok/s | ~399 ms ~403 ms ~413 ms | |
- | SEA-LION-7B | 7.1B | INT4 Q8 FP16 | 92 tok/s 67 tok/s 41 tok/s | ~405 ms ~409 ms ~418 ms | |
- | SEA-LION-7B-Instruct | 7.1B | INT4 Q8 FP16 | 92 tok/s 67 tok/s 41 tok/s | ~405 ms ~409 ms ~418 ms | |
- | Sahabat-AI-Llama3-8B-Instruct | 8B | INT4 Q8 FP16 | 85 tok/s 62 tok/s 37 tok/s | ~453 ms ~458 ms ~468 ms | |
- | Typhoon-2-8B | 8B | INT4 Q8 FP16 | 85 tok/s 62 tok/s 37 tok/s | ~453 ms ~458 ms ~468 ms | |
- | GLM-4-9B | 9B | INT4 Q8 FP16 | 78 tok/s 56 tok/s 34 tok/s | ~508 ms ~513 ms ~525 ms | |
- | GLM-4-9B-Chat | 9B | INT4 Q8 FP16 | 78 tok/s 56 tok/s 34 tok/s | ~508 ms ~513 ms ~525 ms | |
- | GLM-4-9B-Chat-1M | 9B | INT4 Q8 FP16 | 78 tok/s 56 tok/s 34 tok/s | ~508 ms ~513 ms ~525 ms | |
- | Yi-9B | 9B | INT4 Q8 FP16 | 78 tok/s 56 tok/s 34 tok/s | ~508 ms ~513 ms ~525 ms | |
- | Sahabat-AI-Gemma2-9B | 9.2B | INT4 Q8 FP16 | 77 tok/s 55 tok/s 33 tok/s | ~519 ms ~524 ms ~536 ms | |
- | Sahabat-AI-Gemma2-9B-Instruct | 9.2B | INT4 Q8 FP16 | 77 tok/s 55 tok/s 33 tok/s | ~519 ms ~524 ms ~536 ms | |
- | GreenMind-14B-R1 | 14B | INT4 Q8 FP16 | 56 tok/s 39 tok/s 20 tok/s | ~781 ms ~789 ms ~944 ms | |
- | Falcon-40B | 40B | INT4 | 32 tok/s | ~2.2s | |
不同量化精度下可运行的最大模型参数级别。
上下文长度:
4位量化
32B 模型
8位精度
14B 模型
16位全精度
14B 模型
本地模型训练与适配器微调支持能力。
微调上下文:
QLoRA
32B 模型
LoRA
14B 模型
全参数微调
3B 模型
NVIDIA RTX 4500 Blackwell (32GB) 上的最佳量化精度与运行规格建议。
最佳推理区间
适合在全精度或 Q8 精度下运行 14B 模型,以及在 Q4 精度下搭配最高 32k 上下文运行 32B 模型。
显存带宽与推理速率
具备 896 GB/s 聚合带宽,单批次推理处于显存带宽受限模式。8B Q4 模型预估生成速度约 199 tok/s,70B Q4 模型预估生成速度约 24 tok/s。
Assistant
在线