趋近智
NVIDIA RTX 5000 Ada Generation (32GB) 配备 32 GB 专用显存与 576 GB/s 显存带宽,支持 CUDA 和 TensorRT-LLM 运行环境,可进行全精度与量化大模型推理。
总显存
32 GB
可用显存上限
32 GB
显存带宽
576 GB/s
最大推理模型级别
32B 模型 (Q4)
热设计功耗
250W
随上下文长度增长的显存需求评估。当曲线超过参考线时将导致显存不足(OOM)。
量化精度:
主流开源大模型在 NVIDIA RTX 5000 Ada Generation (32GB) 上的推理速度、显存兼容性与生成吞吐表现。
排序:
上下文长度:
KV 缓存:
显卡数量:
| 排名 | 模型 | 参数量 | 量化精度 | 预估 TPS | TTFT | 可运行 |
|---|---|---|---|---|---|---|
#33 | Qwen 3.8 27B | 27B | INT4 Q8 | 29 tok/s 16 tok/s | ~1.2s ~1.3s | |
#48 | Agnes 3.0 Flash | 33B | INT4 | 24 tok/s | ~1.4s | |
#72 | K2 Horizon MoVA 36B A4B | 36B (4B active) | INT4 | 113 tok/s | ~233 ms | |
#83 | Qwen3.5-27B | 27B | INT4 Q8 | 29 tok/s 16 tok/s | ~1.2s ~1.3s | |
#92 | Sarvam-30B | 32B (2.4B active) | INT4 | 143 tok/s | ~164 ms | |
#94 | Qwen3.6 35B A3B | 35B (3B active) | INT4 | 130 tok/s | ~191 ms | |
#96 | Muse Glimmer 30B | 30B | INT4 Q8 | 27 tok/s 14 tok/s | ~1.3s ~1.5s | |
#100 | Phi-4 Reasoning Plus | 14B | INT4 Q8 FP16 | 38 tok/s 26 tok/s 13 tok/s | ~622 ms ~634 ms ~773 ms | |
#101 | MiMo V2 Flash | 15B (309B active) | INT4 Q8 | 3 tok/s 2 tok/s | ~12.7s ~13.0s | |
#108 | Gemma 4 26B A4B | 25.2B (3.8B active) | INT4 Q8 | 120 tok/s 81 tok/s | ~214 ms ~235 ms | |
#109 | Gemma 4 12B | 11.95B | INT4 Q8 FP16 | 44 tok/s 30 tok/s 16 tok/s | ~534 ms ~544 ms ~615 ms | |
#113 | Qwen3.5-9B | 9B | INT4 Q8 FP16 | 75 tok/s 46 tok/s 25 tok/s | ~401 ms ~409 ms ~428 ms | |
#114 | Qwen3.5-35B-A3B | 35B (3B active) | INT4 | 130 tok/s | ~191 ms | |
#118 | K2 Horizon 7B | 7B | INT4 Q8 FP16 | 90 tok/s 57 tok/s 31 tok/s | ~315 ms ~322 ms ~336 ms | |
#128 | NVIDIA Nemotron 3 Nano 30B-A3B | 3.5B (30B active) | INT4 Q8 FP16 | 25 tok/s 15 tok/s 8 tok/s | ~1.3s ~1.3s ~1.3s | |
#129 | Gemma 4 31B | 30.7B | INT4 Q8 | 26 tok/s 13 tok/s | ~1.3s ~1.6s | |
#131 | Nemotron 3.5 Lightning | 30B (3B active) | INT4 | 54 tok/s | ~198 ms | |
#132 | Qwen3.5-4B | 4B | INT4 Q8 FP16 | 132 tok/s 89 tok/s 51 tok/s | ~188 ms ~191 ms ~199 ms | |
#133 | Qwen3-30B-A3B | 30B (3B active) | INT4 Q8 | 132 tok/s 88 tok/s | ~187 ms ~221 ms | |
#136 | GPT-OSS 20B | 21B (3.6B active) | INT4 Q8 | 60 tok/s 49 tok/s | ~209 ms ~229 ms | |
#146 | Granite 4.2 8B | 8B | INT4 Q8 FP16 | 82 tok/s 51 tok/s 28 tok/s | ~358 ms ~365 ms ~381 ms | |
#150 | Gemma 4 E4B | 8B | INT4 Q8 FP16 | 82 tok/s 51 tok/s 28 tok/s | ~358 ms ~365 ms ~381 ms | |
#151 | Nemotron 3.5 Lightning 30B A3B | 30B (3B active) | INT4 Q8 | 132 tok/s 88 tok/s | ~187 ms ~221 ms | |
#153 | Qwen3-32B | 32B | INT4 | 25 tok/s | ~1.4s | |
#155 | Mistral Large 3 | 41B (675B active) | INT4 | 1 tok/s | ~32.4s | |
#156 | GLM-4 | 32B | INT4 | 20 tok/s | ~1.4s | |
#158 | GLM-4V | 9B | INT4 Q8 FP16 | 55 tok/s 38 tok/s 22 tok/s | ~406 ms ~414 ms ~432 ms | |
#159 | Gemma 3 27B | 27B | INT4 Q8 | 29 tok/s 16 tok/s | ~1.2s ~1.3s | |
#160 | Phi-4 | 14B | INT4 Q8 FP16 | 52 tok/s 31 tok/s 16 tok/s | ~615 ms ~628 ms ~711 ms | |
#162 | DeepSeek-R1 32B | 32B | INT4 Q8 | 26 tok/s 13 tok/s | ~1.4s ~1.6s | |
#164 | Qwen2.5-32B | 32B | INT4 | 25 tok/s | ~1.4s | |
#168 | Magistral Small | 24B | INT4 Q8 | 25 tok/s 15 tok/s | ~1.0s ~1.2s | |
#169 | OLMo 3 7B Think | 7B | INT4 Q8 FP16 | 66 tok/s 47 tok/s 28 tok/s | ~319 ms ~325 ms ~340 ms | |
#170 | OLMo 3.1 32B Instruct | 32B | INT4 | 20 tok/s | ~1.4s | |
#172 | DeepSeek-R1 14B | 14B | INT4 Q8 FP16 | 54 tok/s 32 tok/s 16 tok/s | ~614 ms ~627 ms ~710 ms | |
#173 | Ministral 3 14B | 14B | INT4 Q8 FP16 | 38 tok/s 26 tok/s 13 tok/s | ~622 ms ~634 ms ~773 ms | |
#177 | Gemma 3 12B | 12B | INT4 Q8 FP16 | 59 tok/s 36 tok/s 19 tok/s | ~530 ms ~541 ms ~565 ms | |
#180 | OLMo 3 32B Base | 32B | INT4 | 20 tok/s | ~1.4s | |
#181 | Mistral-Small-2501 | 24B | INT4 Q8 | 33 tok/s 18 tok/s | ~1.0s ~1.1s | |
#182 | Ministral 3 8B | 8B | INT4 Q8 FP16 | 60 tok/s 42 tok/s 25 tok/s | ~362 ms ~369 ms ~385 ms | |
#183 | Qwen3.5-2B | 2B | INT4 Q8 FP16 | 189 tok/s 140 tok/s 89 tok/s | ~103 ms ~105 ms ~109 ms | |
#184 | MiniCPM5-2B | 2B | INT4 Q8 FP16 | 189 tok/s 140 tok/s 89 tok/s | ~103 ms ~105 ms ~109 ms | |
#185 | Qwen2.5-14B | 14B | INT4 Q8 FP16 | 52 tok/s 31 tok/s 16 tok/s | ~615 ms ~628 ms ~711 ms | |
#186 | Gemma 2 27B | 27B | INT4 Q8 | 29 tok/s 16 tok/s | ~1.2s ~1.3s | |
#187 | OLMo 3.1 32B Think | 32B | INT4 | 20 tok/s | ~1.4s | |
#188 | Gemma 4 E2B | 5.1B | INT4 Q8 FP16 | 113 tok/s 74 tok/s 42 tok/s | ~234 ms ~239 ms ~249 ms | |
#189 | Qwen3-4B | 4B | INT4 Q8 FP16 | 132 tok/s 89 tok/s 51 tok/s | ~188 ms ~191 ms ~199 ms | |
#190 | DeepSeek-R1 8B | 8B | INT4 Q8 FP16 | 84 tok/s 52 tok/s 28 tok/s | ~357 ms ~365 ms ~381 ms | |
#193 | Ministral 3 3B | 3B | INT4 Q8 FP16 | 107 tok/s 84 tok/s 56 tok/s | ~148 ms ~150 ms ~157 ms | |
#195 | Qwen3-14B | 14B | INT4 Q8 FP16 | 52 tok/s 31 tok/s 16 tok/s | ~615 ms ~628 ms ~711 ms | |
#196 | Kimi Linear 48B A3B Instruct | 48B (3B active) | INT4 | 41 tok/s | ~250 ms | |
#197 | Gemma 2 9B | 9B | INT4 Q8 FP16 | 75 tok/s 46 tok/s 25 tok/s | ~401 ms ~409 ms ~428 ms | |
#198 | Qwen2.5-7B | 7B | INT4 Q8 FP16 | 90 tok/s 57 tok/s 31 tok/s | ~315 ms ~322 ms ~336 ms | |
#199 | Qwen3-8B | 8B | INT4 Q8 FP16 | 82 tok/s 51 tok/s 28 tok/s | ~358 ms ~365 ms ~381 ms | |
#200 | Gemma 3 4B | 4B | INT4 Q8 FP16 | 132 tok/s 89 tok/s 51 tok/s | ~188 ms ~191 ms ~199 ms | |
#201 | DeepSeek-R1 7B | 7B | INT4 Q8 FP16 | 93 tok/s 58 tok/s 32 tok/s | ~315 ms ~321 ms ~336 ms | |
#202 | Llama 3.1 8B | 8B | INT4 Q8 FP16 | 82 tok/s 51 tok/s 28 tok/s | ~358 ms ~365 ms ~381 ms | |
#204 | Qwen3-1.7B | 1.7B | INT4 Q8 FP16 | 203 tok/s 154 tok/s 101 tok/s | ~89 ms ~91 ms ~94 ms | |
#205 | Command R | 35B | INT4 | 18 tok/s | ~1.5s | |
#206 | Gemma 3 270M | 0.27B | INT4 Q8 FP16 | 303 tok/s 283 tok/s 245 tok/s | ~20 ms ~21 ms ~21 ms | |
#208 | Llama 3 8B | 8B | INT4 Q8 FP16 | 82 tok/s 51 tok/s 28 tok/s | ~358 ms ~365 ms ~381 ms | |
#209 | Qwen3-0.6B | 0.6B | INT4 Q8 FP16 | 288 tok/s 249 tok/s 191 tok/s | ~36 ms ~37 ms ~38 ms | |
#210 | Phi-4-Mini | 3.8B | INT4 Q8 FP16 | 136 tok/s 92 tok/s 54 tok/s | ~179 ms ~183 ms ~190 ms | |
#211 | Mixtral-8x7B-v0.1 | 46.7B (7B active) | INT4 | 76 tok/s | ~395 ms | |
#212 | Ministral-8B-2410 | 8B | INT4 Q8 FP16 | 82 tok/s 51 tok/s 28 tok/s | ~358 ms ~365 ms ~381 ms | |
#213 | DeepSeek-R1 1.5B | 1.5B | INT4 Q8 FP16 | 215 tok/s 166 tok/s 110 tok/s | ~80 ms ~81 ms ~84 ms | |
#214 | Llama 3.2 3B | 3B | INT4 Q8 FP16 | 155 tok/s 109 tok/s 65 tok/s | ~145 ms ~148 ms ~154 ms | |
#215 | Qwen3.5-0.8B | 0.8B | INT4 Q8 FP16 | 267 tok/s 223 tok/s 164 tok/s | ~46 ms ~47 ms ~48 ms | |
#216 | Phi-3-mini | 3.8B | INT4 Q8 FP16 | 136 tok/s 92 tok/s 54 tok/s | ~179 ms ~183 ms ~190 ms | |
#217 | Gemma 3n E2B IT | 6B (2B active) | INT4 Q8 FP16 | 107 tok/s 92 tok/s 67 tok/s | ~113 ms ~115 ms ~119 ms | |
#218 | Mistral-7B-Instruct-v0.1 | 7.3B | INT4 Q8 FP16 | 88 tok/s 55 tok/s 30 tok/s | ~328 ms ~334 ms ~349 ms | |
#219 | Llama 3.2 1B | 1B | INT4 Q8 FP16 | 248 tok/s 202 tok/s 143 tok/s | ~57 ms ~58 ms ~60 ms | |
#220 | Gemma 2 2B | 2B | INT4 Q8 FP16 | 189 tok/s 140 tok/s 89 tok/s | ~103 ms ~105 ms ~109 ms | |
#221 | Phi-3-medium | 14B | INT4 Q8 FP16 | 52 tok/s 31 tok/s 16 tok/s | ~615 ms ~628 ms ~711 ms | |
#222 | OLMo 3 7B Instruct | 7B | INT4 Q8 FP16 | 66 tok/s 47 tok/s 28 tok/s | ~319 ms ~325 ms ~340 ms | |
#223 | Yi-34B | 34B | INT4 | 19 tok/s | ~1.5s | |
#224 | Qwen2-7B | 7B | INT4 Q8 FP16 | 90 tok/s 57 tok/s 31 tok/s | ~315 ms ~322 ms ~336 ms | |
#225 | Phi-3-small | 7B | INT4 Q8 FP16 | 90 tok/s 57 tok/s 31 tok/s | ~315 ms ~322 ms ~336 ms | |
#226 | Gemma 3 1B | 1B | INT4 Q8 FP16 | 248 tok/s 202 tok/s 143 tok/s | ~57 ms ~58 ms ~60 ms | |
#227 | Mistral-7B-Instruct-v0.2 | 7.3B | INT4 Q8 FP16 | 88 tok/s 55 tok/s 30 tok/s | ~328 ms ~334 ms ~349 ms | |
#229 | Gemma 1 7B | 7B | INT4 Q8 FP16 | 66 tok/s 47 tok/s 28 tok/s | ~319 ms ~325 ms ~340 ms | |
#230 | Gemma 1 2B | 2B | INT4 Q8 FP16 | 200 tok/s 146 tok/s 91 tok/s | ~103 ms ~104 ms ~109 ms | |
#231 | ChatGLM3-6B | 6B | INT4 Q8 FP16 | 73 tok/s 53 tok/s 32 tok/s | ~277 ms ~282 ms ~294 ms | |
#232 | ChatGLM2-6B | 6B | INT4 Q8 FP16 | 73 tok/s 53 tok/s 32 tok/s | ~277 ms ~282 ms ~294 ms | |
#233 | ChatGLM-6B | 6B | INT4 Q8 FP16 | 73 tok/s 53 tok/s 32 tok/s | ~277 ms ~282 ms ~294 ms | |
未上榜模型(按推理速度排序) | ||||||
- | Qwen2-0.5B | 0.5B | INT4 Q8 FP16 | 300 tok/s 263 tok/s 208 tok/s | ~31 ms ~32 ms ~33 ms | |
- | Qwen2.5-0.5B | 0.5B | INT4 Q8 FP16 | 300 tok/s 263 tok/s 208 tok/s | ~31 ms ~32 ms ~33 ms | |
- | ERNIE-4.5-0.3B | 0.3B | INT4 Q8 FP16 | 295 tok/s 275 tok/s 235 tok/s | ~22 ms ~22 ms ~23 ms | |
- | ERNIE-4.5-0.3B-Base | 0.3B | INT4 Q8 FP16 | 295 tok/s 275 tok/s 235 tok/s | ~22 ms ~22 ms ~23 ms | |
- | Falcon-1B | 1B | INT4 Q8 FP16 | 259 tok/s 209 tok/s 146 tok/s | ~57 ms ~57 ms ~59 ms | |
- | Falcon3-1B | 1B | INT4 Q8 FP16 | 248 tok/s 202 tok/s 143 tok/s | ~57 ms ~58 ms ~60 ms | |
- | Qwen2-1.5B | 1.5B | INT4 Q8 FP16 | 215 tok/s 166 tok/s 110 tok/s | ~80 ms ~81 ms ~84 ms | |
- | Qwen2.5-1.5B | 1.5B | INT4 Q8 FP16 | 215 tok/s 166 tok/s 110 tok/s | ~80 ms ~81 ms ~84 ms | |
- | Spark X2.5 1.7B | 1.7B | INT4 Q8 FP16 | 203 tok/s 154 tok/s 101 tok/s | ~89 ms ~91 ms ~94 ms | |
- | Hy-MT2 1.8B | 1.8B | INT4 Q8 FP16 | 199 tok/s 150 tok/s 97 tok/s | ~93 ms ~95 ms ~99 ms | |
- | Falcon-3B | 3B | INT4 Q8 FP16 | 163 tok/s 112 tok/s 66 tok/s | ~145 ms ~148 ms ~154 ms | |
- | CroissantLLM Base | 1.3B | INT4 Q8 FP16 | 161 tok/s 138 tok/s 101 tok/s | ~72 ms ~73 ms ~76 ms | |
- | Phi-1 | 1.3B | INT4 Q8 FP16 | 161 tok/s 138 tok/s 101 tok/s | ~72 ms ~73 ms ~76 ms | |
- | Phi-1.5 | 1.3B | INT4 Q8 FP16 | 161 tok/s 138 tok/s 101 tok/s | ~72 ms ~73 ms ~76 ms | |
- | DeepSeek-R1 3B | 3B | INT4 Q8 FP16 | 157 tok/s 109 tok/s 66 tok/s | ~145 ms ~148 ms ~154 ms | |
- | Falcon3-3B | 3B | INT4 Q8 FP16 | 155 tok/s 109 tok/s 65 tok/s | ~145 ms ~148 ms ~154 ms | |
- | Qwen2.5-3B | 3B | INT4 Q8 FP16 | 155 tok/s 109 tok/s 65 tok/s | ~145 ms ~148 ms ~154 ms | |
- | ERNIE-4.5-21B-A3B | 21B (3B active) | INT4 Q8 | 137 tok/s 100 tok/s | ~176 ms ~178 ms | |
- | ERNIE-4.5-21B-A3B-Base | 21B (3B active) | INT4 Q8 | 137 tok/s 100 tok/s | ~176 ms ~178 ms | |
- | ERNIE-4.5-VL-28B-A3B | 28B (3B active) | INT4 Q8 | 133 tok/s 93 tok/s | ~184 ms ~202 ms | |
- | ERNIE-4.5-VL-28B-A3B-Base | 28B (3B active) | INT4 Q8 | 133 tok/s 93 tok/s | ~184 ms ~202 ms | |
- | Hy-MT2 30B A3B | 30B (3B active) | INT4 Q8 | 132 tok/s 88 tok/s | ~187 ms ~221 ms | |
- | Spark X2.5 4B | 4B | INT4 Q8 FP16 | 132 tok/s 89 tok/s 51 tok/s | ~188 ms ~191 ms ~199 ms | |
- | Phi-2 | 2.7B | INT4 Q8 FP16 | 113 tok/s 90 tok/s 60 tok/s | ~135 ms ~137 ms ~143 ms | |
- | MaLLaM-3B | 3B | INT4 Q8 FP16 | 107 tok/s 84 tok/s 56 tok/s | ~148 ms ~150 ms ~157 ms | |
- | SmolLM3 3B | 3B | INT4 Q8 FP16 | 107 tok/s 84 tok/s 56 tok/s | ~148 ms ~150 ms ~157 ms | |
- | Falcon-7B | 7B | INT4 Q8 FP16 | 94 tok/s 58 tok/s 32 tok/s | ~315 ms ~321 ms ~335 ms | |
- | Falcon3-7B | 7B | INT4 Q8 FP16 | 90 tok/s 57 tok/s 31 tok/s | ~315 ms ~322 ms ~336 ms | |
- | Hy-MT2 7B | 7B | INT4 Q8 FP16 | 90 tok/s 57 tok/s 31 tok/s | ~315 ms ~322 ms ~336 ms | |
- | Mistral-7B-v0.1 | 7.3B | INT4 Q8 FP16 | 88 tok/s 55 tok/s 30 tok/s | ~328 ms ~334 ms ~349 ms | |
- | LensVLM 9B | 9B | INT4 Q8 FP16 | 75 tok/s 46 tok/s 25 tok/s | ~401 ms ~409 ms ~428 ms | |
- | MiMo V2.6 Distill Qwen 9B | 9B | INT4 Q8 FP16 | 75 tok/s 46 tok/s 25 tok/s | ~401 ms ~409 ms ~428 ms | |
- | ChatGLM3-6B-32K | 6B | INT4 Q8 FP16 | 73 tok/s 53 tok/s 32 tok/s | ~277 ms ~282 ms ~294 ms | |
- | Yi-6B | 6B | INT4 Q8 FP16 | 73 tok/s 53 tok/s 32 tok/s | ~277 ms ~282 ms ~294 ms | |
- | Falcon3-10B | 10B | INT4 Q8 FP16 | 69 tok/s 42 tok/s 23 tok/s | ~443 ms ~453 ms ~473 ms | |
- | Kimi-VL-A3B-Instruct | 16B (3B active) | INT4 Q8 | 69 tok/s 60 tok/s | ~176 ms ~178 ms | |
- | Falcon2-11B | 11B | INT4 Q8 FP16 | 66 tok/s 39 tok/s 21 tok/s | ~485 ms ~496 ms ~518 ms | |
- | Hunyuan Lite | 7B | INT4 Q8 FP16 | 66 tok/s 47 tok/s 28 tok/s | ~319 ms ~325 ms ~340 ms | |
- | OLMo 3 7B Base | 7B | INT4 Q8 FP16 | 66 tok/s 47 tok/s 28 tok/s | ~319 ms ~325 ms ~340 ms | |
- | SEA-LION-7B | 7.1B | INT4 Q8 FP16 | 65 tok/s 46 tok/s 28 tok/s | ~324 ms ~330 ms ~344 ms | |
- | SEA-LION-7B-Instruct | 7.1B | INT4 Q8 FP16 | 65 tok/s 46 tok/s 28 tok/s | ~324 ms ~330 ms ~344 ms | |
- | Sahabat-AI-Llama3-8B-Instruct | 8B | INT4 Q8 FP16 | 60 tok/s 42 tok/s 25 tok/s | ~362 ms ~369 ms ~385 ms | |
- | Typhoon-2-8B | 8B | INT4 Q8 FP16 | 60 tok/s 42 tok/s 25 tok/s | ~362 ms ~369 ms ~385 ms | |
- | GLM-4-9B | 9B | INT4 Q8 FP16 | 55 tok/s 38 tok/s 22 tok/s | ~406 ms ~414 ms ~432 ms | |
- | GLM-4-9B-Chat | 9B | INT4 Q8 FP16 | 55 tok/s 38 tok/s 22 tok/s | ~406 ms ~414 ms ~432 ms | |
- | GLM-4-9B-Chat-1M | 9B | INT4 Q8 FP16 | 55 tok/s 38 tok/s 22 tok/s | ~406 ms ~414 ms ~432 ms | |
- | Yi-9B | 9B | INT4 Q8 FP16 | 55 tok/s 38 tok/s 22 tok/s | ~406 ms ~414 ms ~432 ms | |
- | Sahabat-AI-Gemma2-9B | 9.2B | INT4 Q8 FP16 | 54 tok/s 37 tok/s 22 tok/s | ~414 ms ~422 ms ~441 ms | |
- | Sahabat-AI-Gemma2-9B-Instruct | 9.2B | INT4 Q8 FP16 | 54 tok/s 37 tok/s 22 tok/s | ~414 ms ~422 ms ~441 ms | |
- | GreenMind-14B-R1 | 14B | INT4 Q8 FP16 | 38 tok/s 26 tok/s 13 tok/s | ~622 ms ~634 ms ~773 ms | |
- | Falcon-40B | 40B | INT4 | 21 tok/s | ~1.7s | |
不同量化精度下可运行的最大模型参数级别。
上下文长度:
4位量化
32B 模型
8位精度
14B 模型
16位全精度
14B 模型
本地模型训练与适配器微调支持能力。
微调上下文:
QLoRA
32B 模型
LoRA
14B 模型
全参数微调
3B 模型
NVIDIA RTX 5000 Ada Generation (32GB) 上的最佳量化精度与运行规格建议。
最佳推理区间
适合在全精度或 Q8 精度下运行 14B 模型,以及在 Q4 精度下搭配最高 32k 上下文运行 32B 模型。
显存带宽与推理速率
具备 576 GB/s 聚合带宽,单批次推理处于显存带宽受限模式。8B Q4 模型预估生成速度约 128 tok/s,70B Q4 模型预估生成速度约 15 tok/s。
Assistant
在线