趋近智
NVIDIA RTX PRO 5000 Blackwell (72GB) 配备 72 GB 专用显存与 1344 GB/s 显存带宽,支持 CUDA 和 TensorRT-LLM 运行环境,可进行全精度与量化大模型推理。
总显存
72 GB
可用显存上限
72 GB
显存带宽
1344 GB/s
最大推理模型级别
70B+ 模型 (Q4)
热设计功耗
300W
随上下文长度增长的显存需求评估。当曲线超过参考线时将导致显存不足(OOM)。
量化精度:
主流开源大模型在 NVIDIA RTX PRO 5000 Blackwell (72GB) 上的推理速度、显存兼容性与生成吞吐表现。
排序:
上下文长度:
KV 缓存:
显卡数量:
| 排名 | 模型 | 参数量 | 量化精度 | 预估 TPS | TTFT | 可运行 |
|---|---|---|---|---|---|---|
#35 | Qwen 3.8 Flash | 125B (6B active) | INT4 | 160 tok/s | ~288 ms | |
#48 | Sarvam-105B | 106B (10.3B active) | INT4 | 119 tok/s | ~621 ms | |
#63 | Ling 3.0 Flash VL | 124B (5.5B active) | INT4 | 157 tok/s | ~479 ms | |
#72 | Sarvam-30B | 32B (2.4B active) | INT4 Q8 FP16 | 221 tok/s 184 tok/s 119 tok/s | ~158 ms ~159 ms ~188 ms | |
#73 | Muse Glimmer 30B | 30B | INT4 Q8 FP16 | 57 tok/s 34 tok/s 17 tok/s | ~1.2s ~1.3s ~1.4s | |
#77 | MiMo V2 Flash | 15B (309B active) | INT4 Q8 FP16 | 7 tok/s 4 tok/s 2 tok/s | ~12.2s ~12.3s ~12.6s | |
#78 | Phi-4 Reasoning Plus | 14B | INT4 Q8 FP16 | 79 tok/s 55 tok/s 33 tok/s | ~594 ms ~599 ms ~611 ms | |
#83 | Ling 3.0 Flash | 124B (5.1B active) | INT4 | 162 tok/s | ~461 ms | |
#93 | Gemma 4 26B A4B | 25.2B (3.8B active) | INT4 Q8 FP16 | 196 tok/s 152 tok/s 101 tok/s | ~205 ms ~207 ms ~210 ms | |
#98 | Gemma 4 12B | 11.95B | INT4 Q8 FP16 | 88 tok/s 63 tok/s 38 tok/s | ~509 ms ~514 ms ~524 ms | |
#101 | Nemotron 3.5 Lightning | 30B (3B active) | INT4 Q8 FP16 | 105 tok/s 97 tok/s 70 tok/s | ~185 ms ~185 ms ~219 ms | |
#103 | GPT-OSS 20B | 21B (3.6B active) | INT4 Q8 FP16 | 115 tok/s 102 tok/s 77 tok/s | ~196 ms ~197 ms ~200 ms | |
#110 | Qwen3 Next 80B A3B | 80B (79B active) | INT4 | 18 tok/s | ~3.5s | |
#112 | Gemma 4 31B | 30.7B | INT4 Q8 FP16 | 56 tok/s 33 tok/s 17 tok/s | ~1.3s ~1.3s ~1.4s | |
#121 | NVIDIA Nemotron 3 Nano 30B-A3B | 3.5B (30B active) | INT4 Q8 FP16 | 54 tok/s 33 tok/s 18 tok/s | ~1.2s ~1.2s ~1.2s | |
#123 | Granite 4.2 8B | 8B | INT4 Q8 FP16 | 147 tok/s 100 tok/s 59 tok/s | ~344 ms ~347 ms ~354 ms | |
#124 | Qwen3-30B-A3B | 30B (3B active) | INT4 Q8 FP16 | 208 tok/s 168 tok/s 111 tok/s | ~180 ms ~181 ms ~199 ms | |
#126 | Qwen2.5-72B | 72B | INT4 | 26 tok/s | ~2.9s | |
#128 | Hunyuan Standard | 52B (389B active) | INT4 Q8 | 5 tok/s 3 tok/s | ~15.3s ~16.8s | |
#129 | DeepSeek-R1 70B | 70B | INT4 | 28 tok/s | ~2.9s | |
#130 | Phi-4 | 14B | INT4 Q8 FP16 | 102 tok/s 65 tok/s 36 tok/s | ~591 ms ~596 ms ~609 ms | |
#131 | Mistral Large 3 | 41B (675B active) | INT4 Q8 | 3 tok/s 2 tok/s | ~26.5s ~26.8s | |
#132 | Llama 3.3 70B | 70B | INT4 | 27 tok/s | ~2.9s | |
#133 | Gemma 3 27B | 27B | INT4 Q8 FP16 | 62 tok/s 37 tok/s 19 tok/s | ~1.1s ~1.1s ~1.2s | |
#133 | DeepSeek-R1 32B | 32B | INT4 Q8 FP16 | 55 tok/s 32 tok/s 15 tok/s | ~1.3s ~1.3s ~1.6s | |
#135 | Qwen2.5-32B | 32B | INT4 Q8 FP16 | 54 tok/s 32 tok/s 15 tok/s | ~1.3s ~1.3s ~1.6s | |
#136 | OLMo 3.1 32B Instruct | 32B | INT4 Q8 FP16 | 43 tok/s 28 tok/s 14 tok/s | ~1.3s ~1.3s ~1.6s | |
#137 | Gemma 4 E4B | 8B | INT4 Q8 FP16 | 147 tok/s 100 tok/s 59 tok/s | ~344 ms ~347 ms ~354 ms | |
#138 | Mistral-Large-2407 | 123B | INT4 | 14 tok/s | ~5.9s | |
#139 | Qwen3-32B | 32B | INT4 Q8 FP16 | 54 tok/s 32 tok/s 15 tok/s | ~1.3s ~1.3s ~1.6s | |
#140 | Llama 3.1 70B | 70B | INT4 | 27 tok/s | ~2.9s | |
#141 | DeepSeek-R1 14B | 14B | INT4 Q8 FP16 | 105 tok/s 66 tok/s 37 tok/s | ~591 ms ~596 ms ~609 ms | |
#142 | Magistral Small | 24B | INT4 Q8 FP16 | 53 tok/s 36 tok/s 19 tok/s | ~1.0s ~1.0s ~1.1s | |
#143 | Gemma 2 27B | 27B | INT4 Q8 FP16 | 62 tok/s 37 tok/s 19 tok/s | ~1.1s ~1.1s ~1.2s | |
#144 | OLMo 3 32B Base | 32B | INT4 Q8 FP16 | 43 tok/s 28 tok/s 14 tok/s | ~1.3s ~1.3s ~1.6s | |
#146 | Llama 4 Scout | 109B (17B active) | INT4 | 74 tok/s | ~912 ms | |
#147 | Qwen2-72B | 72B | INT4 | 26 tok/s | ~2.9s | |
#148 | Ministral 3 14B | 14B | INT4 Q8 FP16 | 79 tok/s 55 tok/s 33 tok/s | ~594 ms ~599 ms ~611 ms | |
#149 | OLMo 3 7B Think | 7B | INT4 Q8 FP16 | 124 tok/s 93 tok/s 59 tok/s | ~305 ms ~307 ms ~313 ms | |
#150 | Mistral-Small-2501 | 24B | INT4 Q8 FP16 | 68 tok/s 41 tok/s 22 tok/s | ~997 ms ~1.0s ~1.0s | |
#151 | Gemma 3 12B | 12B | INT4 Q8 FP16 | 114 tok/s 74 tok/s 42 tok/s | ~509 ms ~514 ms ~524 ms | |
#153 | OLMo 3.1 32B Think | 32B | INT4 Q8 FP16 | 43 tok/s 28 tok/s 14 tok/s | ~1.3s ~1.3s ~1.6s | |
#155 | Qwen2.5-14B | 14B | INT4 Q8 FP16 | 102 tok/s 65 tok/s 36 tok/s | ~591 ms ~596 ms ~609 ms | |
#156 | MiniCPM5-2B | 2B | INT4 Q8 FP16 | 262 tok/s 218 tok/s 158 tok/s | ~99 ms ~100 ms ~102 ms | |
#157 | Ministral 3 8B | 8B | INT4 Q8 FP16 | 115 tok/s 85 tok/s 53 tok/s | ~346 ms ~349 ms ~356 ms | |
#158 | GLM-4 | 32B | INT4 Q8 FP16 | 43 tok/s 28 tok/s 14 tok/s | ~1.3s ~1.3s ~1.6s | |
#159 | Llama 3 70B | 70B | INT4 | 27 tok/s | ~2.9s | |
#160 | Command R Plus | 104B | INT4 | 13 tok/s | ~5.0s | |
#161 | Gemma 2 9B | 9B | INT4 Q8 FP16 | 137 tok/s 92 tok/s 53 tok/s | ~385 ms ~389 ms ~397 ms | |
#162 | Gemma 4 E2B | 5.1B | INT4 Q8 FP16 | 187 tok/s 136 tok/s 85 tok/s | ~225 ms ~227 ms ~232 ms | |
#163 | DeepSeek-R1 8B | 8B | INT4 Q8 FP16 | 150 tok/s 102 tok/s 59 tok/s | ~344 ms ~347 ms ~354 ms | |
#165 | Kimi Linear 48B A3B Instruct | 48B (3B active) | INT4 Q8 | 92 tok/s 83 tok/s | ~200 ms ~217 ms | |
#166 | Qwen3-4B | 4B | INT4 Q8 FP16 | 208 tok/s 157 tok/s 101 tok/s | ~180 ms ~182 ms ~186 ms | |
#167 | Command R | 35B | INT4 Q8 | 40 tok/s 26 tok/s | ~1.4s ~1.5s | |
#168 | Ministral 3 3B | 3B | INT4 Q8 FP16 | 181 tok/s 151 tok/s 108 tok/s | ~141 ms ~142 ms ~145 ms | |
#169 | Qwen3-14B | 14B | INT4 Q8 FP16 | 102 tok/s 65 tok/s 36 tok/s | ~591 ms ~596 ms ~609 ms | |
#171 | Qwen2.5-7B | 7B | INT4 Q8 FP16 | 159 tok/s 110 tok/s 66 tok/s | ~303 ms ~306 ms ~312 ms | |
#172 | Gemma 3 4B | 4B | INT4 Q8 FP16 | 208 tok/s 157 tok/s 101 tok/s | ~180 ms ~182 ms ~186 ms | |
#173 | DeepSeek-R1 7B | 7B | INT4 Q8 FP16 | 162 tok/s 112 tok/s 66 tok/s | ~303 ms ~306 ms ~312 ms | |
#174 | Llama 3 8B | 8B | INT4 Q8 FP16 | 147 tok/s 100 tok/s 59 tok/s | ~344 ms ~347 ms ~354 ms | |
#175 | Llama 3.1 8B | 8B | INT4 Q8 FP16 | 147 tok/s 100 tok/s 59 tok/s | ~344 ms ~347 ms ~354 ms | |
#176 | Qwen3-1.7B | 1.7B | INT4 Q8 FP16 | 274 tok/s 232 tok/s 172 tok/s | ~86 ms ~86 ms ~88 ms | |
#176 | Qwen3-8B | 8B | INT4 Q8 FP16 | 147 tok/s 100 tok/s 59 tok/s | ~344 ms ~347 ms ~354 ms | |
#178 | Gemma 3 270M | 0.27B | INT4 Q8 FP16 | 338 tok/s 327 tok/s 304 tok/s | ~20 ms ~20 ms ~20 ms | |
#179 | Ministral-8B-2410 | 8B | INT4 Q8 FP16 | 147 tok/s 100 tok/s 59 tok/s | ~344 ms ~347 ms ~354 ms | |
#180 | Qwen3-0.6B | 0.6B | INT4 Q8 FP16 | 330 tok/s 306 tok/s 264 tok/s | ~35 ms ~35 ms ~36 ms | |
#182 | Mixtral-8x7B-v0.1 | 46.7B (7B active) | INT4 Q8 | 146 tok/s 104 tok/s | ~350 ms ~353 ms | |
#183 | Phi-4-Mini | 3.8B | INT4 Q8 FP16 | 213 tok/s 161 tok/s 105 tok/s | ~172 ms ~174 ms ~177 ms | |
#184 | Llama 3.2 3B | 3B | INT4 Q8 FP16 | 232 tok/s 182 tok/s 123 tok/s | ~140 ms ~141 ms ~143 ms | |
#185 | DeepSeek-R1 1.5B | 1.5B | INT4 Q8 FP16 | 283 tok/s 242 tok/s 184 tok/s | ~77 ms ~77 ms ~79 ms | |
#186 | Phi-3-mini | 3.8B | INT4 Q8 FP16 | 213 tok/s 161 tok/s 105 tok/s | ~172 ms ~174 ms ~177 ms | |
#187 | Gemma 2 2B | 2B | INT4 Q8 FP16 | 262 tok/s 218 tok/s 158 tok/s | ~99 ms ~100 ms ~102 ms | |
#188 | Phi-3-medium | 14B | INT4 Q8 FP16 | 102 tok/s 65 tok/s 36 tok/s | ~591 ms ~596 ms ~609 ms | |
#189 | Gemma 3n E2B IT | 6B (2B active) | INT4 Q8 FP16 | 181 tok/s 162 tok/s 126 tok/s | ~107 ms ~108 ms ~109 ms | |
#190 | Mistral-7B-Instruct-v0.1 | 7.3B | INT4 Q8 FP16 | 155 tok/s 107 tok/s 64 tok/s | ~315 ms ~318 ms ~324 ms | |
#191 | Llama 3.2 1B | 1B | INT4 Q8 FP16 | 306 tok/s 273 tok/s 220 tok/s | ~55 ms ~55 ms ~56 ms | |
#192 | Yi-34B | 34B | INT4 Q8 | 41 tok/s 27 tok/s | ~1.4s ~1.4s | |
#193 | OLMo 3 7B Instruct | 7B | INT4 Q8 FP16 | 124 tok/s 93 tok/s 59 tok/s | ~305 ms ~307 ms ~313 ms | |
#194 | Phi-3-small | 7B | INT4 Q8 FP16 | 159 tok/s 110 tok/s 66 tok/s | ~303 ms ~306 ms ~312 ms | |
#195 | Qwen2-7B | 7B | INT4 Q8 FP16 | 159 tok/s 110 tok/s 66 tok/s | ~303 ms ~306 ms ~312 ms | |
#196 | Mistral-7B-Instruct-v0.2 | 7.3B | INT4 Q8 FP16 | 155 tok/s 107 tok/s 64 tok/s | ~315 ms ~318 ms ~324 ms | |
#198 | Gemma 1 7B | 7B | INT4 Q8 FP16 | 124 tok/s 93 tok/s 59 tok/s | ~305 ms ~307 ms ~313 ms | |
#199 | Gemma 3 1B | 1B | INT4 Q8 FP16 | 306 tok/s 273 tok/s 220 tok/s | ~55 ms ~55 ms ~56 ms | |
#200 | Gemma 1 2B | 2B | INT4 Q8 FP16 | 271 tok/s 223 tok/s 160 tok/s | ~99 ms ~100 ms ~102 ms | |
#201 | ChatGLM3-6B | 6B | INT4 Q8 FP16 | 134 tok/s 103 tok/s 67 tok/s | ~264 ms ~266 ms ~271 ms | |
#202 | ChatGLM2-6B | 6B | INT4 Q8 FP16 | 134 tok/s 103 tok/s 67 tok/s | ~264 ms ~266 ms ~271 ms | |
#203 | ChatGLM-6B | 6B | INT4 Q8 FP16 | 134 tok/s 103 tok/s 67 tok/s | ~264 ms ~266 ms ~271 ms | |
未上榜模型(按推理速度排序) | ||||||
- | Qwen2-0.5B | 0.5B | INT4 Q8 FP16 | 336 tok/s 315 tok/s 277 tok/s | ~30 ms ~30 ms ~31 ms | |
- | Qwen2.5-0.5B | 0.5B | INT4 Q8 FP16 | 336 tok/s 315 tok/s 277 tok/s | ~30 ms ~30 ms ~31 ms | |
- | ERNIE-4.5-0.3B | 0.3B | INT4 Q8 FP16 | 334 tok/s 322 tok/s 297 tok/s | ~21 ms ~21 ms ~22 ms | |
- | ERNIE-4.5-0.3B-Base | 0.3B | INT4 Q8 FP16 | 334 tok/s 322 tok/s 297 tok/s | ~21 ms ~21 ms ~22 ms | |
- | Falcon-1B | 1B | INT4 Q8 FP16 | 313 tok/s 278 tok/s 224 tok/s | ~55 ms ~55 ms ~56 ms | |
- | Falcon3-1B | 1B | INT4 Q8 FP16 | 306 tok/s 273 tok/s 220 tok/s | ~55 ms ~55 ms ~56 ms | |
- | Qwen2-1.5B | 1.5B | INT4 Q8 FP16 | 283 tok/s 242 tok/s 184 tok/s | ~77 ms ~77 ms ~79 ms | |
- | Qwen2.5-1.5B | 1.5B | INT4 Q8 FP16 | 283 tok/s 242 tok/s 184 tok/s | ~77 ms ~77 ms ~79 ms | |
- | Spark X2.5 1.7B | 1.7B | INT4 Q8 FP16 | 274 tok/s 232 tok/s 172 tok/s | ~86 ms ~86 ms ~88 ms | |
- | Hy-MT2 1.8B | 1.8B | INT4 Q8 FP16 | 270 tok/s 227 tok/s 167 tok/s | ~90 ms ~91 ms ~92 ms | |
- | Falcon-3B | 3B | INT4 Q8 FP16 | 240 tok/s 186 tok/s 125 tok/s | ~140 ms ~141 ms ~143 ms | |
- | CroissantLLM Base | 1.3B | INT4 Q8 FP16 | 237 tok/s 215 tok/s 173 tok/s | ~69 ms ~69 ms ~70 ms | |
- | Phi-1 | 1.3B | INT4 Q8 FP16 | 237 tok/s 215 tok/s 173 tok/s | ~69 ms ~69 ms ~70 ms | |
- | Phi-1.5 | 1.3B | INT4 Q8 FP16 | 237 tok/s 215 tok/s 173 tok/s | ~69 ms ~69 ms ~70 ms | |
- | DeepSeek-R1 3B | 3B | INT4 Q8 FP16 | 234 tok/s 183 tok/s 124 tok/s | ~140 ms ~141 ms ~143 ms | |
- | Falcon3-3B | 3B | INT4 Q8 FP16 | 232 tok/s 182 tok/s 123 tok/s | ~140 ms ~141 ms ~143 ms | |
- | Qwen2.5-3B | 3B | INT4 Q8 FP16 | 232 tok/s 182 tok/s 123 tok/s | ~140 ms ~141 ms ~143 ms | |
- | ERNIE-4.5-21B-A3B | 21B (3B active) | INT4 Q8 FP16 | 214 tok/s 172 tok/s 118 tok/s | ~169 ms ~170 ms ~173 ms | |
- | ERNIE-4.5-21B-A3B-Base | 21B (3B active) | INT4 Q8 FP16 | 214 tok/s 172 tok/s 118 tok/s | ~169 ms ~170 ms ~173 ms | |
- | ERNIE-4.5-VL-28B-A3B | 28B (3B active) | INT4 Q8 FP16 | 210 tok/s 169 tok/s 111 tok/s | ~177 ms ~178 ms ~196 ms | |
- | ERNIE-4.5-VL-28B-A3B-Base | 28B (3B active) | INT4 Q8 FP16 | 210 tok/s 169 tok/s 111 tok/s | ~177 ms ~178 ms ~196 ms | |
- | Hy-MT2 30B A3B | 30B (3B active) | INT4 Q8 FP16 | 208 tok/s 168 tok/s 111 tok/s | ~180 ms ~181 ms ~199 ms | |
- | Spark X2.5 4B | 4B | INT4 Q8 FP16 | 208 tok/s 157 tok/s 101 tok/s | ~180 ms ~182 ms ~186 ms | |
- | K2 Horizon MoVA 36B A4B | 36B (4B active) | INT4 Q8 | 188 tok/s 146 tok/s | ~224 ms ~226 ms | |
- | Phi-2 | 2.7B | INT4 Q8 FP16 | 187 tok/s 158 tok/s 115 tok/s | ~129 ms ~130 ms ~132 ms | |
- | MaLLaM-3B | 3B | INT4 Q8 FP16 | 181 tok/s 151 tok/s 108 tok/s | ~141 ms ~142 ms ~145 ms | |
- | SmolLM3 3B | 3B | INT4 Q8 FP16 | 181 tok/s 151 tok/s 108 tok/s | ~141 ms ~142 ms ~145 ms | |
- | Falcon-7B | 7B | INT4 Q8 FP16 | 164 tok/s 113 tok/s 67 tok/s | ~303 ms ~306 ms ~312 ms | |
- | Falcon3-7B | 7B | INT4 Q8 FP16 | 159 tok/s 110 tok/s 66 tok/s | ~303 ms ~306 ms ~312 ms | |
- | Hy-MT2 7B | 7B | INT4 Q8 FP16 | 159 tok/s 110 tok/s 66 tok/s | ~303 ms ~306 ms ~312 ms | |
- | K2 Horizon 7B | 7B | INT4 Q8 FP16 | 159 tok/s 110 tok/s 66 tok/s | ~303 ms ~306 ms ~312 ms | |
- | Mistral-7B-v0.1 | 7.3B | INT4 Q8 FP16 | 155 tok/s 107 tok/s 64 tok/s | ~315 ms ~318 ms ~324 ms | |
- | ChatGLM3-6B-32K | 6B | INT4 Q8 FP16 | 134 tok/s 103 tok/s 67 tok/s | ~264 ms ~266 ms ~271 ms | |
- | Yi-6B | 6B | INT4 Q8 FP16 | 134 tok/s 103 tok/s 67 tok/s | ~264 ms ~266 ms ~271 ms | |
- | Falcon3-10B | 10B | INT4 Q8 FP16 | 129 tok/s 85 tok/s 49 tok/s | ~426 ms ~430 ms ~439 ms | |
- | Kimi-VL-A3B-Instruct | 16B (3B active) | INT4 Q8 FP16 | 129 tok/s 115 tok/s 88 tok/s | ~166 ms ~166 ms ~169 ms | |
- | Falcon2-11B | 11B | INT4 Q8 FP16 | 125 tok/s 81 tok/s 45 tok/s | ~467 ms ~471 ms ~481 ms | |
- | Hunyuan Lite | 7B | INT4 Q8 FP16 | 124 tok/s 93 tok/s 59 tok/s | ~305 ms ~307 ms ~313 ms | |
- | OLMo 3 7B Base | 7B | INT4 Q8 FP16 | 124 tok/s 93 tok/s 59 tok/s | ~305 ms ~307 ms ~313 ms | |
- | SEA-LION-7B | 7.1B | INT4 Q8 FP16 | 123 tok/s 93 tok/s 59 tok/s | ~309 ms ~311 ms ~318 ms | |
- | SEA-LION-7B-Instruct | 7.1B | INT4 Q8 FP16 | 123 tok/s 93 tok/s 59 tok/s | ~309 ms ~311 ms ~318 ms | |
- | Sahabat-AI-Llama3-8B-Instruct | 8B | INT4 Q8 FP16 | 115 tok/s 85 tok/s 53 tok/s | ~346 ms ~349 ms ~356 ms | |
- | Typhoon-2-8B | 8B | INT4 Q8 FP16 | 115 tok/s 85 tok/s 53 tok/s | ~346 ms ~349 ms ~356 ms | |
- | Laguna S 2.1 | 118B (8B active) | INT4 | 109 tok/s | ~547 ms | |
- | GLM-4-9B | 9B | INT4 Q8 FP16 | 106 tok/s 78 tok/s 48 tok/s | ~387 ms ~391 ms ~399 ms | |
- | GLM-4-9B-Chat | 9B | INT4 Q8 FP16 | 106 tok/s 78 tok/s 48 tok/s | ~387 ms ~391 ms ~399 ms | |
- | GLM-4-9B-Chat-1M | 9B | INT4 Q8 FP16 | 106 tok/s 78 tok/s 48 tok/s | ~387 ms ~391 ms ~399 ms | |
- | GLM-4V | 9B | INT4 Q8 FP16 | 106 tok/s 78 tok/s 48 tok/s | ~387 ms ~391 ms ~399 ms | |
- | Yi-9B | 9B | INT4 Q8 FP16 | 106 tok/s 78 tok/s 48 tok/s | ~387 ms ~391 ms ~399 ms | |
- | Sahabat-AI-Gemma2-9B | 9.2B | INT4 Q8 FP16 | 105 tok/s 77 tok/s 48 tok/s | ~395 ms ~399 ms ~407 ms | |
- | Sahabat-AI-Gemma2-9B-Instruct | 9.2B | INT4 Q8 FP16 | 105 tok/s 77 tok/s 48 tok/s | ~395 ms ~399 ms ~407 ms | |
- | GreenMind-14B-R1 | 14B | INT4 Q8 FP16 | 79 tok/s 55 tok/s 33 tok/s | ~594 ms ~599 ms ~611 ms | |
- | Falcon-40B | 40B | INT4 Q8 | 46 tok/s 26 tok/s | ~1.6s ~1.7s | |
- | Hunyuan A13B | 80B (13B active) | INT4 | 46 tok/s | ~701 ms | |
- | Typhoon-2-70B | 70B | INT4 | 22 tok/s | ~2.9s | |
- | Kimi-Dev-72B | 72B | INT4 | 21 tok/s | ~2.9s | |
不同量化精度下可运行的最大模型参数级别。
上下文长度:
4位量化
70B+ 模型
8位精度
32B 模型
16位全精度
32B 模型
本地模型训练与适配器微调支持能力。
微调上下文:
QLoRA
70B+ 模型
LoRA
70B 模型
全参数微调
7B-8B 模型
NVIDIA RTX PRO 5000 Blackwell (72GB) 上的最佳量化精度与运行规格建议。
最佳推理区间
适合在 Q4/Q8 精度下运行 70B 参数级模型并支持 32k 上下文扩展,或对中小型模型进行高并发批处理推理。
显存带宽与推理速率
具备 1344 GB/s 聚合带宽,单批次推理处于显存带宽受限模式。8B Q4 模型预估生成速度约 299 tok/s,70B Q4 模型预估生成速度约 35 tok/s。
APX AI
在线
我可以读取您正在浏览的页面。随时向我提问!