趋近智
NVIDIA RTX 5090 (32GB) 配备 32 GB 专用显存与 1792 GB/s 显存带宽,支持 CUDA 和 TensorRT-LLM 运行环境,可进行全精度与量化大模型推理。
总显存
32 GB
可用显存上限
32 GB
显存带宽
1792 GB/s
最大推理模型级别
32B 模型 (Q4)
热设计功耗
575W
随上下文长度增长的显存需求评估。当曲线超过参考线时将导致显存不足(OOM)。
量化精度:
主流开源大模型在 NVIDIA RTX 5090 (32GB) 上的推理速度、显存兼容性与生成吞吐表现。
排序:
上下文长度:
KV 缓存:
显卡数量:
| 排名 | 模型 | 参数量 | 量化精度 | 预估 TPS | TTFT | 可运行 |
|---|---|---|---|---|---|---|
#33 | Qwen 3.8 27B | 27B | INT4 Q8 | 78 tok/s 46 tok/s | ~723 ms ~792 ms | |
#49 | Agnes 3.0 Flash | 33B | INT4 | 67 tok/s | ~878 ms | |
#72 | K2 Horizon MoVA 36B A4B | 36B (4B active) | INT4 | 214 tok/s | ~147 ms | |
#80 | Qwen3.5-27B | 27B | INT4 Q8 | 78 tok/s 46 tok/s | ~723 ms ~792 ms | |
#84 | MiMo V2 Flash | 15B (309B active) | INT4 Q8 | 9 tok/s 5 tok/s | ~7.8s ~7.9s | |
#87 | Sarvam-30B | 32B (2.4B active) | INT4 | 245 tok/s | ~104 ms | |
#90 | Muse Glimmer 30B | 30B | INT4 Q8 | 72 tok/s 39 tok/s | ~801 ms ~948 ms | |
#95 | Qwen3.6 35B A3B | 35B (3B active) | INT4 | 232 tok/s | ~121 ms | |
#96 | Phi-4 Reasoning Plus | 14B | INT4 Q8 FP16 | 98 tok/s 70 tok/s 38 tok/s | ~386 ms ~390 ms ~466 ms | |
#102 | Gemma 4 26B A4B | 25.2B (3.8B active) | INT4 Q8 | 222 tok/s 169 tok/s | ~135 ms ~147 ms | |
#110 | Qwen3.5-35B-A3B | 35B (3B active) | INT4 | 232 tok/s | ~121 ms | |
#117 | Qwen3.5-9B | 9B | INT4 Q8 FP16 | 163 tok/s 113 tok/s 68 tok/s | ~251 ms ~254 ms ~260 ms | |
#119 | K2 Horizon 7B | 7B | INT4 Q8 FP16 | 186 tok/s 134 tok/s 83 tok/s | ~198 ms ~200 ms ~205 ms | |
#124 | Gemma 4 12B | 11.95B | INT4 Q8 FP16 | 108 tok/s 79 tok/s 46 tok/s | ~331 ms ~335 ms ~371 ms | |
#127 | Gemma 4 31B | 30.7B | INT4 Q8 | 71 tok/s 39 tok/s | ~819 ms ~969 ms | |
#130 | Nemotron 3.5 Lightning | 30B (3B active) | INT4 | 128 tok/s | ~122 ms | |
#131 | Qwen3.5-4B | 4B | INT4 Q8 FP16 | 234 tok/s 183 tok/s 124 tok/s | ~119 ms ~120 ms ~123 ms | |
#133 | GPT-OSS 20B | 21B (3.6B active) | INT4 Q8 | 139 tok/s 118 tok/s | ~129 ms ~141 ms | |
#139 | NVIDIA Nemotron 3 Nano 30B-A3B | 3.5B (30B active) | INT4 Q8 FP16 | 69 tok/s 43 tok/s 23 tok/s | ~777 ms ~786 ms ~805 ms | |
#143 | Qwen3-30B-A3B | 30B (3B active) | INT4 Q8 | 234 tok/s 175 tok/s | ~119 ms ~139 ms | |
#145 | Granite 4.2 8B | 8B | INT4 Q8 FP16 | 174 tok/s 123 tok/s 75 tok/s | ~224 ms ~227 ms ~232 ms | |
#150 | Gemma 4 E4B | 8B | INT4 Q8 FP16 | 174 tok/s 123 tok/s 75 tok/s | ~224 ms ~227 ms ~232 ms | |
#152 | Nemotron 3.5 Lightning 30B A3B | 30B (3B active) | INT4 Q8 | 234 tok/s 175 tok/s | ~119 ms ~139 ms | |
#153 | Mistral Large 3 | 41B (675B active) | INT4 | 4 tok/s | ~20.1s | |
#155 | GLM-4 | 32B | INT4 | 55 tok/s | ~856 ms | |
#157 | GLM-4V | 9B | INT4 Q8 FP16 | 129 tok/s 97 tok/s 62 tok/s | ~253 ms ~255 ms ~261 ms | |
#157 | Phi-4 | 14B | INT4 Q8 FP16 | 125 tok/s 82 tok/s 44 tok/s | ~384 ms ~388 ms ~430 ms | |
#157 | Gemma 3 27B | 27B | INT4 Q8 | 78 tok/s 46 tok/s | ~723 ms ~792 ms | |
#162 | Qwen3-32B | 32B | INT4 | 68 tok/s | ~853 ms | |
#163 | Qwen2.5-32B | 32B | INT4 | 68 tok/s | ~853 ms | |
#164 | DeepSeek-R1 32B | 32B | INT4 Q8 | 70 tok/s 38 tok/s | ~852 ms ~1.0s | |
#166 | Magistral Small | 24B | INT4 Q8 | 68 tok/s 44 tok/s | ~648 ms ~710 ms | |
#167 | OLMo 3.1 32B Instruct | 32B | INT4 | 55 tok/s | ~856 ms | |
#171 | Ministral 3 14B | 14B | INT4 Q8 FP16 | 98 tok/s 70 tok/s 38 tok/s | ~386 ms ~390 ms ~466 ms | |
#172 | DeepSeek-R1 14B | 14B | INT4 Q8 FP16 | 128 tok/s 83 tok/s 45 tok/s | ~383 ms ~388 ms ~430 ms | |
#175 | Gemma 3 12B | 12B | INT4 Q8 FP16 | 138 tok/s 92 tok/s 53 tok/s | ~331 ms ~334 ms ~342 ms | |
#179 | Mistral-Small-2501 | 24B | INT4 Q8 | 85 tok/s 50 tok/s | ~645 ms ~707 ms | |
#180 | OLMo 3 32B Base | 32B | INT4 | 55 tok/s | ~856 ms | |
#181 | Ministral 3 8B | 8B | INT4 Q8 FP16 | 139 tok/s 106 tok/s 68 tok/s | ~226 ms ~228 ms ~233 ms | |
#182 | OLMo 3 7B Think | 7B | INT4 Q8 FP16 | 149 tok/s 115 tok/s 75 tok/s | ~199 ms ~201 ms ~206 ms | |
#183 | Gemma 2 27B | 27B | INT4 Q8 | 78 tok/s 46 tok/s | ~723 ms ~792 ms | |
#184 | Qwen3.5-2B | 2B | INT4 Q8 FP16 | 283 tok/s 243 tok/s 184 tok/s | ~67 ms ~67 ms ~68 ms | |
#185 | Qwen2.5-14B | 14B | INT4 Q8 FP16 | 125 tok/s 82 tok/s 44 tok/s | ~384 ms ~388 ms ~430 ms | |
#186 | MiniCPM5-2B | 2B | INT4 Q8 FP16 | 283 tok/s 243 tok/s 184 tok/s | ~67 ms ~67 ms ~68 ms | |
#187 | OLMo 3.1 32B Think | 32B | INT4 | 55 tok/s | ~856 ms | |
#188 | Gemma 4 E2B | 5.1B | INT4 Q8 FP16 | 214 tok/s 161 tok/s 105 tok/s | ~148 ms ~149 ms ~153 ms | |
#191 | Ministral 3 3B | 3B | INT4 Q8 FP16 | 207 tok/s 177 tok/s 131 tok/s | ~94 ms ~94 ms ~96 ms | |
#192 | DeepSeek-R1 8B | 8B | INT4 Q8 FP16 | 177 tok/s 124 tok/s 75 tok/s | ~224 ms ~227 ms ~232 ms | |
#194 | Gemma 2 9B | 9B | INT4 Q8 FP16 | 163 tok/s 113 tok/s 68 tok/s | ~251 ms ~254 ms ~260 ms | |
#195 | Kimi Linear 48B A3B Instruct | 48B (3B active) | INT4 | 102 tok/s | ~153 ms | |
#196 | Qwen2.5-7B | 7B | INT4 Q8 FP16 | 186 tok/s 134 tok/s 83 tok/s | ~198 ms ~200 ms ~205 ms | |
#197 | Gemma 3 4B | 4B | INT4 Q8 FP16 | 234 tok/s 183 tok/s 124 tok/s | ~119 ms ~120 ms ~123 ms | |
#198 | Qwen3-4B | 4B | INT4 Q8 FP16 | 234 tok/s 183 tok/s 124 tok/s | ~119 ms ~120 ms ~123 ms | |
#199 | DeepSeek-R1 7B | 7B | INT4 Q8 FP16 | 188 tok/s 135 tok/s 83 tok/s | ~198 ms ~200 ms ~205 ms | |
#200 | Llama 3.1 8B | 8B | INT4 Q8 FP16 | 174 tok/s 123 tok/s 75 tok/s | ~224 ms ~227 ms ~232 ms | |
#201 | Qwen3-14B | 14B | INT4 Q8 FP16 | 125 tok/s 82 tok/s 44 tok/s | ~384 ms ~388 ms ~430 ms | |
#203 | Command R | 35B | INT4 | 51 tok/s | ~934 ms | |
#205 | Llama 3 8B | 8B | INT4 Q8 FP16 | 174 tok/s 123 tok/s 75 tok/s | ~224 ms ~227 ms ~232 ms | |
#206 | Gemma 3 270M | 0.27B | INT4 Q8 FP16 | 346 tok/s 337 tok/s 318 tok/s | ~15 ms ~16 ms ~16 ms | |
#207 | Qwen3-1.7B | 1.7B | INT4 Q8 FP16 | 293 tok/s 256 tok/s 199 tok/s | ~58 ms ~58 ms ~60 ms | |
#208 | Qwen3-0.6B | 0.6B | INT4 Q8 FP16 | 339 tok/s 320 tok/s 284 tok/s | ~25 ms ~25 ms ~26 ms | |
#209 | Phi-4-Mini | 3.8B | INT4 Q8 FP16 | 238 tok/s 188 tok/s 128 tok/s | ~114 ms ~115 ms ~117 ms | |
#210 | Qwen3-8B | 8B | INT4 Q8 FP16 | 174 tok/s 123 tok/s 75 tok/s | ~224 ms ~227 ms ~232 ms | |
#211 | Mixtral-8x7B-v0.1 | 46.7B (7B active) | INT4 | 163 tok/s | ~247 ms | |
#212 | Ministral-8B-2410 | 8B | INT4 Q8 FP16 | 174 tok/s 123 tok/s 75 tok/s | ~224 ms ~227 ms ~232 ms | |
#213 | DeepSeek-R1 1.5B | 1.5B | INT4 Q8 FP16 | 300 tok/s 265 tok/s 210 tok/s | ~52 ms ~53 ms ~54 ms | |
#214 | Llama 3.2 3B | 3B | INT4 Q8 FP16 | 256 tok/s 209 tok/s 148 tok/s | ~93 ms ~94 ms ~96 ms | |
#215 | Phi-3-mini | 3.8B | INT4 Q8 FP16 | 238 tok/s 188 tok/s 128 tok/s | ~114 ms ~115 ms ~117 ms | |
#216 | Qwen3.5-0.8B | 0.8B | INT4 Q8 FP16 | 329 tok/s 306 tok/s 263 tok/s | ~31 ms ~32 ms ~32 ms | |
#217 | Gemma 3n E2B IT | 6B (2B active) | INT4 Q8 FP16 | 207 tok/s 188 tok/s 151 tok/s | ~72 ms ~72 ms ~74 ms | |
#218 | Gemma 2 2B | 2B | INT4 Q8 FP16 | 283 tok/s 243 tok/s 184 tok/s | ~67 ms ~67 ms ~68 ms | |
#219 | Mistral-7B-Instruct-v0.1 | 7.3B | INT4 Q8 FP16 | 182 tok/s 130 tok/s 80 tok/s | ~206 ms ~208 ms ~213 ms | |
#220 | Llama 3.2 1B | 1B | INT4 Q8 FP16 | 320 tok/s 292 tok/s 245 tok/s | ~38 ms ~38 ms ~39 ms | |
#221 | Phi-3-medium | 14B | INT4 Q8 FP16 | 125 tok/s 82 tok/s 44 tok/s | ~384 ms ~388 ms ~430 ms | |
#222 | Yi-34B | 34B | INT4 | 52 tok/s | ~908 ms | |
#223 | OLMo 3 7B Instruct | 7B | INT4 Q8 FP16 | 149 tok/s 115 tok/s 75 tok/s | ~199 ms ~201 ms ~206 ms | |
#224 | Gemma 1 7B | 7B | INT4 Q8 FP16 | 149 tok/s 115 tok/s 75 tok/s | ~199 ms ~201 ms ~206 ms | |
#225 | Qwen2-7B | 7B | INT4 Q8 FP16 | 186 tok/s 134 tok/s 83 tok/s | ~198 ms ~200 ms ~205 ms | |
#226 | Phi-3-small | 7B | INT4 Q8 FP16 | 186 tok/s 134 tok/s 83 tok/s | ~198 ms ~200 ms ~205 ms | |
#227 | Gemma 3 1B | 1B | INT4 Q8 FP16 | 320 tok/s 292 tok/s 245 tok/s | ~38 ms ~38 ms ~39 ms | |
#228 | Mistral-7B-Instruct-v0.2 | 7.3B | INT4 Q8 FP16 | 182 tok/s 130 tok/s 80 tok/s | ~206 ms ~208 ms ~213 ms | |
#230 | Gemma 1 2B | 2B | INT4 Q8 FP16 | 291 tok/s 248 tok/s 187 tok/s | ~66 ms ~67 ms ~68 ms | |
#231 | ChatGLM3-6B | 6B | INT4 Q8 FP16 | 160 tok/s 126 tok/s 84 tok/s | ~173 ms ~175 ms ~179 ms | |
#232 | ChatGLM2-6B | 6B | INT4 Q8 FP16 | 160 tok/s 126 tok/s 84 tok/s | ~173 ms ~175 ms ~179 ms | |
#233 | ChatGLM-6B | 6B | INT4 Q8 FP16 | 160 tok/s 126 tok/s 84 tok/s | ~173 ms ~175 ms ~179 ms | |
未上榜模型(按推理速度排序) | ||||||
- | Qwen2-0.5B | 0.5B | INT4 Q8 FP16 | 344 tok/s 328 tok/s 296 tok/s | ~22 ms ~22 ms ~23 ms | |
- | Qwen2.5-0.5B | 0.5B | INT4 Q8 FP16 | 344 tok/s 328 tok/s 296 tok/s | ~22 ms ~22 ms ~23 ms | |
- | ERNIE-4.5-0.3B | 0.3B | INT4 Q8 FP16 | 342 tok/s 333 tok/s 313 tok/s | ~16 ms ~16 ms ~17 ms | |
- | ERNIE-4.5-0.3B-Base | 0.3B | INT4 Q8 FP16 | 342 tok/s 333 tok/s 313 tok/s | ~16 ms ~16 ms ~17 ms | |
- | Falcon-1B | 1B | INT4 Q8 FP16 | 325 tok/s 297 tok/s 248 tok/s | ~38 ms ~38 ms ~39 ms | |
- | Falcon3-1B | 1B | INT4 Q8 FP16 | 320 tok/s 292 tok/s 245 tok/s | ~38 ms ~38 ms ~39 ms | |
- | Qwen2-1.5B | 1.5B | INT4 Q8 FP16 | 300 tok/s 265 tok/s 210 tok/s | ~52 ms ~53 ms ~54 ms | |
- | Qwen2.5-1.5B | 1.5B | INT4 Q8 FP16 | 300 tok/s 265 tok/s 210 tok/s | ~52 ms ~53 ms ~54 ms | |
- | Spark X2.5 1.7B | 1.7B | INT4 Q8 FP16 | 293 tok/s 256 tok/s 199 tok/s | ~58 ms ~58 ms ~60 ms | |
- | Hy-MT2 1.8B | 1.8B | INT4 Q8 FP16 | 290 tok/s 251 tok/s 194 tok/s | ~61 ms ~61 ms ~62 ms | |
- | Falcon-3B | 3B | INT4 Q8 FP16 | 263 tok/s 213 tok/s 150 tok/s | ~93 ms ~93 ms ~95 ms | |
- | CroissantLLM Base | 1.3B | INT4 Q8 FP16 | 261 tok/s 240 tok/s 199 tok/s | ~47 ms ~47 ms ~48 ms | |
- | Phi-1 | 1.3B | INT4 Q8 FP16 | 261 tok/s 240 tok/s 199 tok/s | ~47 ms ~47 ms ~48 ms | |
- | Phi-1.5 | 1.3B | INT4 Q8 FP16 | 261 tok/s 240 tok/s 199 tok/s | ~47 ms ~47 ms ~48 ms | |
- | DeepSeek-R1 3B | 3B | INT4 Q8 FP16 | 258 tok/s 210 tok/s 148 tok/s | ~93 ms ~94 ms ~95 ms | |
- | Falcon3-3B | 3B | INT4 Q8 FP16 | 256 tok/s 209 tok/s 148 tok/s | ~93 ms ~94 ms ~96 ms | |
- | Qwen2.5-3B | 3B | INT4 Q8 FP16 | 256 tok/s 209 tok/s 148 tok/s | ~93 ms ~94 ms ~96 ms | |
- | ERNIE-4.5-21B-A3B | 21B (3B active) | INT4 Q8 | 240 tok/s 198 tok/s | ~111 ms ~112 ms | |
- | ERNIE-4.5-21B-A3B-Base | 21B (3B active) | INT4 Q8 | 240 tok/s 198 tok/s | ~111 ms ~112 ms | |
- | ERNIE-4.5-VL-28B-A3B | 28B (3B active) | INT4 Q8 | 235 tok/s 186 tok/s | ~117 ms ~127 ms | |
- | ERNIE-4.5-VL-28B-A3B-Base | 28B (3B active) | INT4 Q8 | 235 tok/s 186 tok/s | ~117 ms ~127 ms | |
- | Hy-MT2 30B A3B | 30B (3B active) | INT4 Q8 | 234 tok/s 175 tok/s | ~119 ms ~139 ms | |
- | Spark X2.5 4B | 4B | INT4 Q8 FP16 | 234 tok/s 183 tok/s 124 tok/s | ~119 ms ~120 ms ~123 ms | |
- | Phi-2 | 2.7B | INT4 Q8 FP16 | 213 tok/s 185 tok/s 139 tok/s | ~86 ms ~86 ms ~88 ms | |
- | MaLLaM-3B | 3B | INT4 Q8 FP16 | 207 tok/s 177 tok/s 131 tok/s | ~94 ms ~94 ms ~96 ms | |
- | SmolLM3 3B | 3B | INT4 Q8 FP16 | 207 tok/s 177 tok/s 131 tok/s | ~94 ms ~94 ms ~96 ms | |
- | Falcon-7B | 7B | INT4 Q8 FP16 | 191 tok/s 136 tok/s 84 tok/s | ~198 ms ~200 ms ~205 ms | |
- | Falcon3-7B | 7B | INT4 Q8 FP16 | 186 tok/s 134 tok/s 83 tok/s | ~198 ms ~200 ms ~205 ms | |
- | Hy-MT2 7B | 7B | INT4 Q8 FP16 | 186 tok/s 134 tok/s 83 tok/s | ~198 ms ~200 ms ~205 ms | |
- | Mistral-7B-v0.1 | 7.3B | INT4 Q8 FP16 | 182 tok/s 130 tok/s 80 tok/s | ~206 ms ~208 ms ~213 ms | |
- | LensVLM 9B | 9B | INT4 Q8 FP16 | 163 tok/s 113 tok/s 68 tok/s | ~251 ms ~254 ms ~260 ms | |
- | MiMo V2.6 Distill Qwen 9B | 9B | INT4 Q8 FP16 | 163 tok/s 113 tok/s 68 tok/s | ~251 ms ~254 ms ~260 ms | |
- | ChatGLM3-6B-32K | 6B | INT4 Q8 FP16 | 160 tok/s 126 tok/s 84 tok/s | ~173 ms ~175 ms ~179 ms | |
- | Yi-6B | 6B | INT4 Q8 FP16 | 160 tok/s 126 tok/s 84 tok/s | ~173 ms ~175 ms ~179 ms | |
- | Falcon3-10B | 10B | INT4 Q8 FP16 | 154 tok/s 105 tok/s 62 tok/s | ~277 ms ~280 ms ~287 ms | |
- | Kimi-VL-A3B-Instruct | 16B (3B active) | INT4 Q8 | 154 tok/s 139 tok/s | ~110 ms ~110 ms | |
- | Falcon2-11B | 11B | INT4 Q8 FP16 | 150 tok/s 100 tok/s 58 tok/s | ~304 ms ~307 ms ~314 ms | |
- | Hunyuan Lite | 7B | INT4 Q8 FP16 | 149 tok/s 115 tok/s 75 tok/s | ~199 ms ~201 ms ~206 ms | |
- | OLMo 3 7B Base | 7B | INT4 Q8 FP16 | 149 tok/s 115 tok/s 75 tok/s | ~199 ms ~201 ms ~206 ms | |
- | SEA-LION-7B | 7.1B | INT4 Q8 FP16 | 148 tok/s 114 tok/s 74 tok/s | ~202 ms ~204 ms ~209 ms | |
- | SEA-LION-7B-Instruct | 7.1B | INT4 Q8 FP16 | 148 tok/s 114 tok/s 74 tok/s | ~202 ms ~204 ms ~209 ms | |
- | Sahabat-AI-Llama3-8B-Instruct | 8B | INT4 Q8 FP16 | 139 tok/s 106 tok/s 68 tok/s | ~226 ms ~228 ms ~233 ms | |
- | Typhoon-2-8B | 8B | INT4 Q8 FP16 | 139 tok/s 106 tok/s 68 tok/s | ~226 ms ~228 ms ~233 ms | |
- | GLM-4-9B | 9B | INT4 Q8 FP16 | 129 tok/s 97 tok/s 62 tok/s | ~253 ms ~255 ms ~261 ms | |
- | GLM-4-9B-Chat | 9B | INT4 Q8 FP16 | 129 tok/s 97 tok/s 62 tok/s | ~253 ms ~255 ms ~261 ms | |
- | GLM-4-9B-Chat-1M | 9B | INT4 Q8 FP16 | 129 tok/s 97 tok/s 62 tok/s | ~253 ms ~255 ms ~261 ms | |
- | Yi-9B | 9B | INT4 Q8 FP16 | 129 tok/s 97 tok/s 62 tok/s | ~253 ms ~255 ms ~261 ms | |
- | Sahabat-AI-Gemma2-9B | 9.2B | INT4 Q8 FP16 | 128 tok/s 96 tok/s 61 tok/s | ~258 ms ~260 ms ~266 ms | |
- | Sahabat-AI-Gemma2-9B-Instruct | 9.2B | INT4 Q8 FP16 | 128 tok/s 96 tok/s 61 tok/s | ~258 ms ~260 ms ~266 ms | |
- | GreenMind-14B-R1 | 14B | INT4 Q8 FP16 | 98 tok/s 70 tok/s 38 tok/s | ~386 ms ~390 ms ~466 ms | |
- | Falcon-40B | 40B | INT4 | 58 tok/s | ~1.1s | |
不同量化精度下可运行的最大模型参数级别。
上下文长度:
4位量化
32B 模型
8位精度
14B 模型
16位全精度
14B 模型
本地模型训练与适配器微调支持能力。
微调上下文:
QLoRA
32B 模型
LoRA
14B 模型
全参数微调
3B 模型
NVIDIA RTX 5090 (32GB) 上的最佳量化精度与运行规格建议。
最佳推理区间
适合在全精度或 Q8 精度下运行 14B 模型,以及在 Q4 精度下搭配最高 32k 上下文运行 32B 模型。
显存带宽与推理速率
具备 1792 GB/s 聚合带宽,单批次推理处于显存带宽受限模式。8B Q4 模型预估生成速度约 398 tok/s,70B Q4 模型预估生成速度约 47 tok/s。
Assistant
在线