The NVIDIA RTX 5000 Blackwell (48GB) features 48 GB of dedicated VRAM and 1344 GB/s memory bandwidth, supporting CUDA and TensorRT-LLM runtimes for full-precision and quantized inference.
Memory
48 GB
Usable Memory Ceiling
48 GB
Bandwidth
1344 GB/s
Max Inference Class
32B Models (Q4)
TDP
250W
Estimated memory requirements as context length increases. Curves crossing above the reference line indicate Out of Memory (OOM).
Precision:
Inference throughput, memory compatibility, and generation speeds for open-weights LLMs on NVIDIA RTX 5000 Blackwell (48GB).
Sort by:
Context:
KV Cache:
GPUs:
| Rank | Model | Parameters | Precision | TPS (Approx.) | TTFT | Can Run |
|---|---|---|---|---|---|---|
#33 | Qwen 3.8 27B | 27B | INT4 Q8 | 62 tok/s 37 tok/s | ~1.1s ~1.1s | |
#48 | Agnes 3.0 Flash | 33B | INT4 Q8 | 52 tok/s 31 tok/s | ~1.4s ~1.4s | |
#72 | K2 Horizon MoVA 36B A4B | 36B (4B active) | INT4 Q8 | 188 tok/s 146 tok/s | ~224 ms ~226 ms | |
#83 | Qwen3.5-27B | 27B | INT4 Q8 | 62 tok/s 37 tok/s | ~1.1s ~1.1s | |
#92 | Sarvam-30B | 32B (2.4B active) | INT4 Q8 | 221 tok/s 184 tok/s | ~158 ms ~159 ms | |
#94 | Qwen3.6 35B A3B | 35B (3B active) | INT4 Q8 | 207 tok/s 167 tok/s | ~183 ms ~184 ms | |
#96 | Muse Glimmer 30B | 30B | INT4 Q8 | 57 tok/s 34 tok/s | ~1.2s ~1.3s | |
#100 | Phi-4 Reasoning Plus | 14B | INT4 Q8 FP16 | 79 tok/s 55 tok/s 33 tok/s | ~594 ms ~599 ms ~611 ms | |
#101 | MiMo V2 Flash | 15B (309B active) | INT4 Q8 FP16 | 7 tok/s 4 tok/s 2 tok/s | ~12.2s ~12.3s ~12.6s | |
#108 | Gemma 4 26B A4B | 25.2B (3.8B active) | INT4 Q8 | 196 tok/s 152 tok/s | ~205 ms ~207 ms | |
#109 | Gemma 4 12B | 11.95B | INT4 Q8 FP16 | 88 tok/s 63 tok/s 38 tok/s | ~509 ms ~514 ms ~524 ms | |
#113 | Qwen3.5-9B | 9B | INT4 Q8 FP16 | 137 tok/s 92 tok/s 53 tok/s | ~385 ms ~389 ms ~397 ms | |
#114 | Qwen3.5-35B-A3B | 35B (3B active) | INT4 Q8 | 207 tok/s 167 tok/s | ~183 ms ~184 ms | |
#118 | K2 Horizon 7B | 7B | INT4 Q8 FP16 | 159 tok/s 110 tok/s 66 tok/s | ~303 ms ~306 ms ~312 ms | |
#128 | NVIDIA Nemotron 3 Nano 30B-A3B | 3.5B (30B active) | INT4 Q8 FP16 | 54 tok/s 33 tok/s 18 tok/s | ~1.2s ~1.2s ~1.2s | |
#129 | Gemma 4 31B | 30.7B | INT4 Q8 | 56 tok/s 33 tok/s | ~1.3s ~1.3s | |
#131 | Nemotron 3.5 Lightning | 30B (3B active) | INT4 Q8 | 105 tok/s 97 tok/s | ~185 ms ~185 ms | |
#132 | Qwen3.5-4B | 4B | INT4 Q8 FP16 | 208 tok/s 157 tok/s 101 tok/s | ~180 ms ~182 ms ~186 ms | |
#133 | Qwen3-30B-A3B | 30B (3B active) | INT4 Q8 | 208 tok/s 168 tok/s | ~180 ms ~181 ms | |
#136 | GPT-OSS 20B | 21B (3.6B active) | INT4 Q8 FP16 | 115 tok/s 102 tok/s 70 tok/s | ~196 ms ~197 ms ~234 ms | |
#146 | Granite 4.2 8B | 8B | INT4 Q8 FP16 | 147 tok/s 100 tok/s 59 tok/s | ~344 ms ~347 ms ~354 ms | |
#150 | Gemma 4 E4B | 8B | INT4 Q8 FP16 | 147 tok/s 100 tok/s 59 tok/s | ~344 ms ~347 ms ~354 ms | |
#151 | Nemotron 3.5 Lightning 30B A3B | 30B (3B active) | INT4 Q8 | 208 tok/s 168 tok/s | ~180 ms ~181 ms | |
#153 | Qwen3-32B | 32B | INT4 Q8 | 54 tok/s 32 tok/s | ~1.3s ~1.3s | |
#154 | Qwen2.5-72B | 72B | INT4 | 25 tok/s | ~3.2s | |
#155 | Mistral Large 3 | 41B (675B active) | INT4 | 3 tok/s | ~26.5s | |
#156 | GLM-4 | 32B | INT4 Q8 | 43 tok/s 27 tok/s | ~1.3s ~1.4s | |
#157 | DeepSeek-R1 70B | 70B | INT4 | 28 tok/s | ~2.9s | |
#158 | GLM-4V | 9B | INT4 Q8 FP16 | 106 tok/s 78 tok/s 48 tok/s | ~387 ms ~391 ms ~399 ms | |
#159 | Gemma 3 27B | 27B | INT4 Q8 | 62 tok/s 37 tok/s | ~1.1s ~1.1s | |
#160 | Phi-4 | 14B | INT4 Q8 FP16 | 102 tok/s 65 tok/s 36 tok/s | ~591 ms ~596 ms ~609 ms | |
#161 | Llama 3.3 70B | 70B | INT4 | 27 tok/s | ~2.9s | |
#162 | DeepSeek-R1 32B | 32B | INT4 Q8 | 55 tok/s 32 tok/s | ~1.3s ~1.3s | |
#163 | Hunyuan Standard | 52B (389B active) | INT4 | 5 tok/s | ~15.3s | |
#164 | Qwen2.5-32B | 32B | INT4 Q8 | 54 tok/s 32 tok/s | ~1.3s ~1.3s | |
#168 | Magistral Small | 24B | INT4 Q8 | 53 tok/s 36 tok/s | ~1.0s ~1.0s | |
#169 | OLMo 3 7B Think | 7B | INT4 Q8 FP16 | 124 tok/s 93 tok/s 59 tok/s | ~305 ms ~307 ms ~313 ms | |
#170 | OLMo 3.1 32B Instruct | 32B | INT4 Q8 | 43 tok/s 27 tok/s | ~1.3s ~1.4s | |
#171 | Llama 3.1 70B | 70B | INT4 | 27 tok/s | ~2.9s | |
#172 | DeepSeek-R1 14B | 14B | INT4 Q8 FP16 | 105 tok/s 66 tok/s 37 tok/s | ~591 ms ~596 ms ~609 ms | |
#173 | Ministral 3 14B | 14B | INT4 Q8 FP16 | 79 tok/s 55 tok/s 33 tok/s | ~594 ms ~599 ms ~611 ms | |
#177 | Gemma 3 12B | 12B | INT4 Q8 FP16 | 114 tok/s 74 tok/s 42 tok/s | ~509 ms ~514 ms ~524 ms | |
#179 | Qwen2-72B | 72B | INT4 | 25 tok/s | ~3.2s | |
#180 | OLMo 3 32B Base | 32B | INT4 Q8 | 43 tok/s 27 tok/s | ~1.3s ~1.4s | |
#181 | Mistral-Small-2501 | 24B | INT4 Q8 FP16 | 68 tok/s 41 tok/s 20 tok/s | ~997 ms ~1.0s ~1.2s | |
#182 | Ministral 3 8B | 8B | INT4 Q8 FP16 | 115 tok/s 85 tok/s 53 tok/s | ~346 ms ~349 ms ~356 ms | |
#183 | Qwen3.5-2B | 2B | INT4 Q8 FP16 | 262 tok/s 218 tok/s 158 tok/s | ~99 ms ~100 ms ~102 ms | |
#184 | MiniCPM5-2B | 2B | INT4 Q8 FP16 | 262 tok/s 218 tok/s 158 tok/s | ~99 ms ~100 ms ~102 ms | |
#185 | Qwen2.5-14B | 14B | INT4 Q8 FP16 | 102 tok/s 65 tok/s 36 tok/s | ~591 ms ~596 ms ~609 ms | |
#186 | Gemma 2 27B | 27B | INT4 Q8 | 62 tok/s 37 tok/s | ~1.1s ~1.1s | |
#187 | OLMo 3.1 32B Think | 32B | INT4 Q8 | 43 tok/s 27 tok/s | ~1.3s ~1.4s | |
#188 | Gemma 4 E2B | 5.1B | INT4 Q8 FP16 | 187 tok/s 136 tok/s 85 tok/s | ~225 ms ~227 ms ~232 ms | |
#189 | Qwen3-4B | 4B | INT4 Q8 FP16 | 208 tok/s 157 tok/s 101 tok/s | ~180 ms ~182 ms ~186 ms | |
#190 | DeepSeek-R1 8B | 8B | INT4 Q8 FP16 | 150 tok/s 102 tok/s 59 tok/s | ~344 ms ~347 ms ~354 ms | |
#191 | Llama 3 70B | 70B | INT4 | 27 tok/s | ~2.9s | |
#193 | Ministral 3 3B | 3B | INT4 Q8 FP16 | 181 tok/s 151 tok/s 108 tok/s | ~141 ms ~142 ms ~145 ms | |
#195 | Qwen3-14B | 14B | INT4 Q8 FP16 | 102 tok/s 65 tok/s 36 tok/s | ~591 ms ~596 ms ~609 ms | |
#196 | Kimi Linear 48B A3B Instruct | 48B (3B active) | INT4 | 92 tok/s | ~200 ms | |
#197 | Gemma 2 9B | 9B | INT4 Q8 FP16 | 137 tok/s 92 tok/s 53 tok/s | ~385 ms ~389 ms ~397 ms | |
#198 | Qwen2.5-7B | 7B | INT4 Q8 FP16 | 159 tok/s 110 tok/s 66 tok/s | ~303 ms ~306 ms ~312 ms | |
#199 | Qwen3-8B | 8B | INT4 Q8 FP16 | 147 tok/s 100 tok/s 59 tok/s | ~344 ms ~347 ms ~354 ms | |
#200 | Gemma 3 4B | 4B | INT4 Q8 FP16 | 208 tok/s 157 tok/s 101 tok/s | ~180 ms ~182 ms ~186 ms | |
#201 | DeepSeek-R1 7B | 7B | INT4 Q8 FP16 | 162 tok/s 112 tok/s 66 tok/s | ~303 ms ~306 ms ~312 ms | |
#202 | Llama 3.1 8B | 8B | INT4 Q8 FP16 | 147 tok/s 100 tok/s 59 tok/s | ~344 ms ~347 ms ~354 ms | |
#204 | Qwen3-1.7B | 1.7B | INT4 Q8 FP16 | 274 tok/s 232 tok/s 172 tok/s | ~86 ms ~86 ms ~88 ms | |
#205 | Command R | 35B | INT4 Q8 | 40 tok/s 25 tok/s | ~1.4s ~1.6s | |
#206 | Gemma 3 270M | 0.27B | INT4 Q8 FP16 | 338 tok/s 327 tok/s 304 tok/s | ~20 ms ~20 ms ~20 ms | |
#208 | Llama 3 8B | 8B | INT4 Q8 FP16 | 147 tok/s 100 tok/s 59 tok/s | ~344 ms ~347 ms ~354 ms | |
#209 | Qwen3-0.6B | 0.6B | INT4 Q8 FP16 | 330 tok/s 306 tok/s 264 tok/s | ~35 ms ~35 ms ~36 ms | |
#210 | Phi-4-Mini | 3.8B | INT4 Q8 FP16 | 213 tok/s 161 tok/s 105 tok/s | ~172 ms ~174 ms ~177 ms | |
#211 | Mixtral-8x7B-v0.1 | 46.7B (7B active) | INT4 Q8 | 146 tok/s 94 tok/s | ~350 ms ~413 ms | |
#212 | Ministral-8B-2410 | 8B | INT4 Q8 FP16 | 147 tok/s 100 tok/s 59 tok/s | ~344 ms ~347 ms ~354 ms | |
#213 | DeepSeek-R1 1.5B | 1.5B | INT4 Q8 FP16 | 283 tok/s 242 tok/s 184 tok/s | ~77 ms ~77 ms ~79 ms | |
#214 | Llama 3.2 3B | 3B | INT4 Q8 FP16 | 232 tok/s 182 tok/s 123 tok/s | ~140 ms ~141 ms ~143 ms | |
#215 | Qwen3.5-0.8B | 0.8B | INT4 Q8 FP16 | 318 tok/s 289 tok/s 240 tok/s | ~45 ms ~45 ms ~46 ms | |
#216 | Phi-3-mini | 3.8B | INT4 Q8 FP16 | 213 tok/s 161 tok/s 105 tok/s | ~172 ms ~174 ms ~177 ms | |
#217 | Gemma 3n E2B IT | 6B (2B active) | INT4 Q8 FP16 | 181 tok/s 162 tok/s 126 tok/s | ~107 ms ~108 ms ~109 ms | |
#218 | Mistral-7B-Instruct-v0.1 | 7.3B | INT4 Q8 FP16 | 155 tok/s 107 tok/s 64 tok/s | ~315 ms ~318 ms ~324 ms | |
#219 | Llama 3.2 1B | 1B | INT4 Q8 FP16 | 306 tok/s 273 tok/s 220 tok/s | ~55 ms ~55 ms ~56 ms | |
#220 | Gemma 2 2B | 2B | INT4 Q8 FP16 | 262 tok/s 218 tok/s 158 tok/s | ~99 ms ~100 ms ~102 ms | |
#221 | Phi-3-medium | 14B | INT4 Q8 FP16 | 102 tok/s 65 tok/s 36 tok/s | ~591 ms ~596 ms ~609 ms | |
#222 | OLMo 3 7B Instruct | 7B | INT4 Q8 FP16 | 124 tok/s 93 tok/s 59 tok/s | ~305 ms ~307 ms ~313 ms | |
#223 | Yi-34B | 34B | INT4 Q8 | 41 tok/s 25 tok/s | ~1.4s ~1.5s | |
#224 | Qwen2-7B | 7B | INT4 Q8 FP16 | 159 tok/s 110 tok/s 66 tok/s | ~303 ms ~306 ms ~312 ms | |
#225 | Phi-3-small | 7B | INT4 Q8 FP16 | 159 tok/s 110 tok/s 66 tok/s | ~303 ms ~306 ms ~312 ms | |
#226 | Gemma 3 1B | 1B | INT4 Q8 FP16 | 306 tok/s 273 tok/s 220 tok/s | ~55 ms ~55 ms ~56 ms | |
#227 | Mistral-7B-Instruct-v0.2 | 7.3B | INT4 Q8 FP16 | 155 tok/s 107 tok/s 64 tok/s | ~315 ms ~318 ms ~324 ms | |
#229 | Gemma 1 7B | 7B | INT4 Q8 FP16 | 124 tok/s 93 tok/s 59 tok/s | ~305 ms ~307 ms ~313 ms | |
#230 | Gemma 1 2B | 2B | INT4 Q8 FP16 | 271 tok/s 223 tok/s 160 tok/s | ~99 ms ~100 ms ~102 ms | |
#231 | ChatGLM3-6B | 6B | INT4 Q8 FP16 | 134 tok/s 103 tok/s 67 tok/s | ~264 ms ~266 ms ~271 ms | |
#232 | ChatGLM2-6B | 6B | INT4 Q8 FP16 | 134 tok/s 103 tok/s 67 tok/s | ~264 ms ~266 ms ~271 ms | |
#233 | ChatGLM-6B | 6B | INT4 Q8 FP16 | 134 tok/s 103 tok/s 67 tok/s | ~264 ms ~266 ms ~271 ms | |
Unranked Models (Sorted by Speed) | ||||||
- | Qwen2-0.5B | 0.5B | INT4 Q8 FP16 | 336 tok/s 315 tok/s 277 tok/s | ~30 ms ~30 ms ~31 ms | |
- | Qwen2.5-0.5B | 0.5B | INT4 Q8 FP16 | 336 tok/s 315 tok/s 277 tok/s | ~30 ms ~30 ms ~31 ms | |
- | ERNIE-4.5-0.3B | 0.3B | INT4 Q8 FP16 | 334 tok/s 322 tok/s 297 tok/s | ~21 ms ~21 ms ~22 ms | |
- | ERNIE-4.5-0.3B-Base | 0.3B | INT4 Q8 FP16 | 334 tok/s 322 tok/s 297 tok/s | ~21 ms ~21 ms ~22 ms | |
- | Falcon-1B | 1B | INT4 Q8 FP16 | 313 tok/s 278 tok/s 224 tok/s | ~55 ms ~55 ms ~56 ms | |
- | Falcon3-1B | 1B | INT4 Q8 FP16 | 306 tok/s 273 tok/s 220 tok/s | ~55 ms ~55 ms ~56 ms | |
- | Qwen2-1.5B | 1.5B | INT4 Q8 FP16 | 283 tok/s 242 tok/s 184 tok/s | ~77 ms ~77 ms ~79 ms | |
- | Qwen2.5-1.5B | 1.5B | INT4 Q8 FP16 | 283 tok/s 242 tok/s 184 tok/s | ~77 ms ~77 ms ~79 ms | |
- | Spark X2.5 1.7B | 1.7B | INT4 Q8 FP16 | 274 tok/s 232 tok/s 172 tok/s | ~86 ms ~86 ms ~88 ms | |
- | Hy-MT2 1.8B | 1.8B | INT4 Q8 FP16 | 270 tok/s 227 tok/s 167 tok/s | ~90 ms ~91 ms ~92 ms | |
- | Falcon-3B | 3B | INT4 Q8 FP16 | 240 tok/s 186 tok/s 125 tok/s | ~140 ms ~141 ms ~143 ms | |
- | CroissantLLM Base | 1.3B | INT4 Q8 FP16 | 237 tok/s 215 tok/s 173 tok/s | ~69 ms ~69 ms ~70 ms | |
- | Phi-1 | 1.3B | INT4 Q8 FP16 | 237 tok/s 215 tok/s 173 tok/s | ~69 ms ~69 ms ~70 ms | |
- | Phi-1.5 | 1.3B | INT4 Q8 FP16 | 237 tok/s 215 tok/s 173 tok/s | ~69 ms ~69 ms ~70 ms | |
- | DeepSeek-R1 3B | 3B | INT4 Q8 FP16 | 234 tok/s 183 tok/s 124 tok/s | ~140 ms ~141 ms ~143 ms | |
- | Falcon3-3B | 3B | INT4 Q8 FP16 | 232 tok/s 182 tok/s 123 tok/s | ~140 ms ~141 ms ~143 ms | |
- | Qwen2.5-3B | 3B | INT4 Q8 FP16 | 232 tok/s 182 tok/s 123 tok/s | ~140 ms ~141 ms ~143 ms | |
- | ERNIE-4.5-21B-A3B | 21B (3B active) | INT4 Q8 FP16 | 214 tok/s 172 tok/s 112 tok/s | ~169 ms ~170 ms ~187 ms | |
- | ERNIE-4.5-21B-A3B-Base | 21B (3B active) | INT4 Q8 FP16 | 214 tok/s 172 tok/s 112 tok/s | ~169 ms ~170 ms ~187 ms | |
- | ERNIE-4.5-VL-28B-A3B | 28B (3B active) | INT4 Q8 | 210 tok/s 169 tok/s | ~177 ms ~178 ms | |
- | ERNIE-4.5-VL-28B-A3B-Base | 28B (3B active) | INT4 Q8 | 210 tok/s 169 tok/s | ~177 ms ~178 ms | |
- | Hy-MT2 30B A3B | 30B (3B active) | INT4 Q8 | 208 tok/s 168 tok/s | ~180 ms ~181 ms | |
- | Spark X2.5 4B | 4B | INT4 Q8 FP16 | 208 tok/s 157 tok/s 101 tok/s | ~180 ms ~182 ms ~186 ms | |
- | Phi-2 | 2.7B | INT4 Q8 FP16 | 187 tok/s 158 tok/s 115 tok/s | ~129 ms ~130 ms ~132 ms | |
- | MaLLaM-3B | 3B | INT4 Q8 FP16 | 181 tok/s 151 tok/s 108 tok/s | ~141 ms ~142 ms ~145 ms | |
- | SmolLM3 3B | 3B | INT4 Q8 FP16 | 181 tok/s 151 tok/s 108 tok/s | ~141 ms ~142 ms ~145 ms | |
- | AliceAI Foundation 80B A3B Base | 80B (3B active) | INT4 | 170 tok/s | ~264 ms | |
- | Falcon-7B | 7B | INT4 Q8 FP16 | 164 tok/s 113 tok/s 67 tok/s | ~303 ms ~306 ms ~312 ms | |
- | Falcon3-7B | 7B | INT4 Q8 FP16 | 159 tok/s 110 tok/s 66 tok/s | ~303 ms ~306 ms ~312 ms | |
- | Hy-MT2 7B | 7B | INT4 Q8 FP16 | 159 tok/s 110 tok/s 66 tok/s | ~303 ms ~306 ms ~312 ms | |
- | Mistral-7B-v0.1 | 7.3B | INT4 Q8 FP16 | 155 tok/s 107 tok/s 64 tok/s | ~315 ms ~318 ms ~324 ms | |
- | LensVLM 9B | 9B | INT4 Q8 FP16 | 137 tok/s 92 tok/s 53 tok/s | ~385 ms ~389 ms ~397 ms | |
- | MiMo V2.6 Distill Qwen 9B | 9B | INT4 Q8 FP16 | 137 tok/s 92 tok/s 53 tok/s | ~385 ms ~389 ms ~397 ms | |
- | ChatGLM3-6B-32K | 6B | INT4 Q8 FP16 | 134 tok/s 103 tok/s 67 tok/s | ~264 ms ~266 ms ~271 ms | |
- | Yi-6B | 6B | INT4 Q8 FP16 | 134 tok/s 103 tok/s 67 tok/s | ~264 ms ~266 ms ~271 ms | |
- | Falcon3-10B | 10B | INT4 Q8 FP16 | 129 tok/s 85 tok/s 49 tok/s | ~426 ms ~430 ms ~439 ms | |
- | Kimi-VL-A3B-Instruct | 16B (3B active) | INT4 Q8 FP16 | 129 tok/s 115 tok/s 88 tok/s | ~166 ms ~166 ms ~169 ms | |
- | Falcon2-11B | 11B | INT4 Q8 FP16 | 125 tok/s 81 tok/s 45 tok/s | ~467 ms ~471 ms ~481 ms | |
- | Hunyuan Lite | 7B | INT4 Q8 FP16 | 124 tok/s 93 tok/s 59 tok/s | ~305 ms ~307 ms ~313 ms | |
- | OLMo 3 7B Base | 7B | INT4 Q8 FP16 | 124 tok/s 93 tok/s 59 tok/s | ~305 ms ~307 ms ~313 ms | |
- | SEA-LION-7B | 7.1B | INT4 Q8 FP16 | 123 tok/s 93 tok/s 59 tok/s | ~309 ms ~311 ms ~318 ms | |
- | SEA-LION-7B-Instruct | 7.1B | INT4 Q8 FP16 | 123 tok/s 93 tok/s 59 tok/s | ~309 ms ~311 ms ~318 ms | |
- | Sahabat-AI-Llama3-8B-Instruct | 8B | INT4 Q8 FP16 | 115 tok/s 85 tok/s 53 tok/s | ~346 ms ~349 ms ~356 ms | |
- | Typhoon-2-8B | 8B | INT4 Q8 FP16 | 115 tok/s 85 tok/s 53 tok/s | ~346 ms ~349 ms ~356 ms | |
- | GLM-4-9B | 9B | INT4 Q8 FP16 | 106 tok/s 78 tok/s 48 tok/s | ~387 ms ~391 ms ~399 ms | |
- | GLM-4-9B-Chat | 9B | INT4 Q8 FP16 | 106 tok/s 78 tok/s 48 tok/s | ~387 ms ~391 ms ~399 ms | |
- | GLM-4-9B-Chat-1M | 9B | INT4 Q8 FP16 | 106 tok/s 78 tok/s 48 tok/s | ~387 ms ~391 ms ~399 ms | |
- | Yi-9B | 9B | INT4 Q8 FP16 | 106 tok/s 78 tok/s 48 tok/s | ~387 ms ~391 ms ~399 ms | |
- | Sahabat-AI-Gemma2-9B | 9.2B | INT4 Q8 FP16 | 105 tok/s 77 tok/s 48 tok/s | ~395 ms ~399 ms ~407 ms | |
- | Sahabat-AI-Gemma2-9B-Instruct | 9.2B | INT4 Q8 FP16 | 105 tok/s 77 tok/s 48 tok/s | ~395 ms ~399 ms ~407 ms | |
- | GreenMind-14B-R1 | 14B | INT4 Q8 FP16 | 79 tok/s 55 tok/s 33 tok/s | ~594 ms ~599 ms ~611 ms | |
- | Falcon-40B | 40B | INT4 Q8 | 46 tok/s 25 tok/s | ~1.6s ~1.8s | |
- | Kimi-Dev-72B | 72B | INT4 | 19 tok/s | ~3.5s | |
- | Typhoon-2-70B | 70B | INT4 | 19 tok/s | ~3.4s | |
Maximum model parameter class runnable by weight precision.
Context:
4-bit
32B Models
8-bit
32B Models
16-bit
14B Models
Hardware capacity for local training and adapter fine-tuning.
Context Length:
QLoRA
32B Models
LoRA
14B Models
Full Parameter Training
7B-8B Models
Guidance for optimal precision and operational ceilings on NVIDIA RTX 5000 Blackwell (48GB).
Inference Sweet Spot
Optimized for 14B models at uncompressed or Q8 precision, and 32B models at Q4 with up to 32k context.
Bandwidth & Speed Profile
With 1344 GB/s aggregate bandwidth, batch size 1 inference operates in a memory-bandwidth bound regime. Generates approximately 299 tok/s on an 8B Q4 model and 35 tok/s on a 70B Q4 model.
©2025 ApX Machine Learning
Assistant
Online