The NVIDIA RTX A6000 (48GB) features 48 GB of dedicated VRAM and 768 GB/s memory bandwidth, supporting CUDA and TensorRT-LLM runtimes for full-precision and quantized inference.
Memory
48 GB
Usable Memory Ceiling
48 GB
Bandwidth
768 GB/s
Max Inference Class
32B Models (Q4)
TDP
300W
Estimated memory requirements as context length increases. Curves crossing above the reference line indicate Out of Memory (OOM).
Precision:
Inference throughput, memory compatibility, and generation speeds for open-weights LLMs on NVIDIA RTX A6000 (48GB).
Sort by:
Context:
KV Cache:
GPUs:
| Rank | Model | Parameters | Precision | TPS (Approx.) | TTFT | Can Run |
|---|---|---|---|---|---|---|
#33 | Qwen 3.8 27B | 27B | INT4 Q8 | 38 tok/s 22 tok/s | ~1.9s ~1.9s | |
#48 | Agnes 3.0 Flash | 33B | INT4 Q8 | 32 tok/s 18 tok/s | ~2.3s ~2.4s | |
#72 | K2 Horizon MoVA 36B A4B | 36B (4B active) | INT4 Q8 | 137 tok/s 100 tok/s | ~380 ms ~383 ms | |
#83 | Qwen3.5-27B | 27B | INT4 Q8 | 38 tok/s 22 tok/s | ~1.9s ~1.9s | |
#92 | Sarvam-30B | 32B (2.4B active) | INT4 Q8 | 169 tok/s 134 tok/s | ~267 ms ~268 ms | |
#94 | Qwen3.6 35B A3B | 35B (3B active) | INT4 Q8 | 155 tok/s 118 tok/s | ~310 ms ~312 ms | |
#96 | Muse Glimmer 30B | 30B | INT4 Q8 | 35 tok/s 20 tok/s | ~2.1s ~2.1s | |
#100 | Phi-4 Reasoning Plus | 14B | INT4 Q8 FP16 | 49 tok/s 34 tok/s 20 tok/s | ~1.0s ~1.0s ~1.0s | |
#101 | MiMo V2 Flash | 15B (309B active) | INT4 Q8 FP16 | 4 tok/s 2 tok/s 1 tok/s | ~20.9s ~21.1s ~21.6s | |
#108 | Gemma 4 26B A4B | 25.2B (3.8B active) | INT4 Q8 | 145 tok/s 105 tok/s | ~348 ms ~351 ms | |
#109 | Gemma 4 12B | 11.95B | INT4 Q8 FP16 | 56 tok/s 39 tok/s 23 tok/s | ~872 ms ~879 ms ~898 ms | |
#113 | Qwen3.5-9B | 9B | INT4 Q8 FP16 | 93 tok/s 59 tok/s 33 tok/s | ~658 ms ~664 ms ~678 ms | |
#114 | Qwen3.5-35B-A3B | 35B (3B active) | INT4 Q8 | 155 tok/s 118 tok/s | ~310 ms ~312 ms | |
#118 | K2 Horizon 7B | 7B | INT4 Q8 FP16 | 111 tok/s 72 tok/s 41 tok/s | ~516 ms ~521 ms ~532 ms | |
#128 | NVIDIA Nemotron 3 Nano 30B-A3B | 3.5B (30B active) | INT4 Q8 FP16 | 33 tok/s 20 tok/s 10 tok/s | ~2.1s ~2.1s ~2.1s | |
#129 | Gemma 4 31B | 30.7B | INT4 Q8 | 34 tok/s 20 tok/s | ~2.2s ~2.2s | |
#131 | Nemotron 3.5 Lightning | 30B (3B active) | INT4 Q8 | 69 tok/s 63 tok/s | ~313 ms ~314 ms | |
#132 | Qwen3.5-4B | 4B | INT4 Q8 FP16 | 157 tok/s 109 tok/s 65 tok/s | ~305 ms ~308 ms ~314 ms | |
#133 | Qwen3-30B-A3B | 30B (3B active) | INT4 Q8 | 157 tok/s 119 tok/s | ~305 ms ~307 ms | |
#136 | GPT-OSS 20B | 21B (3.6B active) | INT4 Q8 FP16 | 76 tok/s 66 tok/s 44 tok/s | ~333 ms ~335 ms ~397 ms | |
#146 | Granite 4.2 8B | 8B | INT4 Q8 FP16 | 102 tok/s 65 tok/s 36 tok/s | ~586 ms ~592 ms ~604 ms | |
#150 | Gemma 4 E4B | 8B | INT4 Q8 FP16 | 102 tok/s 65 tok/s 36 tok/s | ~586 ms ~592 ms ~604 ms | |
#151 | Nemotron 3.5 Lightning 30B A3B | 30B (3B active) | INT4 Q8 | 157 tok/s 119 tok/s | ~305 ms ~307 ms | |
#153 | Qwen3-32B | 32B | INT4 Q8 | 33 tok/s 19 tok/s | ~2.3s ~2.3s | |
#154 | Qwen2.5-72B | 72B | INT4 | 15 tok/s | ~5.5s | |
#155 | Mistral Large 3 | 41B (675B active) | INT4 | 2 tok/s | ~45.7s | |
#156 | GLM-4 | 32B | INT4 Q8 | 26 tok/s 16 tok/s | ~2.3s ~2.5s | |
#157 | DeepSeek-R1 70B | 70B | INT4 | 16 tok/s | ~4.9s | |
#158 | GLM-4V | 9B | INT4 Q8 FP16 | 69 tok/s 49 tok/s 29 tok/s | ~661 ms ~667 ms ~681 ms | |
#159 | Gemma 3 27B | 27B | INT4 Q8 | 38 tok/s 22 tok/s | ~1.9s ~1.9s | |
#160 | Phi-4 | 14B | INT4 Q8 FP16 | 66 tok/s 40 tok/s 22 tok/s | ~1.0s ~1.0s ~1.0s | |
#161 | Llama 3.3 70B | 70B | INT4 | 16 tok/s | ~4.9s | |
#162 | DeepSeek-R1 32B | 32B | INT4 Q8 | 34 tok/s 19 tok/s | ~2.3s ~2.3s | |
#163 | Hunyuan Standard | 52B (389B active) | INT4 | 3 tok/s | ~26.4s | |
#164 | Qwen2.5-32B | 32B | INT4 Q8 | 33 tok/s 19 tok/s | ~2.3s ~2.3s | |
#168 | Magistral Small | 24B | INT4 Q8 | 32 tok/s 21 tok/s | ~1.7s ~1.7s | |
#169 | OLMo 3 7B Think | 7B | INT4 Q8 FP16 | 83 tok/s 60 tok/s 36 tok/s | ~519 ms ~524 ms ~534 ms | |
#170 | OLMo 3.1 32B Instruct | 32B | INT4 Q8 | 26 tok/s 16 tok/s | ~2.3s ~2.5s | |
#171 | Llama 3.1 70B | 70B | INT4 | 16 tok/s | ~4.9s | |
#172 | DeepSeek-R1 14B | 14B | INT4 Q8 FP16 | 68 tok/s 41 tok/s 22 tok/s | ~1.0s ~1.0s ~1.0s | |
#173 | Ministral 3 14B | 14B | INT4 Q8 FP16 | 49 tok/s 34 tok/s 20 tok/s | ~1.0s ~1.0s ~1.0s | |
#177 | Gemma 3 12B | 12B | INT4 Q8 FP16 | 75 tok/s 46 tok/s 25 tok/s | ~870 ms ~879 ms ~897 ms | |
#179 | Qwen2-72B | 72B | INT4 | 15 tok/s | ~5.5s | |
#180 | OLMo 3 32B Base | 32B | INT4 Q8 | 26 tok/s 16 tok/s | ~2.3s ~2.5s | |
#181 | Mistral-Small-2501 | 24B | INT4 Q8 FP16 | 42 tok/s 25 tok/s 12 tok/s | ~1.7s ~1.7s ~2.1s | |
#182 | Ministral 3 8B | 8B | INT4 Q8 FP16 | 76 tok/s 54 tok/s 33 tok/s | ~590 ms ~595 ms ~607 ms | |
#183 | Qwen3.5-2B | 2B | INT4 Q8 FP16 | 215 tok/s 166 tok/s 110 tok/s | ~165 ms ~166 ms ~170 ms | |
#184 | MiniCPM5-2B | 2B | INT4 Q8 FP16 | 215 tok/s 166 tok/s 110 tok/s | ~165 ms ~166 ms ~170 ms | |
#185 | Qwen2.5-14B | 14B | INT4 Q8 FP16 | 66 tok/s 40 tok/s 22 tok/s | ~1.0s ~1.0s ~1.0s | |
#186 | Gemma 2 27B | 27B | INT4 Q8 | 38 tok/s 22 tok/s | ~1.9s ~1.9s | |
#187 | OLMo 3.1 32B Think | 32B | INT4 Q8 | 26 tok/s 16 tok/s | ~2.3s ~2.5s | |
#188 | Gemma 4 E2B | 5.1B | INT4 Q8 FP16 | 136 tok/s 92 tok/s 54 tok/s | ~382 ms ~386 ms ~394 ms | |
#189 | Qwen3-4B | 4B | INT4 Q8 FP16 | 157 tok/s 109 tok/s 65 tok/s | ~305 ms ~308 ms ~314 ms | |
#190 | DeepSeek-R1 8B | 8B | INT4 Q8 FP16 | 104 tok/s 66 tok/s 36 tok/s | ~586 ms ~592 ms ~604 ms | |
#191 | Llama 3 70B | 70B | INT4 | 16 tok/s | ~4.9s | |
#193 | Ministral 3 3B | 3B | INT4 Q8 FP16 | 131 tok/s 105 tok/s 71 tok/s | ~237 ms ~239 ms ~244 ms | |
#195 | Qwen3-14B | 14B | INT4 Q8 FP16 | 66 tok/s 40 tok/s 22 tok/s | ~1.0s ~1.0s ~1.0s | |
#196 | Kimi Linear 48B A3B Instruct | 48B (3B active) | INT4 | 59 tok/s | ~339 ms | |
#197 | Gemma 2 9B | 9B | INT4 Q8 FP16 | 93 tok/s 59 tok/s 33 tok/s | ~658 ms ~664 ms ~678 ms | |
#198 | Qwen2.5-7B | 7B | INT4 Q8 FP16 | 111 tok/s 72 tok/s 41 tok/s | ~516 ms ~521 ms ~532 ms | |
#199 | Qwen3-8B | 8B | INT4 Q8 FP16 | 102 tok/s 65 tok/s 36 tok/s | ~586 ms ~592 ms ~604 ms | |
#200 | Gemma 3 4B | 4B | INT4 Q8 FP16 | 157 tok/s 109 tok/s 65 tok/s | ~305 ms ~308 ms ~314 ms | |
#201 | DeepSeek-R1 7B | 7B | INT4 Q8 FP16 | 114 tok/s 73 tok/s 41 tok/s | ~516 ms ~521 ms ~531 ms | |
#202 | Llama 3.1 8B | 8B | INT4 Q8 FP16 | 102 tok/s 65 tok/s 36 tok/s | ~586 ms ~592 ms ~604 ms | |
#204 | Qwen3-1.7B | 1.7B | INT4 Q8 FP16 | 229 tok/s 181 tok/s 123 tok/s | ~142 ms ~143 ms ~146 ms | |
#205 | Command R | 35B | INT4 Q8 | 24 tok/s 15 tok/s | ~2.5s ~2.7s | |
#206 | Gemma 3 270M | 0.27B | INT4 Q8 FP16 | 317 tok/s 301 tok/s 268 tok/s | ~28 ms ~29 ms ~29 ms | |
#208 | Llama 3 8B | 8B | INT4 Q8 FP16 | 102 tok/s 65 tok/s 36 tok/s | ~586 ms ~592 ms ~604 ms | |
#209 | Qwen3-0.6B | 0.6B | INT4 Q8 FP16 | 305 tok/s 271 tok/s 217 tok/s | ~55 ms ~55 ms ~56 ms | |
#210 | Phi-4-Mini | 3.8B | INT4 Q8 FP16 | 161 tok/s 113 tok/s 68 tok/s | ~291 ms ~294 ms ~300 ms | |
#211 | Mixtral-8x7B-v0.1 | 46.7B (7B active) | INT4 Q8 | 100 tok/s 61 tok/s | ~598 ms ~706 ms | |
#212 | Ministral-8B-2410 | 8B | INT4 Q8 FP16 | 102 tok/s 65 tok/s 36 tok/s | ~586 ms ~592 ms ~604 ms | |
#213 | DeepSeek-R1 1.5B | 1.5B | INT4 Q8 FP16 | 240 tok/s 192 tok/s 133 tok/s | ~127 ms ~128 ms ~130 ms | |
#214 | Llama 3.2 3B | 3B | INT4 Q8 FP16 | 182 tok/s 132 tok/s 82 tok/s | ~235 ms ~237 ms ~242 ms | |
#215 | Qwen3.5-0.8B | 0.8B | INT4 Q8 FP16 | 287 tok/s 248 tok/s 190 tok/s | ~71 ms ~72 ms ~73 ms | |
#216 | Phi-3-mini | 3.8B | INT4 Q8 FP16 | 161 tok/s 113 tok/s 68 tok/s | ~291 ms ~294 ms ~300 ms | |
#217 | Gemma 3n E2B IT | 6B (2B active) | INT4 Q8 FP16 | 131 tok/s 114 tok/s 84 tok/s | ~179 ms ~180 ms ~183 ms | |
#218 | Mistral-7B-Instruct-v0.1 | 7.3B | INT4 Q8 FP16 | 108 tok/s 70 tok/s 39 tok/s | ~537 ms ~542 ms ~553 ms | |
#219 | Llama 3.2 1B | 1B | INT4 Q8 FP16 | 270 tok/s 228 tok/s 169 tok/s | ~89 ms ~89 ms ~91 ms | |
#220 | Gemma 2 2B | 2B | INT4 Q8 FP16 | 215 tok/s 166 tok/s 110 tok/s | ~165 ms ~166 ms ~170 ms | |
#221 | Phi-3-medium | 14B | INT4 Q8 FP16 | 66 tok/s 40 tok/s 22 tok/s | ~1.0s ~1.0s ~1.0s | |
#222 | OLMo 3 7B Instruct | 7B | INT4 Q8 FP16 | 83 tok/s 60 tok/s 36 tok/s | ~519 ms ~524 ms ~534 ms | |
#223 | Yi-34B | 34B | INT4 Q8 | 24 tok/s 15 tok/s | ~2.4s ~2.6s | |
#224 | Qwen2-7B | 7B | INT4 Q8 FP16 | 111 tok/s 72 tok/s 41 tok/s | ~516 ms ~521 ms ~532 ms | |
#225 | Phi-3-small | 7B | INT4 Q8 FP16 | 111 tok/s 72 tok/s 41 tok/s | ~516 ms ~521 ms ~532 ms | |
#226 | Gemma 3 1B | 1B | INT4 Q8 FP16 | 270 tok/s 228 tok/s 169 tok/s | ~89 ms ~89 ms ~91 ms | |
#227 | Mistral-7B-Instruct-v0.2 | 7.3B | INT4 Q8 FP16 | 108 tok/s 70 tok/s 39 tok/s | ~537 ms ~542 ms ~553 ms | |
#229 | Gemma 1 7B | 7B | INT4 Q8 FP16 | 83 tok/s 60 tok/s 36 tok/s | ~519 ms ~524 ms ~534 ms | |
#230 | Gemma 1 2B | 2B | INT4 Q8 FP16 | 226 tok/s 172 tok/s 112 tok/s | ~165 ms ~166 ms ~169 ms | |
#231 | ChatGLM3-6B | 6B | INT4 Q8 FP16 | 91 tok/s 67 tok/s 41 tok/s | ~449 ms ~453 ms ~462 ms | |
#232 | ChatGLM2-6B | 6B | INT4 Q8 FP16 | 91 tok/s 67 tok/s 41 tok/s | ~449 ms ~453 ms ~462 ms | |
#233 | ChatGLM-6B | 6B | INT4 Q8 FP16 | 91 tok/s 67 tok/s 41 tok/s | ~449 ms ~453 ms ~462 ms | |
Unranked Models (Sorted by Speed) | ||||||
- | Qwen2-0.5B | 0.5B | INT4 Q8 FP16 | 315 tok/s 284 tok/s 233 tok/s | ~46 ms ~47 ms ~47 ms | |
- | Qwen2.5-0.5B | 0.5B | INT4 Q8 FP16 | 315 tok/s 284 tok/s 233 tok/s | ~46 ms ~47 ms ~47 ms | |
- | ERNIE-4.5-0.3B | 0.3B | INT4 Q8 FP16 | 311 tok/s 294 tok/s 259 tok/s | ~31 ms ~31 ms ~32 ms | |
- | ERNIE-4.5-0.3B-Base | 0.3B | INT4 Q8 FP16 | 311 tok/s 294 tok/s 259 tok/s | ~31 ms ~31 ms ~32 ms | |
- | Falcon-1B | 1B | INT4 Q8 FP16 | 280 tok/s 234 tok/s 172 tok/s | ~89 ms ~89 ms ~91 ms | |
- | Falcon3-1B | 1B | INT4 Q8 FP16 | 270 tok/s 228 tok/s 169 tok/s | ~89 ms ~89 ms ~91 ms | |
- | Qwen2-1.5B | 1.5B | INT4 Q8 FP16 | 240 tok/s 192 tok/s 133 tok/s | ~127 ms ~128 ms ~130 ms | |
- | Qwen2.5-1.5B | 1.5B | INT4 Q8 FP16 | 240 tok/s 192 tok/s 133 tok/s | ~127 ms ~128 ms ~130 ms | |
- | Spark X2.5 1.7B | 1.7B | INT4 Q8 FP16 | 229 tok/s 181 tok/s 123 tok/s | ~142 ms ~143 ms ~146 ms | |
- | Hy-MT2 1.8B | 1.8B | INT4 Q8 FP16 | 225 tok/s 176 tok/s 118 tok/s | ~149 ms ~151 ms ~153 ms | |
- | Falcon-3B | 3B | INT4 Q8 FP16 | 190 tok/s 136 tok/s 84 tok/s | ~235 ms ~237 ms ~241 ms | |
- | CroissantLLM Base | 1.3B | INT4 Q8 FP16 | 187 tok/s 163 tok/s 123 tok/s | ~112 ms ~113 ms ~115 ms | |
- | Phi-1 | 1.3B | INT4 Q8 FP16 | 187 tok/s 163 tok/s 123 tok/s | ~112 ms ~113 ms ~115 ms | |
- | Phi-1.5 | 1.3B | INT4 Q8 FP16 | 187 tok/s 163 tok/s 123 tok/s | ~112 ms ~113 ms ~115 ms | |
- | DeepSeek-R1 3B | 3B | INT4 Q8 FP16 | 184 tok/s 133 tok/s 82 tok/s | ~235 ms ~237 ms ~241 ms | |
- | Falcon3-3B | 3B | INT4 Q8 FP16 | 182 tok/s 132 tok/s 82 tok/s | ~235 ms ~237 ms ~242 ms | |
- | Qwen2.5-3B | 3B | INT4 Q8 FP16 | 182 tok/s 132 tok/s 82 tok/s | ~235 ms ~237 ms ~242 ms | |
- | ERNIE-4.5-21B-A3B | 21B (3B active) | INT4 Q8 FP16 | 163 tok/s 123 tok/s 74 tok/s | ~286 ms ~288 ms ~317 ms | |
- | ERNIE-4.5-21B-A3B-Base | 21B (3B active) | INT4 Q8 FP16 | 163 tok/s 123 tok/s 74 tok/s | ~286 ms ~288 ms ~317 ms | |
- | ERNIE-4.5-VL-28B-A3B | 28B (3B active) | INT4 Q8 | 158 tok/s 120 tok/s | ~300 ms ~302 ms | |
- | ERNIE-4.5-VL-28B-A3B-Base | 28B (3B active) | INT4 Q8 | 158 tok/s 120 tok/s | ~300 ms ~302 ms | |
- | Hy-MT2 30B A3B | 30B (3B active) | INT4 Q8 | 157 tok/s 119 tok/s | ~305 ms ~307 ms | |
- | Spark X2.5 4B | 4B | INT4 Q8 FP16 | 157 tok/s 109 tok/s 65 tok/s | ~305 ms ~308 ms ~314 ms | |
- | Phi-2 | 2.7B | INT4 Q8 FP16 | 136 tok/s 111 tok/s 76 tok/s | ~216 ms ~218 ms ~222 ms | |
- | MaLLaM-3B | 3B | INT4 Q8 FP16 | 131 tok/s 105 tok/s 71 tok/s | ~237 ms ~239 ms ~244 ms | |
- | SmolLM3 3B | 3B | INT4 Q8 FP16 | 131 tok/s 105 tok/s 71 tok/s | ~237 ms ~239 ms ~244 ms | |
- | AliceAI Foundation 80B A3B Base | 80B (3B active) | INT4 | 123 tok/s | ~451 ms | |
- | Falcon-7B | 7B | INT4 Q8 FP16 | 116 tok/s 74 tok/s 41 tok/s | ~516 ms ~521 ms ~531 ms | |
- | Falcon3-7B | 7B | INT4 Q8 FP16 | 111 tok/s 72 tok/s 41 tok/s | ~516 ms ~521 ms ~532 ms | |
- | Hy-MT2 7B | 7B | INT4 Q8 FP16 | 111 tok/s 72 tok/s 41 tok/s | ~516 ms ~521 ms ~532 ms | |
- | Mistral-7B-v0.1 | 7.3B | INT4 Q8 FP16 | 108 tok/s 70 tok/s 39 tok/s | ~537 ms ~542 ms ~553 ms | |
- | LensVLM 9B | 9B | INT4 Q8 FP16 | 93 tok/s 59 tok/s 33 tok/s | ~658 ms ~664 ms ~678 ms | |
- | MiMo V2.6 Distill Qwen 9B | 9B | INT4 Q8 FP16 | 93 tok/s 59 tok/s 33 tok/s | ~658 ms ~664 ms ~678 ms | |
- | ChatGLM3-6B-32K | 6B | INT4 Q8 FP16 | 91 tok/s 67 tok/s 41 tok/s | ~449 ms ~453 ms ~462 ms | |
- | Yi-6B | 6B | INT4 Q8 FP16 | 91 tok/s 67 tok/s 41 tok/s | ~449 ms ~453 ms ~462 ms | |
- | Falcon3-10B | 10B | INT4 Q8 FP16 | 86 tok/s 54 tok/s 30 tok/s | ~728 ms ~735 ms ~750 ms | |
- | Kimi-VL-A3B-Instruct | 16B (3B active) | INT4 Q8 FP16 | 86 tok/s 76 tok/s 56 tok/s | ~280 ms ~281 ms ~286 ms | |
- | Falcon2-11B | 11B | INT4 Q8 FP16 | 83 tok/s 51 tok/s 27 tok/s | ~798 ms ~806 ms ~823 ms | |
- | Hunyuan Lite | 7B | INT4 Q8 FP16 | 83 tok/s 60 tok/s 36 tok/s | ~519 ms ~524 ms ~534 ms | |
- | OLMo 3 7B Base | 7B | INT4 Q8 FP16 | 83 tok/s 60 tok/s 36 tok/s | ~519 ms ~524 ms ~534 ms | |
- | SEA-LION-7B | 7.1B | INT4 Q8 FP16 | 82 tok/s 59 tok/s 36 tok/s | ~526 ms ~531 ms ~542 ms | |
- | SEA-LION-7B-Instruct | 7.1B | INT4 Q8 FP16 | 82 tok/s 59 tok/s 36 tok/s | ~526 ms ~531 ms ~542 ms | |
- | Sahabat-AI-Llama3-8B-Instruct | 8B | INT4 Q8 FP16 | 76 tok/s 54 tok/s 33 tok/s | ~590 ms ~595 ms ~607 ms | |
- | Typhoon-2-8B | 8B | INT4 Q8 FP16 | 76 tok/s 54 tok/s 33 tok/s | ~590 ms ~595 ms ~607 ms | |
- | GLM-4-9B | 9B | INT4 Q8 FP16 | 69 tok/s 49 tok/s 29 tok/s | ~661 ms ~667 ms ~681 ms | |
- | GLM-4-9B-Chat | 9B | INT4 Q8 FP16 | 69 tok/s 49 tok/s 29 tok/s | ~661 ms ~667 ms ~681 ms | |
- | GLM-4-9B-Chat-1M | 9B | INT4 Q8 FP16 | 69 tok/s 49 tok/s 29 tok/s | ~661 ms ~667 ms ~681 ms | |
- | Yi-9B | 9B | INT4 Q8 FP16 | 69 tok/s 49 tok/s 29 tok/s | ~661 ms ~667 ms ~681 ms | |
- | Sahabat-AI-Gemma2-9B | 9.2B | INT4 Q8 FP16 | 68 tok/s 48 tok/s 29 tok/s | ~675 ms ~681 ms ~695 ms | |
- | Sahabat-AI-Gemma2-9B-Instruct | 9.2B | INT4 Q8 FP16 | 68 tok/s 48 tok/s 29 tok/s | ~675 ms ~681 ms ~695 ms | |
- | GreenMind-14B-R1 | 14B | INT4 Q8 FP16 | 49 tok/s 34 tok/s 20 tok/s | ~1.0s ~1.0s ~1.0s | |
- | Falcon-40B | 40B | INT4 Q8 | 28 tok/s 15 tok/s | ~2.8s ~3.1s | |
- | Kimi-Dev-72B | 72B | INT4 | 11 tok/s | ~6.0s | |
- | Typhoon-2-70B | 70B | INT4 | 11 tok/s | ~5.8s | |
Maximum model parameter class runnable by weight precision.
Context:
4-bit
32B Models
8-bit
32B Models
16-bit
14B Models
Hardware capacity for local training and adapter fine-tuning.
Context Length:
QLoRA
32B Models
LoRA
14B Models
Full Parameter Training
7B-8B Models
Guidance for optimal precision and operational ceilings on NVIDIA RTX A6000 (48GB).
Inference Sweet Spot
Optimized for 14B models at uncompressed or Q8 precision, and 32B models at Q4 with up to 32k context.
Bandwidth & Speed Profile
With 768 GB/s aggregate bandwidth, batch size 1 inference operates in a memory-bandwidth bound regime. Generates approximately 171 tok/s on an 8B Q4 model and 20 tok/s on a 70B Q4 model.
©2025 ApX Machine Learning
Assistant
Online