The NVIDIA RTX 6000 Ada Generation (48GB) features 48 GB of dedicated VRAM and 960 GB/s memory bandwidth, supporting CUDA and TensorRT-LLM runtimes for full-precision and quantized inference.
Memory
48 GB
Usable Memory Ceiling
48 GB
Bandwidth
960 GB/s
Max Inference Class
32B Models (Q4)
TDP
300W
Estimated memory requirements as context length increases. Curves crossing above the reference line indicate Out of Memory (OOM).
Precision:
Inference throughput, memory compatibility, and generation speeds for open-weights LLMs on NVIDIA RTX 6000 Ada Generation (48GB).
Sort by:
Context:
KV Cache:
GPUs:
| Rank | Model | Parameters | Precision | TPS (Approx.) | TTFT | Can Run |
|---|---|---|---|---|---|---|
#33 | Qwen 3.8 27B | 27B | INT4 Q8 | 46 tok/s 27 tok/s | ~836 ms ~851 ms | |
#48 | Agnes 3.0 Flash | 33B | INT4 Q8 | 39 tok/s 23 tok/s | ~1.0s ~1.0s | |
#72 | K2 Horizon MoVA 36B A4B | 36B (4B active) | INT4 Q8 | 157 tok/s 117 tok/s | ~169 ms ~171 ms | |
#83 | Qwen3.5-27B | 27B | INT4 Q8 | 46 tok/s 27 tok/s | ~836 ms ~851 ms | |
#92 | Sarvam-30B | 32B (2.4B active) | INT4 Q8 | 190 tok/s 153 tok/s | ~120 ms ~121 ms | |
#94 | Qwen3.6 35B A3B | 35B (3B active) | INT4 Q8 | 176 tok/s 137 tok/s | ~139 ms ~140 ms | |
#96 | Muse Glimmer 30B | 30B | INT4 Q8 | 42 tok/s 25 tok/s | ~926 ms ~943 ms | |
#100 | Phi-4 Reasoning Plus | 14B | INT4 Q8 FP16 | 60 tok/s 41 tok/s 24 tok/s | ~447 ms ~454 ms ~472 ms | |
#101 | MiMo V2 Flash | 15B (309B active) | INT4 Q8 FP16 | 5 tok/s 3 tok/s 1 tok/s | ~9.1s ~9.3s ~9.6s | |
#108 | Gemma 4 26B A4B | 25.2B (3.8B active) | INT4 Q8 | 165 tok/s 123 tok/s | ~155 ms ~157 ms | |
#109 | Gemma 4 12B | 11.95B | INT4 Q8 FP16 | 67 tok/s 47 tok/s 28 tok/s | ~384 ms ~390 ms ~405 ms | |
#113 | Qwen3.5-9B | 9B | INT4 Q8 FP16 | 110 tok/s 71 tok/s 40 tok/s | ~289 ms ~294 ms ~305 ms | |
#114 | Qwen3.5-35B-A3B | 35B (3B active) | INT4 Q8 | 176 tok/s 137 tok/s | ~139 ms ~140 ms | |
#118 | K2 Horizon 7B | 7B | INT4 Q8 FP16 | 130 tok/s 86 tok/s 50 tok/s | ~228 ms ~232 ms ~240 ms | |
#128 | NVIDIA Nemotron 3 Nano 30B-A3B | 3.5B (30B active) | INT4 Q8 FP16 | 40 tok/s 24 tok/s 13 tok/s | ~899 ms ~915 ms ~952 ms | |
#129 | Gemma 4 31B | 30.7B | INT4 Q8 | 42 tok/s 24 tok/s | ~947 ms ~964 ms | |
#131 | Nemotron 3.5 Lightning | 30B (3B active) | INT4 Q8 | 82 tok/s 75 tok/s | ~143 ms ~144 ms | |
#132 | Qwen3.5-4B | 4B | INT4 Q8 FP16 | 177 tok/s 127 tok/s 78 tok/s | ~137 ms ~139 ms ~144 ms | |
#133 | Qwen3-30B-A3B | 30B (3B active) | INT4 Q8 | 177 tok/s 138 tok/s | ~136 ms ~138 ms | |
#136 | GPT-OSS 20B | 21B (3.6B active) | INT4 Q8 FP16 | 90 tok/s 79 tok/s 53 tok/s | ~151 ms ~152 ms ~182 ms | |
#146 | Granite 4.2 8B | 8B | INT4 Q8 FP16 | 119 tok/s 78 tok/s 44 tok/s | ~258 ms ~263 ms ~273 ms | |
#150 | Gemma 4 E4B | 8B | INT4 Q8 FP16 | 119 tok/s 78 tok/s 44 tok/s | ~258 ms ~263 ms ~273 ms | |
#151 | Nemotron 3.5 Lightning 30B A3B | 30B (3B active) | INT4 Q8 | 177 tok/s 138 tok/s | ~136 ms ~138 ms | |
#153 | Qwen3-32B | 32B | INT4 Q8 | 40 tok/s 23 tok/s | ~986 ms ~1.0s | |
#154 | Qwen2.5-72B | 72B | INT4 | 18 tok/s | ~2.4s | |
#155 | Mistral Large 3 | 41B (675B active) | INT4 | 2 tok/s | ~19.8s | |
#156 | GLM-4 | 32B | INT4 Q8 | 32 tok/s 19 tok/s | ~993 ms ~1.1s | |
#157 | DeepSeek-R1 70B | 70B | INT4 | 20 tok/s | ~2.1s | |
#158 | GLM-4V | 9B | INT4 Q8 FP16 | 83 tok/s 59 tok/s 36 tok/s | ~292 ms ~297 ms ~308 ms | |
#159 | Gemma 3 27B | 27B | INT4 Q8 | 46 tok/s 27 tok/s | ~836 ms ~851 ms | |
#160 | Phi-4 | 14B | INT4 Q8 FP16 | 79 tok/s 49 tok/s 27 tok/s | ~443 ms ~451 ms ~468 ms | |
#161 | Llama 3.3 70B | 70B | INT4 | 20 tok/s | ~2.1s | |
#162 | DeepSeek-R1 32B | 32B | INT4 Q8 | 41 tok/s 24 tok/s | ~985 ms ~1.0s | |
#163 | Hunyuan Standard | 52B (389B active) | INT4 | 4 tok/s | ~11.5s | |
#164 | Qwen2.5-32B | 32B | INT4 Q8 | 40 tok/s 23 tok/s | ~986 ms ~1.0s | |
#168 | Magistral Small | 24B | INT4 Q8 | 40 tok/s 26 tok/s | ~751 ms ~764 ms | |
#169 | OLMo 3 7B Think | 7B | INT4 Q8 FP16 | 98 tok/s 72 tok/s 44 tok/s | ~230 ms ~234 ms ~243 ms | |
#170 | OLMo 3.1 32B Instruct | 32B | INT4 Q8 | 32 tok/s 19 tok/s | ~993 ms ~1.1s | |
#171 | Llama 3.1 70B | 70B | INT4 | 20 tok/s | ~2.1s | |
#172 | DeepSeek-R1 14B | 14B | INT4 Q8 FP16 | 81 tok/s 50 tok/s 27 tok/s | ~443 ms ~450 ms ~468 ms | |
#173 | Ministral 3 14B | 14B | INT4 Q8 FP16 | 60 tok/s 41 tok/s 24 tok/s | ~447 ms ~454 ms ~472 ms | |
#177 | Gemma 3 12B | 12B | INT4 Q8 FP16 | 89 tok/s 56 tok/s 31 tok/s | ~382 ms ~388 ms ~403 ms | |
#179 | Qwen2-72B | 72B | INT4 | 18 tok/s | ~2.4s | |
#180 | OLMo 3 32B Base | 32B | INT4 Q8 | 32 tok/s 19 tok/s | ~993 ms ~1.1s | |
#181 | Mistral-Small-2501 | 24B | INT4 Q8 FP16 | 51 tok/s 30 tok/s 14 tok/s | ~746 ms ~759 ms ~920 ms | |
#182 | Ministral 3 8B | 8B | INT4 Q8 FP16 | 90 tok/s 65 tok/s 40 tok/s | ~261 ms ~265 ms ~275 ms | |
#183 | Qwen3.5-2B | 2B | INT4 Q8 FP16 | 235 tok/s 187 tok/s 128 tok/s | ~76 ms ~77 ms ~79 ms | |
#184 | MiniCPM5-2B | 2B | INT4 Q8 FP16 | 235 tok/s 187 tok/s 128 tok/s | ~76 ms ~77 ms ~79 ms | |
#185 | Qwen2.5-14B | 14B | INT4 Q8 FP16 | 79 tok/s 49 tok/s 27 tok/s | ~443 ms ~451 ms ~468 ms | |
#186 | Gemma 2 27B | 27B | INT4 Q8 | 46 tok/s 27 tok/s | ~836 ms ~851 ms | |
#187 | OLMo 3.1 32B Think | 32B | INT4 Q8 | 32 tok/s 19 tok/s | ~993 ms ~1.1s | |
#188 | Gemma 4 E2B | 5.1B | INT4 Q8 FP16 | 156 tok/s 108 tok/s 65 tok/s | ~170 ms ~173 ms ~179 ms | |
#189 | Qwen3-4B | 4B | INT4 Q8 FP16 | 177 tok/s 127 tok/s 78 tok/s | ~137 ms ~139 ms ~144 ms | |
#190 | DeepSeek-R1 8B | 8B | INT4 Q8 FP16 | 121 tok/s 79 tok/s 44 tok/s | ~258 ms ~263 ms ~273 ms | |
#191 | Llama 3 70B | 70B | INT4 | 20 tok/s | ~2.1s | |
#193 | Ministral 3 3B | 3B | INT4 Q8 FP16 | 150 tok/s 122 tok/s 84 tok/s | ~108 ms ~109 ms ~113 ms | |
#195 | Qwen3-14B | 14B | INT4 Q8 FP16 | 79 tok/s 49 tok/s 27 tok/s | ~443 ms ~451 ms ~468 ms | |
#196 | Kimi Linear 48B A3B Instruct | 48B (3B active) | INT4 | 71 tok/s | ~155 ms | |
#197 | Gemma 2 9B | 9B | INT4 Q8 FP16 | 110 tok/s 71 tok/s 40 tok/s | ~289 ms ~294 ms ~305 ms | |
#198 | Qwen2.5-7B | 7B | INT4 Q8 FP16 | 130 tok/s 86 tok/s 50 tok/s | ~228 ms ~232 ms ~240 ms | |
#199 | Qwen3-8B | 8B | INT4 Q8 FP16 | 119 tok/s 78 tok/s 44 tok/s | ~258 ms ~263 ms ~273 ms | |
#200 | Gemma 3 4B | 4B | INT4 Q8 FP16 | 177 tok/s 127 tok/s 78 tok/s | ~137 ms ~139 ms ~144 ms | |
#201 | DeepSeek-R1 7B | 7B | INT4 Q8 FP16 | 132 tok/s 87 tok/s 50 tok/s | ~228 ms ~232 ms ~240 ms | |
#202 | Llama 3.1 8B | 8B | INT4 Q8 FP16 | 119 tok/s 78 tok/s 44 tok/s | ~258 ms ~263 ms ~273 ms | |
#204 | Qwen3-1.7B | 1.7B | INT4 Q8 FP16 | 248 tok/s 201 tok/s 142 tok/s | ~66 ms ~67 ms ~69 ms | |
#205 | Command R | 35B | INT4 Q8 | 29 tok/s 18 tok/s | ~1.1s ~1.2s | |
#206 | Gemma 3 270M | 0.27B | INT4 Q8 FP16 | 327 tok/s 313 tok/s 283 tok/s | ~17 ms ~17 ms ~17 ms | |
#208 | Llama 3 8B | 8B | INT4 Q8 FP16 | 119 tok/s 78 tok/s 44 tok/s | ~258 ms ~263 ms ~273 ms | |
#209 | Qwen3-0.6B | 0.6B | INT4 Q8 FP16 | 316 tok/s 286 tok/s 237 tok/s | ~28 ms ~28 ms ~29 ms | |
#210 | Phi-4-Mini | 3.8B | INT4 Q8 FP16 | 182 tok/s 132 tok/s 82 tok/s | ~130 ms ~133 ms ~137 ms | |
#211 | Mixtral-8x7B-v0.1 | 46.7B (7B active) | INT4 Q8 | 117 tok/s 73 tok/s | ~263 ms ~312 ms | |
#212 | Ministral-8B-2410 | 8B | INT4 Q8 FP16 | 119 tok/s 78 tok/s 44 tok/s | ~258 ms ~263 ms ~273 ms | |
#213 | DeepSeek-R1 1.5B | 1.5B | INT4 Q8 FP16 | 258 tok/s 213 tok/s 153 tok/s | ~59 ms ~60 ms ~62 ms | |
#214 | Llama 3.2 3B | 3B | INT4 Q8 FP16 | 202 tok/s 151 tok/s 97 tok/s | ~106 ms ~108 ms ~111 ms | |
#215 | Qwen3.5-0.8B | 0.8B | INT4 Q8 FP16 | 300 tok/s 265 tok/s 211 tok/s | ~35 ms ~36 ms ~37 ms | |
#216 | Phi-3-mini | 3.8B | INT4 Q8 FP16 | 182 tok/s 132 tok/s 82 tok/s | ~130 ms ~133 ms ~137 ms | |
#217 | Gemma 3n E2B IT | 6B (2B active) | INT4 Q8 FP16 | 150 tok/s 132 tok/s 100 tok/s | ~83 ms ~84 ms ~86 ms | |
#218 | Mistral-7B-Instruct-v0.1 | 7.3B | INT4 Q8 FP16 | 126 tok/s 83 tok/s 48 tok/s | ~237 ms ~241 ms ~250 ms | |
#219 | Llama 3.2 1B | 1B | INT4 Q8 FP16 | 286 tok/s 247 tok/s 190 tok/s | ~43 ms ~43 ms ~45 ms | |
#220 | Gemma 2 2B | 2B | INT4 Q8 FP16 | 235 tok/s 187 tok/s 128 tok/s | ~76 ms ~77 ms ~79 ms | |
#221 | Phi-3-medium | 14B | INT4 Q8 FP16 | 79 tok/s 49 tok/s 27 tok/s | ~443 ms ~451 ms ~468 ms | |
#222 | OLMo 3 7B Instruct | 7B | INT4 Q8 FP16 | 98 tok/s 72 tok/s 44 tok/s | ~230 ms ~234 ms ~243 ms | |
#223 | Yi-34B | 34B | INT4 Q8 | 30 tok/s 18 tok/s | ~1.1s ~1.2s | |
#224 | Qwen2-7B | 7B | INT4 Q8 FP16 | 130 tok/s 86 tok/s 50 tok/s | ~228 ms ~232 ms ~240 ms | |
#225 | Phi-3-small | 7B | INT4 Q8 FP16 | 130 tok/s 86 tok/s 50 tok/s | ~228 ms ~232 ms ~240 ms | |
#226 | Gemma 3 1B | 1B | INT4 Q8 FP16 | 286 tok/s 247 tok/s 190 tok/s | ~43 ms ~43 ms ~45 ms | |
#227 | Mistral-7B-Instruct-v0.2 | 7.3B | INT4 Q8 FP16 | 126 tok/s 83 tok/s 48 tok/s | ~237 ms ~241 ms ~250 ms | |
#229 | Gemma 1 7B | 7B | INT4 Q8 FP16 | 98 tok/s 72 tok/s 44 tok/s | ~230 ms ~234 ms ~243 ms | |
#230 | Gemma 1 2B | 2B | INT4 Q8 FP16 | 245 tok/s 192 tok/s 131 tok/s | ~76 ms ~77 ms ~79 ms | |
#231 | ChatGLM3-6B | 6B | INT4 Q8 FP16 | 107 tok/s 80 tok/s 50 tok/s | ~200 ms ~203 ms ~210 ms | |
#232 | ChatGLM2-6B | 6B | INT4 Q8 FP16 | 107 tok/s 80 tok/s 50 tok/s | ~200 ms ~203 ms ~210 ms | |
#233 | ChatGLM-6B | 6B | INT4 Q8 FP16 | 107 tok/s 80 tok/s 50 tok/s | ~200 ms ~203 ms ~210 ms | |
Unranked Models (Sorted by Speed) | ||||||
- | Qwen2-0.5B | 0.5B | INT4 Q8 FP16 | 324 tok/s 298 tok/s 252 tok/s | ~24 ms ~25 ms ~25 ms | |
- | Qwen2.5-0.5B | 0.5B | INT4 Q8 FP16 | 324 tok/s 298 tok/s 252 tok/s | ~24 ms ~25 ms ~25 ms | |
- | ERNIE-4.5-0.3B | 0.3B | INT4 Q8 FP16 | 321 tok/s 306 tok/s 275 tok/s | ~18 ms ~18 ms ~18 ms | |
- | ERNIE-4.5-0.3B-Base | 0.3B | INT4 Q8 FP16 | 321 tok/s 306 tok/s 275 tok/s | ~18 ms ~18 ms ~18 ms | |
- | Falcon-1B | 1B | INT4 Q8 FP16 | 294 tok/s 253 tok/s 193 tok/s | ~43 ms ~43 ms ~44 ms | |
- | Falcon3-1B | 1B | INT4 Q8 FP16 | 286 tok/s 247 tok/s 190 tok/s | ~43 ms ~43 ms ~45 ms | |
- | Qwen2-1.5B | 1.5B | INT4 Q8 FP16 | 258 tok/s 213 tok/s 153 tok/s | ~59 ms ~60 ms ~62 ms | |
- | Qwen2.5-1.5B | 1.5B | INT4 Q8 FP16 | 258 tok/s 213 tok/s 153 tok/s | ~59 ms ~60 ms ~62 ms | |
- | Spark X2.5 1.7B | 1.7B | INT4 Q8 FP16 | 248 tok/s 201 tok/s 142 tok/s | ~66 ms ~67 ms ~69 ms | |
- | Hy-MT2 1.8B | 1.8B | INT4 Q8 FP16 | 244 tok/s 196 tok/s 137 tok/s | ~69 ms ~70 ms ~72 ms | |
- | Falcon-3B | 3B | INT4 Q8 FP16 | 210 tok/s 156 tok/s 99 tok/s | ~106 ms ~108 ms ~111 ms | |
- | CroissantLLM Base | 1.3B | INT4 Q8 FP16 | 208 tok/s 184 tok/s 142 tok/s | ~54 ms ~54 ms ~56 ms | |
- | Phi-1 | 1.3B | INT4 Q8 FP16 | 208 tok/s 184 tok/s 142 tok/s | ~54 ms ~54 ms ~56 ms | |
- | Phi-1.5 | 1.3B | INT4 Q8 FP16 | 208 tok/s 184 tok/s 142 tok/s | ~54 ms ~54 ms ~56 ms | |
- | DeepSeek-R1 3B | 3B | INT4 Q8 FP16 | 204 tok/s 152 tok/s 98 tok/s | ~106 ms ~108 ms ~111 ms | |
- | Falcon3-3B | 3B | INT4 Q8 FP16 | 202 tok/s 151 tok/s 97 tok/s | ~106 ms ~108 ms ~111 ms | |
- | Qwen2.5-3B | 3B | INT4 Q8 FP16 | 202 tok/s 151 tok/s 97 tok/s | ~106 ms ~108 ms ~111 ms | |
- | ERNIE-4.5-21B-A3B | 21B (3B active) | INT4 Q8 FP16 | 184 tok/s 142 tok/s 88 tok/s | ~128 ms ~130 ms ~144 ms | |
- | ERNIE-4.5-21B-A3B-Base | 21B (3B active) | INT4 Q8 FP16 | 184 tok/s 142 tok/s 88 tok/s | ~128 ms ~130 ms ~144 ms | |
- | ERNIE-4.5-VL-28B-A3B | 28B (3B active) | INT4 Q8 | 179 tok/s 139 tok/s | ~134 ms ~136 ms | |
- | ERNIE-4.5-VL-28B-A3B-Base | 28B (3B active) | INT4 Q8 | 179 tok/s 139 tok/s | ~134 ms ~136 ms | |
- | Hy-MT2 30B A3B | 30B (3B active) | INT4 Q8 | 177 tok/s 138 tok/s | ~136 ms ~138 ms | |
- | Spark X2.5 4B | 4B | INT4 Q8 FP16 | 177 tok/s 127 tok/s 78 tok/s | ~137 ms ~139 ms ~144 ms | |
- | Phi-2 | 2.7B | INT4 Q8 FP16 | 156 tok/s 129 tok/s 90 tok/s | ~99 ms ~100 ms ~103 ms | |
- | MaLLaM-3B | 3B | INT4 Q8 FP16 | 150 tok/s 122 tok/s 84 tok/s | ~108 ms ~109 ms ~113 ms | |
- | SmolLM3 3B | 3B | INT4 Q8 FP16 | 150 tok/s 122 tok/s 84 tok/s | ~108 ms ~109 ms ~113 ms | |
- | AliceAI Foundation 80B A3B Base | 80B (3B active) | INT4 | 141 tok/s | ~199 ms | |
- | Falcon-7B | 7B | INT4 Q8 FP16 | 134 tok/s 88 tok/s 50 tok/s | ~228 ms ~232 ms ~240 ms | |
- | Falcon3-7B | 7B | INT4 Q8 FP16 | 130 tok/s 86 tok/s 50 tok/s | ~228 ms ~232 ms ~240 ms | |
- | Hy-MT2 7B | 7B | INT4 Q8 FP16 | 130 tok/s 86 tok/s 50 tok/s | ~228 ms ~232 ms ~240 ms | |
- | Mistral-7B-v0.1 | 7.3B | INT4 Q8 FP16 | 126 tok/s 83 tok/s 48 tok/s | ~237 ms ~241 ms ~250 ms | |
- | LensVLM 9B | 9B | INT4 Q8 FP16 | 110 tok/s 71 tok/s 40 tok/s | ~289 ms ~294 ms ~305 ms | |
- | MiMo V2.6 Distill Qwen 9B | 9B | INT4 Q8 FP16 | 110 tok/s 71 tok/s 40 tok/s | ~289 ms ~294 ms ~305 ms | |
- | ChatGLM3-6B-32K | 6B | INT4 Q8 FP16 | 107 tok/s 80 tok/s 50 tok/s | ~200 ms ~203 ms ~210 ms | |
- | Yi-6B | 6B | INT4 Q8 FP16 | 107 tok/s 80 tok/s 50 tok/s | ~200 ms ~203 ms ~210 ms | |
- | Falcon3-10B | 10B | INT4 Q8 FP16 | 102 tok/s 65 tok/s 36 tok/s | ~320 ms ~326 ms ~338 ms | |
- | Kimi-VL-A3B-Instruct | 16B (3B active) | INT4 Q8 FP16 | 102 tok/s 90 tok/s 68 tok/s | ~127 ms ~129 ms ~132 ms | |
- | Falcon2-11B | 11B | INT4 Q8 FP16 | 99 tok/s 61 tok/s 34 tok/s | ~350 ms ~356 ms ~370 ms | |
- | Hunyuan Lite | 7B | INT4 Q8 FP16 | 98 tok/s 72 tok/s 44 tok/s | ~230 ms ~234 ms ~243 ms | |
- | OLMo 3 7B Base | 7B | INT4 Q8 FP16 | 98 tok/s 72 tok/s 44 tok/s | ~230 ms ~234 ms ~243 ms | |
- | SEA-LION-7B | 7.1B | INT4 Q8 FP16 | 97 tok/s 71 tok/s 44 tok/s | ~234 ms ~237 ms ~246 ms | |
- | SEA-LION-7B-Instruct | 7.1B | INT4 Q8 FP16 | 97 tok/s 71 tok/s 44 tok/s | ~234 ms ~237 ms ~246 ms | |
- | Sahabat-AI-Llama3-8B-Instruct | 8B | INT4 Q8 FP16 | 90 tok/s 65 tok/s 40 tok/s | ~261 ms ~265 ms ~275 ms | |
- | Typhoon-2-8B | 8B | INT4 Q8 FP16 | 90 tok/s 65 tok/s 40 tok/s | ~261 ms ~265 ms ~275 ms | |
- | GLM-4-9B | 9B | INT4 Q8 FP16 | 83 tok/s 59 tok/s 36 tok/s | ~292 ms ~297 ms ~308 ms | |
- | GLM-4-9B-Chat | 9B | INT4 Q8 FP16 | 83 tok/s 59 tok/s 36 tok/s | ~292 ms ~297 ms ~308 ms | |
- | GLM-4-9B-Chat-1M | 9B | INT4 Q8 FP16 | 83 tok/s 59 tok/s 36 tok/s | ~292 ms ~297 ms ~308 ms | |
- | Yi-9B | 9B | INT4 Q8 FP16 | 83 tok/s 59 tok/s 36 tok/s | ~292 ms ~297 ms ~308 ms | |
- | Sahabat-AI-Gemma2-9B | 9.2B | INT4 Q8 FP16 | 82 tok/s 58 tok/s 35 tok/s | ~298 ms ~303 ms ~315 ms | |
- | Sahabat-AI-Gemma2-9B-Instruct | 9.2B | INT4 Q8 FP16 | 82 tok/s 58 tok/s 35 tok/s | ~298 ms ~303 ms ~315 ms | |
- | GreenMind-14B-R1 | 14B | INT4 Q8 FP16 | 60 tok/s 41 tok/s 24 tok/s | ~447 ms ~454 ms ~472 ms | |
- | Falcon-40B | 40B | INT4 Q8 | 34 tok/s 18 tok/s | ~1.2s ~1.4s | |
- | Kimi-Dev-72B | 72B | INT4 | 14 tok/s | ~2.6s | |
- | Typhoon-2-70B | 70B | INT4 | 14 tok/s | ~2.5s | |
Maximum model parameter class runnable by weight precision.
Context:
4-bit
32B Models
8-bit
32B Models
16-bit
14B Models
Hardware capacity for local training and adapter fine-tuning.
Context Length:
QLoRA
32B Models
LoRA
14B Models
Full Parameter Training
7B-8B Models
Guidance for optimal precision and operational ceilings on NVIDIA RTX 6000 Ada Generation (48GB).
Inference Sweet Spot
Optimized for 14B models at uncompressed or Q8 precision, and 32B models at Q4 with up to 32k context.
Bandwidth & Speed Profile
With 960 GB/s aggregate bandwidth, batch size 1 inference operates in a memory-bandwidth bound regime. Generates approximately 213 tok/s on an 8B Q4 model and 25 tok/s on a 70B Q4 model.
©2025 ApX Machine Learning
Assistant
Online