The NVIDIA A800 (40GB) features 40 GB of dedicated VRAM and 1555 GB/s memory bandwidth, supporting CUDA and TensorRT-LLM runtimes for full-precision and quantized inference.
Memory
40 GB
Usable Memory Ceiling
40 GB
Bandwidth
1555.2 GB/s
Max Inference Class
32B Models (Q4)
TDP
400W
Estimated memory requirements as context length increases. Curves crossing above the reference line indicate Out of Memory (OOM).
Precision:
Inference throughput, memory compatibility, and generation speeds for open-weights LLMs on NVIDIA A800 (40GB).
Sort by:
Context:
KV Cache:
GPUs:
| Rank | Model | Parameters | Precision | TPS (Approx.) | TTFT | Can Run |
|---|---|---|---|---|---|---|
#33 | Qwen 3.8 27B | 27B | INT4 Q8 | 72 tok/s 42 tok/s | ~4.3s ~4.3s | |
#48 | Agnes 3.0 Flash | 33B | INT4 Q8 | 60 tok/s 33 tok/s | ~5.2s ~5.7s | |
#72 | K2 Horizon MoVA 36B A4B | 36B (4B active) | INT4 Q8 | 255 tok/s 178 tok/s | ~837 ms ~911 ms | |
#83 | Qwen3.5-27B | 27B | INT4 Q8 | 72 tok/s 42 tok/s | ~4.3s ~4.3s | |
#92 | Sarvam-30B | 32B (2.4B active) | INT4 Q8 | 314 tok/s 237 tok/s | ~583 ms ~634 ms | |
#94 | Qwen3.6 35B A3B | 35B (3B active) | INT4 Q8 | 289 tok/s 210 tok/s | ~681 ms ~741 ms | |
#96 | Muse Glimmer 30B | 30B | INT4 Q8 | 66 tok/s 36 tok/s | ~4.7s ~5.2s | |
#100 | Phi-4 Reasoning Plus | 14B | INT4 Q8 FP16 | 93 tok/s 64 tok/s 35 tok/s | ~2.2s ~2.3s ~2.5s | |
#101 | MiMo V2 Flash | 15B (309B active) | INT4 Q8 FP16 | 7 tok/s 4 tok/s 2 tok/s | ~46.7s ~46.8s ~51.1s | |
#108 | Gemma 4 26B A4B | 25.2B (3.8B active) | INT4 Q8 | 270 tok/s 198 tok/s | ~765 ms ~766 ms | |
#109 | Gemma 4 12B | 11.95B | INT4 Q8 FP16 | 106 tok/s 73 tok/s 43 tok/s | ~1.9s ~1.9s ~1.9s | |
#113 | Qwen3.5-9B | 9B | INT4 Q8 FP16 | 175 tok/s 111 tok/s 62 tok/s | ~1.5s ~1.5s ~1.5s | |
#114 | Qwen3.5-35B-A3B | 35B (3B active) | INT4 Q8 | 289 tok/s 210 tok/s | ~681 ms ~741 ms | |
#118 | K2 Horizon 7B | 7B | INT4 Q8 FP16 | 209 tok/s 136 tok/s 77 tok/s | ~1.1s ~1.1s ~1.1s | |
#128 | NVIDIA Nemotron 3 Nano 30B-A3B | 3.5B (30B active) | INT4 Q8 FP16 | 63 tok/s 37 tok/s 20 tok/s | ~4.6s ~4.6s ~4.6s | |
#129 | Gemma 4 31B | 30.7B | INT4 Q8 | 64 tok/s 36 tok/s | ~4.8s ~5.3s | |
#131 | Nemotron 3.5 Lightning | 30B (3B active) | INT4 Q8 | 129 tok/s 113 tok/s | ~672 ms ~730 ms | |
#132 | Qwen3.5-4B | 4B | INT4 Q8 FP16 | 292 tok/s 205 tok/s 124 tok/s | ~668 ms ~669 ms ~672 ms | |
#133 | Qwen3-30B-A3B | 30B (3B active) | INT4 Q8 | 292 tok/s 212 tok/s | ~667 ms ~726 ms | |
#136 | GPT-OSS 20B | 21B (3.6B active) | INT4 Q8 | 143 tok/s 125 tok/s | ~718 ms ~719 ms | |
#146 | Granite 4.2 8B | 8B | INT4 Q8 FP16 | 191 tok/s 123 tok/s 69 tok/s | ~1.3s ~1.3s ~1.3s | |
#150 | Gemma 4 E4B | 8B | INT4 Q8 FP16 | 191 tok/s 123 tok/s 69 tok/s | ~1.3s ~1.3s ~1.3s | |
#151 | Nemotron 3.5 Lightning 30B A3B | 30B (3B active) | INT4 Q8 | 292 tok/s 212 tok/s | ~667 ms ~726 ms | |
#153 | Qwen3-32B | 32B | INT4 Q8 | 62 tok/s 34 tok/s | ~5.0s ~5.5s | |
#154 | Qwen2.5-72B | 72B | INT4 | 26 tok/s | ~13.2s | |
#155 | Mistral Large 3 | 41B (675B active) | INT4 | 3 tok/s | ~110.7s | |
#156 | GLM-4 | 32B | INT4 Q8 | 49 tok/s 28 tok/s | ~5.0s ~5.9s | |
#157 | DeepSeek-R1 70B | 70B | INT4 | 29 tok/s | ~11.9s | |
#158 | GLM-4V | 9B | INT4 Q8 FP16 | 131 tok/s 93 tok/s 56 tok/s | ~1.5s ~1.5s ~1.5s | |
#159 | Gemma 3 27B | 27B | INT4 Q8 | 72 tok/s 42 tok/s | ~4.3s ~4.3s | |
#160 | Phi-4 | 14B | INT4 Q8 FP16 | 125 tok/s 76 tok/s 41 tok/s | ~2.2s ~2.3s ~2.3s | |
#161 | Llama 3.3 70B | 70B | INT4 | 29 tok/s | ~11.9s | |
#162 | DeepSeek-R1 32B | 32B | INT4 Q8 | 64 tok/s 35 tok/s | ~5.0s ~5.5s | |
#163 | Hunyuan Standard | 52B (389B active) | INT4 | 5 tok/s | ~64.0s | |
#164 | Qwen2.5-32B | 32B | INT4 Q8 | 62 tok/s 34 tok/s | ~5.0s ~5.5s | |
#168 | Magistral Small | 24B | INT4 Q8 | 61 tok/s 40 tok/s | ~3.8s ~3.8s | |
#169 | OLMo 3 7B Think | 7B | INT4 Q8 FP16 | 155 tok/s 113 tok/s 69 tok/s | ~1.1s ~1.1s ~1.1s | |
#170 | OLMo 3.1 32B Instruct | 32B | INT4 Q8 | 49 tok/s 28 tok/s | ~5.0s ~5.9s | |
#171 | Llama 3.1 70B | 70B | INT4 | 29 tok/s | ~11.9s | |
#172 | DeepSeek-R1 14B | 14B | INT4 Q8 FP16 | 128 tok/s 77 tok/s 41 tok/s | ~2.2s ~2.2s ~2.3s | |
#173 | Ministral 3 14B | 14B | INT4 Q8 FP16 | 93 tok/s 64 tok/s 35 tok/s | ~2.2s ~2.3s ~2.5s | |
#177 | Gemma 3 12B | 12B | INT4 Q8 FP16 | 141 tok/s 87 tok/s 47 tok/s | ~1.9s ~1.9s ~1.9s | |
#179 | Qwen2-72B | 72B | INT4 | 26 tok/s | ~13.2s | |
#180 | OLMo 3 32B Base | 32B | INT4 Q8 | 49 tok/s 28 tok/s | ~5.0s ~5.9s | |
#181 | Mistral-Small-2501 | 24B | INT4 Q8 | 80 tok/s 47 tok/s | ~3.8s ~3.8s | |
#182 | Ministral 3 8B | 8B | INT4 Q8 FP16 | 143 tok/s 102 tok/s 62 tok/s | ~1.3s ~1.3s ~1.3s | |
#183 | Qwen3.5-2B | 2B | INT4 Q8 FP16 | 397 tok/s 308 tok/s 206 tok/s | ~355 ms ~356 ms ~357 ms | |
#184 | MiniCPM5-2B | 2B | INT4 Q8 FP16 | 397 tok/s 308 tok/s 206 tok/s | ~355 ms ~356 ms ~357 ms | |
#185 | Qwen2.5-14B | 14B | INT4 Q8 FP16 | 125 tok/s 76 tok/s 41 tok/s | ~2.2s ~2.3s ~2.3s | |
#186 | Gemma 2 27B | 27B | INT4 Q8 | 72 tok/s 42 tok/s | ~4.3s ~4.3s | |
#187 | OLMo 3.1 32B Think | 32B | INT4 Q8 | 49 tok/s 28 tok/s | ~5.0s ~5.9s | |
#188 | Gemma 4 E2B | 5.1B | INT4 Q8 FP16 | 255 tok/s 173 tok/s 101 tok/s | ~840 ms ~842 ms ~846 ms | |
#189 | Qwen3-4B | 4B | INT4 Q8 FP16 | 292 tok/s 205 tok/s 124 tok/s | ~668 ms ~669 ms ~672 ms | |
#190 | DeepSeek-R1 8B | 8B | INT4 Q8 FP16 | 195 tok/s 124 tok/s 69 tok/s | ~1.3s ~1.3s ~1.3s | |
#191 | Llama 3 70B | 70B | INT4 | 29 tok/s | ~11.9s | |
#193 | Ministral 3 3B | 3B | INT4 Q8 FP16 | 244 tok/s 196 tok/s 133 tok/s | ~512 ms ~513 ms ~515 ms | |
#195 | Qwen3-14B | 14B | INT4 Q8 FP16 | 125 tok/s 76 tok/s 41 tok/s | ~2.2s ~2.3s ~2.3s | |
#196 | Kimi Linear 48B A3B Instruct | 48B (3B active) | INT4 | 106 tok/s | ~789 ms | |
#197 | Gemma 2 9B | 9B | INT4 Q8 FP16 | 175 tok/s 111 tok/s 62 tok/s | ~1.5s ~1.5s ~1.5s | |
#198 | Qwen2.5-7B | 7B | INT4 Q8 FP16 | 209 tok/s 136 tok/s 77 tok/s | ~1.1s ~1.1s ~1.1s | |
#199 | Qwen3-8B | 8B | INT4 Q8 FP16 | 191 tok/s 123 tok/s 69 tok/s | ~1.3s ~1.3s ~1.3s | |
#200 | Gemma 3 4B | 4B | INT4 Q8 FP16 | 292 tok/s 205 tok/s 124 tok/s | ~668 ms ~669 ms ~672 ms | |
#201 | DeepSeek-R1 7B | 7B | INT4 Q8 FP16 | 213 tok/s 138 tok/s 78 tok/s | ~1.1s ~1.1s ~1.1s | |
#202 | Llama 3.1 8B | 8B | INT4 Q8 FP16 | 191 tok/s 123 tok/s 69 tok/s | ~1.3s ~1.3s ~1.3s | |
#204 | Qwen3-1.7B | 1.7B | INT4 Q8 FP16 | 422 tok/s 335 tok/s 230 tok/s | ~304 ms ~305 ms ~306 ms | |
#205 | Command R | 35B | INT4 Q8 | 45 tok/s 26 tok/s | ~5.5s ~6.5s | |
#206 | Gemma 3 270M | 0.27B | INT4 Q8 FP16 | 576 tok/s 547 tok/s 489 tok/s | ~49 ms ~49 ms ~50 ms | |
#208 | Llama 3 8B | 8B | INT4 Q8 FP16 | 191 tok/s 123 tok/s 69 tok/s | ~1.3s ~1.3s ~1.3s | |
#209 | Qwen3-0.6B | 0.6B | INT4 Q8 FP16 | 555 tok/s 495 tok/s 400 tok/s | ~108 ms ~108 ms ~109 ms | |
#210 | Phi-4-Mini | 3.8B | INT4 Q8 FP16 | 300 tok/s 212 tok/s 129 tok/s | ~636 ms ~638 ms ~641 ms | |
#211 | Mixtral-8x7B-v0.1 | 46.7B (7B active) | INT4 | 188 tok/s | ~1.3s | |
#212 | Ministral-8B-2410 | 8B | INT4 Q8 FP16 | 191 tok/s 123 tok/s 69 tok/s | ~1.3s ~1.3s ~1.3s | |
#213 | DeepSeek-R1 1.5B | 1.5B | INT4 Q8 FP16 | 440 tok/s 356 tok/s 249 tok/s | ~269 ms ~270 ms ~271 ms | |
#214 | Llama 3.2 3B | 3B | INT4 Q8 FP16 | 337 tok/s 246 tok/s 155 tok/s | ~511 ms ~512 ms ~514 ms | |
#215 | Qwen3.5-0.8B | 0.8B | INT4 Q8 FP16 | 523 tok/s 454 tok/s 352 tok/s | ~145 ms ~146 ms ~146 ms | |
#216 | Phi-3-mini | 3.8B | INT4 Q8 FP16 | 300 tok/s 212 tok/s 129 tok/s | ~636 ms ~638 ms ~641 ms | |
#217 | Gemma 3n E2B IT | 6B (2B active) | INT4 Q8 FP16 | 244 tok/s 213 tok/s 159 tok/s | ~381 ms ~381 ms ~383 ms | |
#218 | Mistral-7B-Instruct-v0.1 | 7.3B | INT4 Q8 FP16 | 203 tok/s 132 tok/s 74 tok/s | ~1.2s ~1.2s ~1.2s | |
#219 | Llama 3.2 1B | 1B | INT4 Q8 FP16 | 494 tok/s 419 tok/s 314 tok/s | ~184 ms ~185 ms ~186 ms | |
#220 | Gemma 2 2B | 2B | INT4 Q8 FP16 | 397 tok/s 308 tok/s 206 tok/s | ~355 ms ~356 ms ~357 ms | |
#221 | Phi-3-medium | 14B | INT4 Q8 FP16 | 125 tok/s 76 tok/s 41 tok/s | ~2.2s ~2.3s ~2.3s | |
#222 | OLMo 3 7B Instruct | 7B | INT4 Q8 FP16 | 155 tok/s 113 tok/s 69 tok/s | ~1.1s ~1.1s ~1.1s | |
#223 | Yi-34B | 34B | INT4 Q8 | 46 tok/s 27 tok/s | ~5.4s ~6.3s | |
#224 | Qwen2-7B | 7B | INT4 Q8 FP16 | 209 tok/s 136 tok/s 77 tok/s | ~1.1s ~1.1s ~1.1s | |
#225 | Phi-3-small | 7B | INT4 Q8 FP16 | 209 tok/s 136 tok/s 77 tok/s | ~1.1s ~1.1s ~1.1s | |
#226 | Gemma 3 1B | 1B | INT4 Q8 FP16 | 494 tok/s 419 tok/s 314 tok/s | ~184 ms ~185 ms ~186 ms | |
#227 | Mistral-7B-Instruct-v0.2 | 7.3B | INT4 Q8 FP16 | 203 tok/s 132 tok/s 74 tok/s | ~1.2s ~1.2s ~1.2s | |
#229 | Gemma 1 7B | 7B | INT4 Q8 FP16 | 155 tok/s 113 tok/s 69 tok/s | ~1.1s ~1.1s ~1.1s | |
#230 | Gemma 1 2B | 2B | INT4 Q8 FP16 | 415 tok/s 318 tok/s 211 tok/s | ~355 ms ~356 ms ~357 ms | |
#231 | ChatGLM3-6B | 6B | INT4 Q8 FP16 | 171 tok/s 126 tok/s 79 tok/s | ~983 ms ~985 ms ~990 ms | |
#232 | ChatGLM2-6B | 6B | INT4 Q8 FP16 | 171 tok/s 126 tok/s 79 tok/s | ~983 ms ~985 ms ~990 ms | |
#233 | ChatGLM-6B | 6B | INT4 Q8 FP16 | 171 tok/s 126 tok/s 79 tok/s | ~983 ms ~985 ms ~990 ms | |
Unranked Models (Sorted by Speed) | ||||||
- | Qwen2-0.5B | 0.5B | INT4 Q8 FP16 | 571 tok/s 518 tok/s 429 tok/s | ~90 ms ~90 ms ~90 ms | |
- | Qwen2.5-0.5B | 0.5B | INT4 Q8 FP16 | 571 tok/s 518 tok/s 429 tok/s | ~90 ms ~90 ms ~90 ms | |
- | ERNIE-4.5-0.3B | 0.3B | INT4 Q8 FP16 | 565 tok/s 535 tok/s 474 tok/s | ~55 ms ~55 ms ~55 ms | |
- | ERNIE-4.5-0.3B-Base | 0.3B | INT4 Q8 FP16 | 565 tok/s 535 tok/s 474 tok/s | ~55 ms ~55 ms ~55 ms | |
- | Falcon-1B | 1B | INT4 Q8 FP16 | 511 tok/s 430 tok/s 320 tok/s | ~184 ms ~185 ms ~185 ms | |
- | Falcon3-1B | 1B | INT4 Q8 FP16 | 494 tok/s 419 tok/s 314 tok/s | ~184 ms ~185 ms ~186 ms | |
- | Qwen2-1.5B | 1.5B | INT4 Q8 FP16 | 440 tok/s 356 tok/s 249 tok/s | ~269 ms ~270 ms ~271 ms | |
- | Qwen2.5-1.5B | 1.5B | INT4 Q8 FP16 | 440 tok/s 356 tok/s 249 tok/s | ~269 ms ~270 ms ~271 ms | |
- | Spark X2.5 1.7B | 1.7B | INT4 Q8 FP16 | 422 tok/s 335 tok/s 230 tok/s | ~304 ms ~305 ms ~306 ms | |
- | Hy-MT2 1.8B | 1.8B | INT4 Q8 FP16 | 414 tok/s 326 tok/s 221 tok/s | ~320 ms ~321 ms ~322 ms | |
- | Falcon-3B | 3B | INT4 Q8 FP16 | 351 tok/s 253 tok/s 157 tok/s | ~511 ms ~512 ms ~514 ms | |
- | CroissantLLM Base | 1.3B | INT4 Q8 FP16 | 346 tok/s 303 tok/s 230 tok/s | ~235 ms ~236 ms ~237 ms | |
- | Phi-1 | 1.3B | INT4 Q8 FP16 | 346 tok/s 303 tok/s 230 tok/s | ~235 ms ~236 ms ~237 ms | |
- | Phi-1.5 | 1.3B | INT4 Q8 FP16 | 346 tok/s 303 tok/s 230 tok/s | ~235 ms ~236 ms ~237 ms | |
- | DeepSeek-R1 3B | 3B | INT4 Q8 FP16 | 340 tok/s 248 tok/s 155 tok/s | ~511 ms ~512 ms ~514 ms | |
- | Falcon3-3B | 3B | INT4 Q8 FP16 | 337 tok/s 246 tok/s 155 tok/s | ~511 ms ~512 ms ~514 ms | |
- | Qwen2.5-3B | 3B | INT4 Q8 FP16 | 337 tok/s 246 tok/s 155 tok/s | ~511 ms ~512 ms ~514 ms | |
- | ERNIE-4.5-21B-A3B | 21B (3B active) | INT4 Q8 | 303 tok/s 229 tok/s | ~625 ms ~626 ms | |
- | ERNIE-4.5-21B-A3B-Base | 21B (3B active) | INT4 Q8 | 303 tok/s 229 tok/s | ~625 ms ~626 ms | |
- | ERNIE-4.5-VL-28B-A3B | 28B (3B active) | INT4 Q8 | 294 tok/s 225 tok/s | ~657 ms ~658 ms | |
- | ERNIE-4.5-VL-28B-A3B-Base | 28B (3B active) | INT4 Q8 | 294 tok/s 225 tok/s | ~657 ms ~658 ms | |
- | Hy-MT2 30B A3B | 30B (3B active) | INT4 Q8 | 292 tok/s 212 tok/s | ~667 ms ~726 ms | |
- | Spark X2.5 4B | 4B | INT4 Q8 FP16 | 292 tok/s 205 tok/s 124 tok/s | ~668 ms ~669 ms ~672 ms | |
- | Phi-2 | 2.7B | INT4 Q8 FP16 | 254 tok/s 207 tok/s 143 tok/s | ~465 ms ~466 ms ~468 ms | |
- | MaLLaM-3B | 3B | INT4 Q8 FP16 | 244 tok/s 196 tok/s 133 tok/s | ~512 ms ~513 ms ~515 ms | |
- | SmolLM3 3B | 3B | INT4 Q8 FP16 | 244 tok/s 196 tok/s 133 tok/s | ~512 ms ~513 ms ~515 ms | |
- | Falcon-7B | 7B | INT4 Q8 FP16 | 217 tok/s 139 tok/s 78 tok/s | ~1.1s ~1.1s ~1.1s | |
- | Falcon3-7B | 7B | INT4 Q8 FP16 | 209 tok/s 136 tok/s 77 tok/s | ~1.1s ~1.1s ~1.1s | |
- | Hy-MT2 7B | 7B | INT4 Q8 FP16 | 209 tok/s 136 tok/s 77 tok/s | ~1.1s ~1.1s ~1.1s | |
- | Mistral-7B-v0.1 | 7.3B | INT4 Q8 FP16 | 203 tok/s 132 tok/s 74 tok/s | ~1.2s ~1.2s ~1.2s | |
- | LensVLM 9B | 9B | INT4 Q8 FP16 | 175 tok/s 111 tok/s 62 tok/s | ~1.5s ~1.5s ~1.5s | |
- | MiMo V2.6 Distill Qwen 9B | 9B | INT4 Q8 FP16 | 175 tok/s 111 tok/s 62 tok/s | ~1.5s ~1.5s ~1.5s | |
- | ChatGLM3-6B-32K | 6B | INT4 Q8 FP16 | 171 tok/s 126 tok/s 79 tok/s | ~983 ms ~985 ms ~990 ms | |
- | Yi-6B | 6B | INT4 Q8 FP16 | 171 tok/s 126 tok/s 79 tok/s | ~983 ms ~985 ms ~990 ms | |
- | Kimi-VL-A3B-Instruct | 16B (3B active) | INT4 Q8 FP16 | 163 tok/s 143 tok/s 101 tok/s | ~602 ms ~603 ms ~657 ms | |
- | Falcon3-10B | 10B | INT4 Q8 FP16 | 162 tok/s 102 tok/s 56 tok/s | ~1.6s ~1.6s ~1.6s | |
- | Falcon2-11B | 11B | INT4 Q8 FP16 | 157 tok/s 96 tok/s 52 tok/s | ~1.8s ~1.8s ~1.8s | |
- | Hunyuan Lite | 7B | INT4 Q8 FP16 | 155 tok/s 113 tok/s 69 tok/s | ~1.1s ~1.1s ~1.1s | |
- | OLMo 3 7B Base | 7B | INT4 Q8 FP16 | 155 tok/s 113 tok/s 69 tok/s | ~1.1s ~1.1s ~1.1s | |
- | SEA-LION-7B | 7.1B | INT4 Q8 FP16 | 154 tok/s 112 tok/s 68 tok/s | ~1.2s ~1.2s ~1.2s | |
- | SEA-LION-7B-Instruct | 7.1B | INT4 Q8 FP16 | 154 tok/s 112 tok/s 68 tok/s | ~1.2s ~1.2s ~1.2s | |
- | Sahabat-AI-Llama3-8B-Instruct | 8B | INT4 Q8 FP16 | 143 tok/s 102 tok/s 62 tok/s | ~1.3s ~1.3s ~1.3s | |
- | Typhoon-2-8B | 8B | INT4 Q8 FP16 | 143 tok/s 102 tok/s 62 tok/s | ~1.3s ~1.3s ~1.3s | |
- | GLM-4-9B | 9B | INT4 Q8 FP16 | 131 tok/s 93 tok/s 56 tok/s | ~1.5s ~1.5s ~1.5s | |
- | GLM-4-9B-Chat | 9B | INT4 Q8 FP16 | 131 tok/s 93 tok/s 56 tok/s | ~1.5s ~1.5s ~1.5s | |
- | GLM-4-9B-Chat-1M | 9B | INT4 Q8 FP16 | 131 tok/s 93 tok/s 56 tok/s | ~1.5s ~1.5s ~1.5s | |
- | Yi-9B | 9B | INT4 Q8 FP16 | 131 tok/s 93 tok/s 56 tok/s | ~1.5s ~1.5s ~1.5s | |
- | Sahabat-AI-Gemma2-9B | 9.2B | INT4 Q8 FP16 | 129 tok/s 91 tok/s 54 tok/s | ~1.5s ~1.5s ~1.5s | |
- | Sahabat-AI-Gemma2-9B-Instruct | 9.2B | INT4 Q8 FP16 | 129 tok/s 91 tok/s 54 tok/s | ~1.5s ~1.5s ~1.5s | |
- | GreenMind-14B-R1 | 14B | INT4 Q8 FP16 | 93 tok/s 64 tok/s 35 tok/s | ~2.2s ~2.3s ~2.5s | |
- | Falcon-40B | 40B | INT4 Q8 | 52 tok/s 27 tok/s | ~6.3s ~7.4s | |
Maximum model parameter class runnable by weight precision.
Context:
4-bit
32B Models
8-bit
32B Models
16-bit
14B Models
Hardware capacity for local training and adapter fine-tuning.
Context Length:
QLoRA
32B Models
LoRA
14B Models
Full Parameter Training
3B Models
Guidance for optimal precision and operational ceilings on NVIDIA A800 (40GB).
Inference Sweet Spot
Optimized for 14B models at uncompressed or Q8 precision, and 32B models at Q4 with up to 32k context.
Bandwidth & Speed Profile
With 1555.2 GB/s aggregate bandwidth, batch size 1 inference operates in a memory-bandwidth bound regime. Generates approximately 346 tok/s on an 8B Q4 model and 41 tok/s on a 70B Q4 model.
©2025 ApX Machine Learning
Assistant
Online