The NVIDIA L40 (48GB) features 48 GB of dedicated VRAM and 864 GB/s memory bandwidth, supporting CUDA and TensorRT-LLM runtimes for full-precision and quantized inference.
Memory
48 GB
Usable Memory Ceiling
48 GB
Bandwidth
864 GB/s
Max Inference Class
32B Models (Q4)
TDP
300W
Estimated memory requirements as context length increases. Curves crossing above the reference line indicate Out of Memory (OOM).
Precision:
Inference throughput, memory compatibility, and generation speeds for open-weights LLMs on NVIDIA L40 (48GB).
Sort by:
Context:
KV Cache:
GPUs:
| Rank | Model | Parameters | Precision | TPS (Approx.) | TTFT | Can Run |
|---|---|---|---|---|---|---|
#33 | Qwen 3.8 27B | 27B | INT4 Q8 | 42 tok/s 24 tok/s | ~1.9s ~1.9s | |
#48 | Agnes 3.0 Flash | 33B | INT4 Q8 | 35 tok/s 20 tok/s | ~2.3s ~2.3s | |
#72 | K2 Horizon MoVA 36B A4B | 36B (4B active) | INT4 Q8 | 171 tok/s 119 tok/s | ~366 ms ~369 ms | |
#83 | Qwen3.5-27B | 27B | INT4 Q8 | 42 tok/s 24 tok/s | ~1.9s ~1.9s | |
#92 | Sarvam-30B | 32B (2.4B active) | INT4 Q8 | 221 tok/s 166 tok/s | ~256 ms ~257 ms | |
#94 | Qwen3.6 35B A3B | 35B (3B active) | INT4 Q8 | 199 tok/s 144 tok/s | ~298 ms ~300 ms | |
#96 | Muse Glimmer 30B | 30B | INT4 Q8 | 38 tok/s 22 tok/s | ~2.1s ~2.1s | |
#100 | Phi-4 Reasoning Plus | 14B | INT4 Q8 FP16 | 55 tok/s 37 tok/s 21 tok/s | ~984 ms ~993 ms ~1.0s | |
#101 | MiMo V2 Flash | 15B (309B active) | INT4 Q8 FP16 | 4 tok/s 2 tok/s 1 tok/s | ~20.3s ~20.5s ~21.0s | |
#108 | Gemma 4 26B A4B | 25.2B (3.8B active) | INT4 Q8 | 183 tok/s 126 tok/s | ~335 ms ~337 ms | |
#109 | Gemma 4 12B | 11.95B | INT4 Q8 FP16 | 63 tok/s 43 tok/s 25 tok/s | ~843 ms ~850 ms ~867 ms | |
#113 | Qwen3.5-9B | 9B | INT4 Q8 FP16 | 110 tok/s 67 tok/s 36 tok/s | ~635 ms ~641 ms ~654 ms | |
#114 | Qwen3.5-35B-A3B | 35B (3B active) | INT4 Q8 | 199 tok/s 144 tok/s | ~298 ms ~300 ms | |
#118 | K2 Horizon 7B | 7B | INT4 Q8 FP16 | 135 tok/s 83 tok/s 45 tok/s | ~497 ms ~502 ms ~512 ms | |
#128 | NVIDIA Nemotron 3 Nano 30B-A3B | 3.5B (30B active) | INT4 Q8 FP16 | 36 tok/s 21 tok/s 11 tok/s | ~2.0s ~2.0s ~2.1s | |
#129 | Gemma 4 31B | 30.7B | INT4 Q8 | 37 tok/s 21 tok/s | ~2.1s ~2.1s | |
#131 | Nemotron 3.5 Lightning | 30B (3B active) | INT4 Q8 | 79 tok/s 71 tok/s | ~300 ms ~301 ms | |
#132 | Qwen3.5-4B | 4B | INT4 Q8 FP16 | 201 tok/s 132 tok/s 75 tok/s | ~293 ms ~295 ms ~301 ms | |
#133 | Qwen3-30B-A3B | 30B (3B active) | INT4 Q8 | 201 tok/s 146 tok/s | ~292 ms ~294 ms | |
#136 | GPT-OSS 20B | 21B (3.6B active) | INT4 Q8 FP16 | 88 tok/s 76 tok/s 49 tok/s | ~319 ms ~321 ms ~382 ms | |
#146 | Granite 4.2 8B | 8B | INT4 Q8 FP16 | 121 tok/s 74 tok/s 40 tok/s | ~566 ms ~571 ms ~582 ms | |
#150 | Gemma 4 E4B | 8B | INT4 Q8 FP16 | 121 tok/s 74 tok/s 40 tok/s | ~566 ms ~571 ms ~582 ms | |
#151 | Nemotron 3.5 Lightning 30B A3B | 30B (3B active) | INT4 Q8 | 201 tok/s 146 tok/s | ~292 ms ~294 ms | |
#153 | Qwen3-32B | 32B | INT4 Q8 | 36 tok/s 20 tok/s | ~2.2s ~2.2s | |
#154 | Qwen2.5-72B | 72B | INT4 | 16 tok/s | ~5.3s | |
#155 | Mistral Large 3 | 41B (675B active) | INT4 | 2 tok/s | ~44.4s | |
#156 | GLM-4 | 32B | INT4 Q8 | 28 tok/s 17 tok/s | ~2.2s ~2.4s | |
#157 | DeepSeek-R1 70B | 70B | INT4 | 18 tok/s | ~4.8s | |
#158 | GLM-4V | 9B | INT4 Q8 FP16 | 80 tok/s 55 tok/s 32 tok/s | ~639 ms ~644 ms ~657 ms | |
#159 | Gemma 3 27B | 27B | INT4 Q8 | 42 tok/s 24 tok/s | ~1.9s ~1.9s | |
#160 | Phi-4 | 14B | INT4 Q8 FP16 | 76 tok/s 45 tok/s 23 tok/s | ~979 ms ~988 ms ~1.0s | |
#161 | Llama 3.3 70B | 70B | INT4 | 17 tok/s | ~4.8s | |
#162 | DeepSeek-R1 32B | 32B | INT4 Q8 | 37 tok/s 21 tok/s | ~2.2s ~2.2s | |
#163 | Hunyuan Standard | 52B (389B active) | INT4 | 3 tok/s | ~25.6s | |
#164 | Qwen2.5-32B | 32B | INT4 Q8 | 36 tok/s 20 tok/s | ~2.2s ~2.2s | |
#168 | Magistral Small | 24B | INT4 Q8 | 36 tok/s 23 tok/s | ~1.7s ~1.7s | |
#169 | OLMo 3 7B Think | 7B | INT4 Q8 FP16 | 96 tok/s 68 tok/s 40 tok/s | ~500 ms ~505 ms ~515 ms | |
#170 | OLMo 3.1 32B Instruct | 32B | INT4 Q8 | 28 tok/s 17 tok/s | ~2.2s ~2.4s | |
#171 | Llama 3.1 70B | 70B | INT4 | 17 tok/s | ~4.8s | |
#172 | DeepSeek-R1 14B | 14B | INT4 Q8 FP16 | 78 tok/s 45 tok/s 24 tok/s | ~979 ms ~988 ms ~1.0s | |
#173 | Ministral 3 14B | 14B | INT4 Q8 FP16 | 55 tok/s 37 tok/s 21 tok/s | ~984 ms ~993 ms ~1.0s | |
#177 | Gemma 3 12B | 12B | INT4 Q8 FP16 | 87 tok/s 51 tok/s 27 tok/s | ~842 ms ~850 ms ~867 ms | |
#179 | Qwen2-72B | 72B | INT4 | 16 tok/s | ~5.3s | |
#180 | OLMo 3 32B Base | 32B | INT4 Q8 | 28 tok/s 17 tok/s | ~2.2s ~2.4s | |
#181 | Mistral-Small-2501 | 24B | INT4 Q8 FP16 | 47 tok/s 27 tok/s 13 tok/s | ~1.7s ~1.7s ~2.0s | |
#182 | Ministral 3 8B | 8B | INT4 Q8 FP16 | 88 tok/s 61 tok/s 36 tok/s | ~569 ms ~574 ms ~585 ms | |
#183 | Qwen3.5-2B | 2B | INT4 Q8 FP16 | 300 tok/s 216 tok/s 133 tok/s | ~157 ms ~158 ms ~161 ms | |
#184 | MiniCPM5-2B | 2B | INT4 Q8 FP16 | 300 tok/s 216 tok/s 133 tok/s | ~157 ms ~158 ms ~161 ms | |
#185 | Qwen2.5-14B | 14B | INT4 Q8 FP16 | 76 tok/s 45 tok/s 23 tok/s | ~979 ms ~988 ms ~1.0s | |
#186 | Gemma 2 27B | 27B | INT4 Q8 | 42 tok/s 24 tok/s | ~1.9s ~1.9s | |
#187 | OLMo 3.1 32B Think | 32B | INT4 Q8 | 28 tok/s 17 tok/s | ~2.2s ~2.4s | |
#188 | Gemma 4 E2B | 5.1B | INT4 Q8 FP16 | 170 tok/s 109 tok/s 60 tok/s | ~368 ms ~371 ms ~378 ms | |
#189 | Qwen3-4B | 4B | INT4 Q8 FP16 | 201 tok/s 132 tok/s 75 tok/s | ~293 ms ~295 ms ~301 ms | |
#190 | DeepSeek-R1 8B | 8B | INT4 Q8 FP16 | 124 tok/s 75 tok/s 40 tok/s | ~565 ms ~571 ms ~582 ms | |
#191 | Llama 3 70B | 70B | INT4 | 17 tok/s | ~4.8s | |
#193 | Ministral 3 3B | 3B | INT4 Q8 FP16 | 162 tok/s 125 tok/s 81 tok/s | ~226 ms ~228 ms ~232 ms | |
#195 | Qwen3-14B | 14B | INT4 Q8 FP16 | 76 tok/s 45 tok/s 23 tok/s | ~979 ms ~988 ms ~1.0s | |
#196 | Kimi Linear 48B A3B Instruct | 48B (3B active) | INT4 | 67 tok/s | ~325 ms | |
#197 | Gemma 2 9B | 9B | INT4 Q8 FP16 | 110 tok/s 67 tok/s 36 tok/s | ~635 ms ~641 ms ~654 ms | |
#198 | Qwen2.5-7B | 7B | INT4 Q8 FP16 | 135 tok/s 83 tok/s 45 tok/s | ~497 ms ~502 ms ~512 ms | |
#199 | Qwen3-8B | 8B | INT4 Q8 FP16 | 121 tok/s 74 tok/s 40 tok/s | ~566 ms ~571 ms ~582 ms | |
#200 | Gemma 3 4B | 4B | INT4 Q8 FP16 | 201 tok/s 132 tok/s 75 tok/s | ~293 ms ~295 ms ~301 ms | |
#201 | DeepSeek-R1 7B | 7B | INT4 Q8 FP16 | 138 tok/s 84 tok/s 46 tok/s | ~497 ms ~502 ms ~512 ms | |
#202 | Llama 3.1 8B | 8B | INT4 Q8 FP16 | 121 tok/s 74 tok/s 40 tok/s | ~566 ms ~571 ms ~582 ms | |
#204 | Qwen3-1.7B | 1.7B | INT4 Q8 FP16 | 326 tok/s 240 tok/s 151 tok/s | ~134 ms ~135 ms ~138 ms | |
#205 | Command R | 35B | INT4 Q8 | 26 tok/s 16 tok/s | ~2.4s ~2.6s | |
#206 | Gemma 3 270M | 0.27B | INT4 Q8 FP16 | 519 tok/s 479 tok/s 403 tok/s | ~24 ms ~24 ms ~24 ms | |
#208 | Llama 3 8B | 8B | INT4 Q8 FP16 | 121 tok/s 74 tok/s 40 tok/s | ~566 ms ~571 ms ~582 ms | |
#209 | Qwen3-0.6B | 0.6B | INT4 Q8 FP16 | 489 tok/s 411 tok/s 303 tok/s | ~49 ms ~49 ms ~50 ms | |
#210 | Phi-4-Mini | 3.8B | INT4 Q8 FP16 | 208 tok/s 137 tok/s 78 tok/s | ~279 ms ~281 ms ~287 ms | |
#211 | Mixtral-8x7B-v0.1 | 46.7B (7B active) | INT4 Q8 | 119 tok/s 70 tok/s | ~577 ms ~683 ms | |
#212 | Ministral-8B-2410 | 8B | INT4 Q8 FP16 | 121 tok/s 74 tok/s 40 tok/s | ~566 ms ~571 ms ~582 ms | |
#213 | DeepSeek-R1 1.5B | 1.5B | INT4 Q8 FP16 | 346 tok/s 259 tok/s 166 tok/s | ~119 ms ~120 ms ~122 ms | |
#214 | Llama 3.2 3B | 3B | INT4 Q8 FP16 | 241 tok/s 164 tok/s 96 tok/s | ~224 ms ~226 ms ~231 ms | |
#215 | Qwen3.5-0.8B | 0.8B | INT4 Q8 FP16 | 446 tok/s 362 tok/s 255 tok/s | ~65 ms ~66 ms ~67 ms | |
#216 | Phi-3-mini | 3.8B | INT4 Q8 FP16 | 208 tok/s 137 tok/s 78 tok/s | ~279 ms ~281 ms ~287 ms | |
#217 | Gemma 3n E2B IT | 6B (2B active) | INT4 Q8 FP16 | 162 tok/s 138 tok/s 99 tok/s | ~170 ms ~171 ms ~174 ms | |
#218 | Mistral-7B-Instruct-v0.1 | 7.3B | INT4 Q8 FP16 | 130 tok/s 80 tok/s 43 tok/s | ~518 ms ~522 ms ~533 ms | |
#219 | Llama 3.2 1B | 1B | INT4 Q8 FP16 | 409 tok/s 323 tok/s 220 tok/s | ~82 ms ~83 ms ~84 ms | |
#220 | Gemma 2 2B | 2B | INT4 Q8 FP16 | 300 tok/s 216 tok/s 133 tok/s | ~157 ms ~158 ms ~161 ms | |
#221 | Phi-3-medium | 14B | INT4 Q8 FP16 | 76 tok/s 45 tok/s 23 tok/s | ~979 ms ~988 ms ~1.0s | |
#222 | OLMo 3 7B Instruct | 7B | INT4 Q8 FP16 | 96 tok/s 68 tok/s 40 tok/s | ~500 ms ~505 ms ~515 ms | |
#223 | Yi-34B | 34B | INT4 Q8 | 27 tok/s 16 tok/s | ~2.3s ~2.6s | |
#224 | Qwen2-7B | 7B | INT4 Q8 FP16 | 135 tok/s 83 tok/s 45 tok/s | ~497 ms ~502 ms ~512 ms | |
#225 | Phi-3-small | 7B | INT4 Q8 FP16 | 135 tok/s 83 tok/s 45 tok/s | ~497 ms ~502 ms ~512 ms | |
#226 | Gemma 3 1B | 1B | INT4 Q8 FP16 | 409 tok/s 323 tok/s 220 tok/s | ~82 ms ~83 ms ~84 ms | |
#227 | Mistral-7B-Instruct-v0.2 | 7.3B | INT4 Q8 FP16 | 130 tok/s 80 tok/s 43 tok/s | ~518 ms ~522 ms ~533 ms | |
#229 | Gemma 1 7B | 7B | INT4 Q8 FP16 | 96 tok/s 68 tok/s 40 tok/s | ~500 ms ~505 ms ~515 ms | |
#230 | Gemma 1 2B | 2B | INT4 Q8 FP16 | 319 tok/s 225 tok/s 136 tok/s | ~156 ms ~158 ms ~161 ms | |
#231 | ChatGLM3-6B | 6B | INT4 Q8 FP16 | 107 tok/s 77 tok/s 46 tok/s | ~432 ms ~436 ms ~444 ms | |
#232 | ChatGLM2-6B | 6B | INT4 Q8 FP16 | 107 tok/s 77 tok/s 46 tok/s | ~432 ms ~436 ms ~444 ms | |
#233 | ChatGLM-6B | 6B | INT4 Q8 FP16 | 107 tok/s 77 tok/s 46 tok/s | ~432 ms ~436 ms ~444 ms | |
Unranked Models (Sorted by Speed) | ||||||
- | Qwen2-0.5B | 0.5B | INT4 Q8 FP16 | 513 tok/s 439 tok/s 333 tok/s | ~41 ms ~41 ms ~42 ms | |
- | Qwen2.5-0.5B | 0.5B | INT4 Q8 FP16 | 513 tok/s 439 tok/s 333 tok/s | ~41 ms ~41 ms ~42 ms | |
- | ERNIE-4.5-0.3B | 0.3B | INT4 Q8 FP16 | 503 tok/s 462 tok/s 385 tok/s | ~26 ms ~26 ms ~27 ms | |
- | ERNIE-4.5-0.3B-Base | 0.3B | INT4 Q8 FP16 | 503 tok/s 462 tok/s 385 tok/s | ~26 ms ~26 ms ~27 ms | |
- | Falcon-1B | 1B | INT4 Q8 FP16 | 430 tok/s 335 tok/s 226 tok/s | ~82 ms ~83 ms ~84 ms | |
- | Falcon3-1B | 1B | INT4 Q8 FP16 | 409 tok/s 323 tok/s 220 tok/s | ~82 ms ~83 ms ~84 ms | |
- | Qwen2-1.5B | 1.5B | INT4 Q8 FP16 | 346 tok/s 259 tok/s 166 tok/s | ~119 ms ~120 ms ~122 ms | |
- | Qwen2.5-1.5B | 1.5B | INT4 Q8 FP16 | 346 tok/s 259 tok/s 166 tok/s | ~119 ms ~120 ms ~122 ms | |
- | Spark X2.5 1.7B | 1.7B | INT4 Q8 FP16 | 326 tok/s 240 tok/s 151 tok/s | ~134 ms ~135 ms ~138 ms | |
- | Hy-MT2 1.8B | 1.8B | INT4 Q8 FP16 | 317 tok/s 231 tok/s 144 tok/s | ~141 ms ~142 ms ~145 ms | |
- | Falcon-3B | 3B | INT4 Q8 FP16 | 255 tok/s 169 tok/s 98 tok/s | ~224 ms ~226 ms ~230 ms | |
- | CroissantLLM Base | 1.3B | INT4 Q8 FP16 | 250 tok/s 211 tok/s 151 tok/s | ~105 ms ~106 ms ~108 ms | |
- | Phi-1 | 1.3B | INT4 Q8 FP16 | 250 tok/s 211 tok/s 151 tok/s | ~105 ms ~106 ms ~108 ms | |
- | Phi-1.5 | 1.3B | INT4 Q8 FP16 | 250 tok/s 211 tok/s 151 tok/s | ~105 ms ~106 ms ~108 ms | |
- | DeepSeek-R1 3B | 3B | INT4 Q8 FP16 | 244 tok/s 165 tok/s 96 tok/s | ~224 ms ~226 ms ~231 ms | |
- | Falcon3-3B | 3B | INT4 Q8 FP16 | 241 tok/s 164 tok/s 96 tok/s | ~224 ms ~226 ms ~231 ms | |
- | Qwen2.5-3B | 3B | INT4 Q8 FP16 | 241 tok/s 164 tok/s 96 tok/s | ~224 ms ~226 ms ~231 ms | |
- | ERNIE-4.5-21B-A3B | 21B (3B active) | INT4 Q8 FP16 | 211 tok/s 150 tok/s 86 tok/s | ~274 ms ~276 ms ~304 ms | |
- | ERNIE-4.5-21B-A3B-Base | 21B (3B active) | INT4 Q8 FP16 | 211 tok/s 150 tok/s 86 tok/s | ~274 ms ~276 ms ~304 ms | |
- | ERNIE-4.5-VL-28B-A3B | 28B (3B active) | INT4 Q8 | 204 tok/s 147 tok/s | ~288 ms ~290 ms | |
- | ERNIE-4.5-VL-28B-A3B-Base | 28B (3B active) | INT4 Q8 | 204 tok/s 147 tok/s | ~288 ms ~290 ms | |
- | Hy-MT2 30B A3B | 30B (3B active) | INT4 Q8 | 201 tok/s 146 tok/s | ~292 ms ~294 ms | |
- | Spark X2.5 4B | 4B | INT4 Q8 FP16 | 201 tok/s 132 tok/s 75 tok/s | ~293 ms ~295 ms ~301 ms | |
- | Phi-2 | 2.7B | INT4 Q8 FP16 | 170 tok/s 134 tok/s 88 tok/s | ~206 ms ~208 ms ~211 ms | |
- | MaLLaM-3B | 3B | INT4 Q8 FP16 | 162 tok/s 125 tok/s 81 tok/s | ~226 ms ~228 ms ~232 ms | |
- | SmolLM3 3B | 3B | INT4 Q8 FP16 | 162 tok/s 125 tok/s 81 tok/s | ~226 ms ~228 ms ~232 ms | |
- | AliceAI Foundation 80B A3B Base | 80B (3B active) | INT4 | 152 tok/s | ~435 ms | |
- | Falcon-7B | 7B | INT4 Q8 FP16 | 141 tok/s 85 tok/s 46 tok/s | ~497 ms ~502 ms ~512 ms | |
- | Falcon3-7B | 7B | INT4 Q8 FP16 | 135 tok/s 83 tok/s 45 tok/s | ~497 ms ~502 ms ~512 ms | |
- | Hy-MT2 7B | 7B | INT4 Q8 FP16 | 135 tok/s 83 tok/s 45 tok/s | ~497 ms ~502 ms ~512 ms | |
- | Mistral-7B-v0.1 | 7.3B | INT4 Q8 FP16 | 130 tok/s 80 tok/s 43 tok/s | ~518 ms ~522 ms ~533 ms | |
- | LensVLM 9B | 9B | INT4 Q8 FP16 | 110 tok/s 67 tok/s 36 tok/s | ~635 ms ~641 ms ~654 ms | |
- | MiMo V2.6 Distill Qwen 9B | 9B | INT4 Q8 FP16 | 110 tok/s 67 tok/s 36 tok/s | ~635 ms ~641 ms ~654 ms | |
- | ChatGLM3-6B-32K | 6B | INT4 Q8 FP16 | 107 tok/s 77 tok/s 46 tok/s | ~432 ms ~436 ms ~444 ms | |
- | Yi-6B | 6B | INT4 Q8 FP16 | 107 tok/s 77 tok/s 46 tok/s | ~432 ms ~436 ms ~444 ms | |
- | Falcon3-10B | 10B | INT4 Q8 FP16 | 101 tok/s 61 tok/s 32 tok/s | ~703 ms ~710 ms ~724 ms | |
- | Kimi-VL-A3B-Instruct | 16B (3B active) | INT4 Q8 FP16 | 101 tok/s 88 tok/s 64 tok/s | ~268 ms ~270 ms ~274 ms | |
- | Falcon2-11B | 11B | INT4 Q8 FP16 | 97 tok/s 57 tok/s 30 tok/s | ~771 ms ~779 ms ~795 ms | |
- | Hunyuan Lite | 7B | INT4 Q8 FP16 | 96 tok/s 68 tok/s 40 tok/s | ~500 ms ~505 ms ~515 ms | |
- | OLMo 3 7B Base | 7B | INT4 Q8 FP16 | 96 tok/s 68 tok/s 40 tok/s | ~500 ms ~505 ms ~515 ms | |
- | SEA-LION-7B | 7.1B | INT4 Q8 FP16 | 95 tok/s 67 tok/s 40 tok/s | ~507 ms ~512 ms ~522 ms | |
- | SEA-LION-7B-Instruct | 7.1B | INT4 Q8 FP16 | 95 tok/s 67 tok/s 40 tok/s | ~507 ms ~512 ms ~522 ms | |
- | Sahabat-AI-Llama3-8B-Instruct | 8B | INT4 Q8 FP16 | 88 tok/s 61 tok/s 36 tok/s | ~569 ms ~574 ms ~585 ms | |
- | Typhoon-2-8B | 8B | INT4 Q8 FP16 | 88 tok/s 61 tok/s 36 tok/s | ~569 ms ~574 ms ~585 ms | |
- | GLM-4-9B | 9B | INT4 Q8 FP16 | 80 tok/s 55 tok/s 32 tok/s | ~639 ms ~644 ms ~657 ms | |
- | GLM-4-9B-Chat | 9B | INT4 Q8 FP16 | 80 tok/s 55 tok/s 32 tok/s | ~639 ms ~644 ms ~657 ms | |
- | GLM-4-9B-Chat-1M | 9B | INT4 Q8 FP16 | 80 tok/s 55 tok/s 32 tok/s | ~639 ms ~644 ms ~657 ms | |
- | Yi-9B | 9B | INT4 Q8 FP16 | 80 tok/s 55 tok/s 32 tok/s | ~639 ms ~644 ms ~657 ms | |
- | Sahabat-AI-Gemma2-9B | 9.2B | INT4 Q8 FP16 | 78 tok/s 54 tok/s 31 tok/s | ~652 ms ~658 ms ~671 ms | |
- | Sahabat-AI-Gemma2-9B-Instruct | 9.2B | INT4 Q8 FP16 | 78 tok/s 54 tok/s 31 tok/s | ~652 ms ~658 ms ~671 ms | |
- | GreenMind-14B-R1 | 14B | INT4 Q8 FP16 | 55 tok/s 37 tok/s 21 tok/s | ~984 ms ~993 ms ~1.0s | |
- | Falcon-40B | 40B | INT4 Q8 | 30 tok/s 16 tok/s | ~2.7s ~3.0s | |
- | Kimi-Dev-72B | 72B | INT4 | 12 tok/s | ~5.8s | |
- | Typhoon-2-70B | 70B | INT4 | 12 tok/s | ~5.6s | |
Maximum model parameter class runnable by weight precision.
Context:
4-bit
32B Models
8-bit
32B Models
16-bit
14B Models
Hardware capacity for local training and adapter fine-tuning.
Context Length:
QLoRA
32B Models
LoRA
14B Models
Full Parameter Training
7B-8B Models
Guidance for optimal precision and operational ceilings on NVIDIA L40 (48GB).
Inference Sweet Spot
Optimized for 14B models at uncompressed or Q8 precision, and 32B models at Q4 with up to 32k context.
Bandwidth & Speed Profile
With 864 GB/s aggregate bandwidth, batch size 1 inference operates in a memory-bandwidth bound regime. Generates approximately 192 tok/s on an 8B Q4 model and 23 tok/s on a 70B Q4 model.
©2025 ApX Machine Learning
Assistant
Online