The Radeon PRO W7900 (48GB) provides 48 GB of memory with 864 GB/s bandwidth, supporting local inference via ROCm and Vulkan acceleration.
Memory
48 GB
Usable Memory Ceiling
48 GB
Bandwidth
864 GB/s
Max Inference Class
32B Models (Q4)
TDP
295W
Estimated memory requirements as context length increases. Curves crossing above the reference line indicate Out of Memory (OOM).
Precision:
Inference throughput, memory compatibility, and generation speeds for open-weights LLMs on Radeon PRO W7900 (48GB).
Sort by:
Context:
KV Cache:
GPUs:
| Rank | Model | Parameters | Precision | TPS (Approx.) | TTFT | Can Run |
|---|---|---|---|---|---|---|
#33 | Qwen 3.8 27B | 27B | INT4 Q8 | 42 tok/s 25 tok/s | ~2.5s ~2.5s | |
#48 | Agnes 3.0 Flash | 33B | INT4 Q8 | 35 tok/s 21 tok/s | ~3.0s ~3.0s | |
#72 | K2 Horizon MoVA 36B A4B | 36B (4B active) | INT4 Q8 | 147 tok/s 109 tok/s | ~486 ms ~488 ms | |
#83 | Qwen3.5-27B | 27B | INT4 Q8 | 42 tok/s 25 tok/s | ~2.5s ~2.5s | |
#92 | Sarvam-30B | 32B (2.4B active) | INT4 Q8 | 180 tok/s 144 tok/s | ~340 ms ~342 ms | |
#94 | Qwen3.6 35B A3B | 35B (3B active) | INT4 Q8 | 166 tok/s 128 tok/s | ~396 ms ~398 ms | |
#96 | Muse Glimmer 30B | 30B | INT4 Q8 | 39 tok/s 22 tok/s | ~2.7s ~2.7s | |
#100 | Phi-4 Reasoning Plus | 14B | INT4 Q8 FP16 | 55 tok/s 38 tok/s 22 tok/s | ~1.3s ~1.3s ~1.3s | |
#101 | MiMo V2 Flash | 15B (309B active) | INT4 Q8 FP16 | 4 tok/s 2 tok/s 1 tok/s | ~26.8s ~27.0s ~27.5s | |
#108 | Gemma 4 26B A4B | 25.2B (3.8B active) | INT4 Q8 | 155 tok/s 115 tok/s | ~445 ms ~447 ms | |
#109 | Gemma 4 12B | 11.95B | INT4 Q8 FP16 | 62 tok/s 43 tok/s 25 tok/s | ~1.1s ~1.1s ~1.1s | |
#113 | Qwen3.5-9B | 9B | INT4 Q8 FP16 | 102 tok/s 65 tok/s 36 tok/s | ~842 ms ~847 ms ~859 ms | |
#114 | Qwen3.5-35B-A3B | 35B (3B active) | INT4 Q8 | 166 tok/s 128 tok/s | ~396 ms ~398 ms | |
#118 | K2 Horizon 7B | 7B | INT4 Q8 FP16 | 121 tok/s 79 tok/s 45 tok/s | ~660 ms ~664 ms ~674 ms | |
#128 | NVIDIA Nemotron 3 Nano 30B-A3B | 3.5B (30B active) | INT4 Q8 FP16 | 37 tok/s 22 tok/s 12 tok/s | ~2.6s ~2.7s ~2.7s | |
#129 | Gemma 4 31B | 30.7B | INT4 Q8 | 38 tok/s 22 tok/s | ~2.8s ~2.8s | |
#131 | Nemotron 3.5 Lightning | 30B (3B active) | INT4 Q8 | 75 tok/s 69 tok/s | ~396 ms ~397 ms | |
#132 | Qwen3.5-4B | 4B | INT4 Q8 FP16 | 168 tok/s 119 tok/s 72 tok/s | ~389 ms ~392 ms ~397 ms | |
#133 | Qwen3-30B-A3B | 30B (3B active) | INT4 Q8 | 168 tok/s 129 tok/s | ~389 ms ~390 ms | |
#136 | GPT-OSS 20B | 21B (3.6B active) | INT4 Q8 FP16 | 83 tok/s 73 tok/s 48 tok/s | ~422 ms ~424 ms ~502 ms | |
#146 | Granite 4.2 8B | 8B | INT4 Q8 FP16 | 111 tok/s 72 tok/s 40 tok/s | ~750 ms ~755 ms ~766 ms | |
#150 | Gemma 4 E4B | 8B | INT4 Q8 FP16 | 111 tok/s 72 tok/s 40 tok/s | ~750 ms ~755 ms ~766 ms | |
#151 | Nemotron 3.5 Lightning 30B A3B | 30B (3B active) | INT4 Q8 | 168 tok/s 129 tok/s | ~389 ms ~390 ms | |
#153 | Qwen3-32B | 32B | INT4 Q8 | 36 tok/s 21 tok/s | ~2.9s ~2.9s | |
#154 | Qwen2.5-72B | 72B | INT4 | 16 tok/s | ~7.0s | |
#155 | Mistral Large 3 | 41B (675B active) | INT4 | 2 tok/s | ~58.6s | |
#156 | GLM-4 | 32B | INT4 Q8 | 29 tok/s 18 tok/s | ~2.9s ~3.2s | |
#157 | DeepSeek-R1 70B | 70B | INT4 | 18 tok/s | ~6.3s | |
#158 | GLM-4V | 9B | INT4 Q8 FP16 | 76 tok/s 54 tok/s 33 tok/s | ~845 ms ~850 ms ~862 ms | |
#159 | Gemma 3 27B | 27B | INT4 Q8 | 42 tok/s 25 tok/s | ~2.5s ~2.5s | |
#160 | Phi-4 | 14B | INT4 Q8 FP16 | 73 tok/s 45 tok/s 24 tok/s | ~1.3s ~1.3s ~1.3s | |
#161 | Llama 3.3 70B | 70B | INT4 | 18 tok/s | ~6.3s | |
#162 | DeepSeek-R1 32B | 32B | INT4 Q8 | 37 tok/s 21 tok/s | ~2.9s ~2.9s | |
#163 | Hunyuan Standard | 52B (389B active) | INT4 | 3 tok/s | ~33.9s | |
#164 | Qwen2.5-32B | 32B | INT4 Q8 | 36 tok/s 21 tok/s | ~2.9s ~2.9s | |
#168 | Magistral Small | 24B | INT4 Q8 | 36 tok/s 24 tok/s | ~2.2s ~2.2s | |
#169 | OLMo 3 7B Think | 7B | INT4 Q8 FP16 | 90 tok/s 66 tok/s 41 tok/s | ~663 ms ~667 ms ~676 ms | |
#170 | OLMo 3.1 32B Instruct | 32B | INT4 Q8 | 29 tok/s 18 tok/s | ~2.9s ~3.2s | |
#171 | Llama 3.1 70B | 70B | INT4 | 18 tok/s | ~6.3s | |
#172 | DeepSeek-R1 14B | 14B | INT4 Q8 FP16 | 75 tok/s 45 tok/s 24 tok/s | ~1.3s ~1.3s ~1.3s | |
#173 | Ministral 3 14B | 14B | INT4 Q8 FP16 | 55 tok/s 38 tok/s 22 tok/s | ~1.3s ~1.3s ~1.3s | |
#177 | Gemma 3 12B | 12B | INT4 Q8 FP16 | 82 tok/s 51 tok/s 28 tok/s | ~1.1s ~1.1s ~1.1s | |
#179 | Qwen2-72B | 72B | INT4 | 16 tok/s | ~7.0s | |
#180 | OLMo 3 32B Base | 32B | INT4 Q8 | 29 tok/s 18 tok/s | ~2.9s ~3.2s | |
#181 | Mistral-Small-2501 | 24B | INT4 Q8 FP16 | 47 tok/s 28 tok/s 13 tok/s | ~2.2s ~2.2s ~2.6s | |
#182 | Ministral 3 8B | 8B | INT4 Q8 FP16 | 83 tok/s 60 tok/s 36 tok/s | ~753 ms ~758 ms ~768 ms | |
#183 | Qwen3.5-2B | 2B | INT4 Q8 FP16 | 226 tok/s 177 tok/s 119 tok/s | ~210 ms ~211 ms ~214 ms | |
#184 | MiniCPM5-2B | 2B | INT4 Q8 FP16 | 226 tok/s 177 tok/s 119 tok/s | ~210 ms ~211 ms ~214 ms | |
#185 | Qwen2.5-14B | 14B | INT4 Q8 FP16 | 73 tok/s 45 tok/s 24 tok/s | ~1.3s ~1.3s ~1.3s | |
#186 | Gemma 2 27B | 27B | INT4 Q8 | 42 tok/s 25 tok/s | ~2.5s ~2.5s | |
#187 | OLMo 3.1 32B Think | 32B | INT4 Q8 | 29 tok/s 18 tok/s | ~2.9s ~3.2s | |
#188 | Gemma 4 E2B | 5.1B | INT4 Q8 FP16 | 147 tok/s 100 tok/s 59 tok/s | ~489 ms ~492 ms ~499 ms | |
#189 | Qwen3-4B | 4B | INT4 Q8 FP16 | 168 tok/s 119 tok/s 72 tok/s | ~389 ms ~392 ms ~397 ms | |
#190 | DeepSeek-R1 8B | 8B | INT4 Q8 FP16 | 113 tok/s 72 tok/s 40 tok/s | ~750 ms ~755 ms ~766 ms | |
#191 | Llama 3 70B | 70B | INT4 | 18 tok/s | ~6.3s | |
#193 | Ministral 3 3B | 3B | INT4 Q8 FP16 | 141 tok/s 114 tok/s 78 tok/s | ~301 ms ~303 ms ~307 ms | |
#195 | Qwen3-14B | 14B | INT4 Q8 FP16 | 73 tok/s 45 tok/s 24 tok/s | ~1.3s ~1.3s ~1.3s | |
#196 | Kimi Linear 48B A3B Instruct | 48B (3B active) | INT4 | 65 tok/s | ~429 ms | |
#197 | Gemma 2 9B | 9B | INT4 Q8 FP16 | 102 tok/s 65 tok/s 36 tok/s | ~842 ms ~847 ms ~859 ms | |
#198 | Qwen2.5-7B | 7B | INT4 Q8 FP16 | 121 tok/s 79 tok/s 45 tok/s | ~660 ms ~664 ms ~674 ms | |
#199 | Qwen3-8B | 8B | INT4 Q8 FP16 | 111 tok/s 72 tok/s 40 tok/s | ~750 ms ~755 ms ~766 ms | |
#200 | Gemma 3 4B | 4B | INT4 Q8 FP16 | 168 tok/s 119 tok/s 72 tok/s | ~389 ms ~392 ms ~397 ms | |
#201 | DeepSeek-R1 7B | 7B | INT4 Q8 FP16 | 123 tok/s 80 tok/s 46 tok/s | ~660 ms ~664 ms ~674 ms | |
#202 | Llama 3.1 8B | 8B | INT4 Q8 FP16 | 111 tok/s 72 tok/s 40 tok/s | ~750 ms ~755 ms ~766 ms | |
#204 | Qwen3-1.7B | 1.7B | INT4 Q8 FP16 | 239 tok/s 192 tok/s 133 tok/s | ~180 ms ~181 ms ~184 ms | |
#205 | Command R | 35B | INT4 Q8 | 27 tok/s 16 tok/s | ~3.2s ~3.5s | |
#206 | Gemma 3 270M | 0.27B | INT4 Q8 FP16 | 322 tok/s 307 tok/s 276 tok/s | ~34 ms ~34 ms ~35 ms | |
#208 | Llama 3 8B | 8B | INT4 Q8 FP16 | 111 tok/s 72 tok/s 40 tok/s | ~750 ms ~755 ms ~766 ms | |
#209 | Qwen3-0.6B | 0.6B | INT4 Q8 FP16 | 311 tok/s 279 tok/s 227 tok/s | ~68 ms ~68 ms ~69 ms | |
#210 | Phi-4-Mini | 3.8B | INT4 Q8 FP16 | 172 tok/s 123 tok/s 75 tok/s | ~371 ms ~374 ms ~379 ms | |
#211 | Mixtral-8x7B-v0.1 | 46.7B (7B active) | INT4 Q8 | 109 tok/s 67 tok/s | ~765 ms ~902 ms | |
#212 | Ministral-8B-2410 | 8B | INT4 Q8 FP16 | 111 tok/s 72 tok/s 40 tok/s | ~750 ms ~755 ms ~766 ms | |
#213 | DeepSeek-R1 1.5B | 1.5B | INT4 Q8 FP16 | 250 tok/s 203 tok/s 144 tok/s | ~160 ms ~161 ms ~163 ms | |
#214 | Llama 3.2 3B | 3B | INT4 Q8 FP16 | 193 tok/s 142 tok/s 90 tok/s | ~299 ms ~301 ms ~305 ms | |
#215 | Qwen3.5-0.8B | 0.8B | INT4 Q8 FP16 | 294 tok/s 257 tok/s 201 tok/s | ~89 ms ~90 ms ~91 ms | |
#216 | Phi-3-mini | 3.8B | INT4 Q8 FP16 | 172 tok/s 123 tok/s 75 tok/s | ~371 ms ~374 ms ~379 ms | |
#217 | Gemma 3n E2B IT | 6B (2B active) | INT4 Q8 FP16 | 141 tok/s 123 tok/s 92 tok/s | ~226 ms ~227 ms ~230 ms | |
#218 | Mistral-7B-Instruct-v0.1 | 7.3B | INT4 Q8 FP16 | 118 tok/s 77 tok/s 44 tok/s | ~686 ms ~691 ms ~701 ms | |
#219 | Llama 3.2 1B | 1B | INT4 Q8 FP16 | 279 tok/s 238 tok/s 180 tok/s | ~112 ms ~112 ms ~114 ms | |
#220 | Gemma 2 2B | 2B | INT4 Q8 FP16 | 226 tok/s 177 tok/s 119 tok/s | ~210 ms ~211 ms ~214 ms | |
#221 | Phi-3-medium | 14B | INT4 Q8 FP16 | 73 tok/s 45 tok/s 24 tok/s | ~1.3s ~1.3s ~1.3s | |
#222 | OLMo 3 7B Instruct | 7B | INT4 Q8 FP16 | 90 tok/s 66 tok/s 41 tok/s | ~663 ms ~667 ms ~676 ms | |
#223 | Yi-34B | 34B | INT4 Q8 | 27 tok/s 17 tok/s | ~3.1s ~3.4s | |
#224 | Qwen2-7B | 7B | INT4 Q8 FP16 | 121 tok/s 79 tok/s 45 tok/s | ~660 ms ~664 ms ~674 ms | |
#225 | Phi-3-small | 7B | INT4 Q8 FP16 | 121 tok/s 79 tok/s 45 tok/s | ~660 ms ~664 ms ~674 ms | |
#226 | Gemma 3 1B | 1B | INT4 Q8 FP16 | 279 tok/s 238 tok/s 180 tok/s | ~112 ms ~112 ms ~114 ms | |
#227 | Mistral-7B-Instruct-v0.2 | 7.3B | INT4 Q8 FP16 | 118 tok/s 77 tok/s 44 tok/s | ~686 ms ~691 ms ~701 ms | |
#229 | Gemma 1 7B | 7B | INT4 Q8 FP16 | 90 tok/s 66 tok/s 41 tok/s | ~663 ms ~667 ms ~676 ms | |
#230 | Gemma 1 2B | 2B | INT4 Q8 FP16 | 236 tok/s 183 tok/s 122 tok/s | ~209 ms ~211 ms ~213 ms | |
#231 | ChatGLM3-6B | 6B | INT4 Q8 FP16 | 99 tok/s 74 tok/s 46 tok/s | ~572 ms ~576 ms ~584 ms | |
#232 | ChatGLM2-6B | 6B | INT4 Q8 FP16 | 99 tok/s 74 tok/s 46 tok/s | ~572 ms ~576 ms ~584 ms | |
#233 | ChatGLM-6B | 6B | INT4 Q8 FP16 | 99 tok/s 74 tok/s 46 tok/s | ~572 ms ~576 ms ~584 ms | |
Unranked Models (Sorted by Speed) | ||||||
- | Qwen2-0.5B | 0.5B | INT4 Q8 FP16 | 320 tok/s 291 tok/s 243 tok/s | ~57 ms ~58 ms ~58 ms | |
- | Qwen2.5-0.5B | 0.5B | INT4 Q8 FP16 | 320 tok/s 291 tok/s 243 tok/s | ~57 ms ~58 ms ~58 ms | |
- | ERNIE-4.5-0.3B | 0.3B | INT4 Q8 FP16 | 317 tok/s 301 tok/s 268 tok/s | ~37 ms ~37 ms ~38 ms | |
- | ERNIE-4.5-0.3B-Base | 0.3B | INT4 Q8 FP16 | 317 tok/s 301 tok/s 268 tok/s | ~37 ms ~37 ms ~38 ms | |
- | Falcon-1B | 1B | INT4 Q8 FP16 | 288 tok/s 244 tok/s 183 tok/s | ~112 ms ~112 ms ~114 ms | |
- | Falcon3-1B | 1B | INT4 Q8 FP16 | 279 tok/s 238 tok/s 180 tok/s | ~112 ms ~112 ms ~114 ms | |
- | Qwen2-1.5B | 1.5B | INT4 Q8 FP16 | 250 tok/s 203 tok/s 144 tok/s | ~160 ms ~161 ms ~163 ms | |
- | Qwen2.5-1.5B | 1.5B | INT4 Q8 FP16 | 250 tok/s 203 tok/s 144 tok/s | ~160 ms ~161 ms ~163 ms | |
- | Spark X2.5 1.7B | 1.7B | INT4 Q8 FP16 | 239 tok/s 192 tok/s 133 tok/s | ~180 ms ~181 ms ~184 ms | |
- | Hy-MT2 1.8B | 1.8B | INT4 Q8 FP16 | 235 tok/s 187 tok/s 128 tok/s | ~190 ms ~191 ms ~193 ms | |
- | Falcon-3B | 3B | INT4 Q8 FP16 | 201 tok/s 146 tok/s 91 tok/s | ~299 ms ~301 ms ~305 ms | |
- | CroissantLLM Base | 1.3B | INT4 Q8 FP16 | 198 tok/s 174 tok/s 133 tok/s | ~142 ms ~142 ms ~144 ms | |
- | Phi-1 | 1.3B | INT4 Q8 FP16 | 198 tok/s 174 tok/s 133 tok/s | ~142 ms ~142 ms ~144 ms | |
- | Phi-1.5 | 1.3B | INT4 Q8 FP16 | 198 tok/s 174 tok/s 133 tok/s | ~142 ms ~142 ms ~144 ms | |
- | DeepSeek-R1 3B | 3B | INT4 Q8 FP16 | 194 tok/s 143 tok/s 90 tok/s | ~299 ms ~301 ms ~305 ms | |
- | Falcon3-3B | 3B | INT4 Q8 FP16 | 193 tok/s 142 tok/s 90 tok/s | ~299 ms ~301 ms ~305 ms | |
- | Qwen2.5-3B | 3B | INT4 Q8 FP16 | 193 tok/s 142 tok/s 90 tok/s | ~299 ms ~301 ms ~305 ms | |
- | ERNIE-4.5-21B-A3B | 21B (3B active) | INT4 Q8 FP16 | 174 tok/s 132 tok/s 82 tok/s | ~364 ms ~366 ms ~401 ms | |
- | ERNIE-4.5-21B-A3B-Base | 21B (3B active) | INT4 Q8 FP16 | 174 tok/s 132 tok/s 82 tok/s | ~364 ms ~366 ms ~401 ms | |
- | ERNIE-4.5-VL-28B-A3B | 28B (3B active) | INT4 Q8 | 169 tok/s 130 tok/s | ~383 ms ~385 ms | |
- | ERNIE-4.5-VL-28B-A3B-Base | 28B (3B active) | INT4 Q8 | 169 tok/s 130 tok/s | ~383 ms ~385 ms | |
- | Hy-MT2 30B A3B | 30B (3B active) | INT4 Q8 | 168 tok/s 129 tok/s | ~389 ms ~390 ms | |
- | Spark X2.5 4B | 4B | INT4 Q8 FP16 | 168 tok/s 119 tok/s 72 tok/s | ~389 ms ~392 ms ~397 ms | |
- | Phi-2 | 2.7B | INT4 Q8 FP16 | 147 tok/s 120 tok/s 83 tok/s | ~274 ms ~276 ms ~279 ms | |
- | MaLLaM-3B | 3B | INT4 Q8 FP16 | 141 tok/s 114 tok/s 78 tok/s | ~301 ms ~303 ms ~307 ms | |
- | SmolLM3 3B | 3B | INT4 Q8 FP16 | 141 tok/s 114 tok/s 78 tok/s | ~301 ms ~303 ms ~307 ms | |
- | AliceAI Foundation 80B A3B Base | 80B (3B active) | INT4 | 132 tok/s | ~577 ms | |
- | Falcon-7B | 7B | INT4 Q8 FP16 | 125 tok/s 81 tok/s 46 tok/s | ~660 ms ~664 ms ~674 ms | |
- | Falcon3-7B | 7B | INT4 Q8 FP16 | 121 tok/s 79 tok/s 45 tok/s | ~660 ms ~664 ms ~674 ms | |
- | Hy-MT2 7B | 7B | INT4 Q8 FP16 | 121 tok/s 79 tok/s 45 tok/s | ~660 ms ~664 ms ~674 ms | |
- | Mistral-7B-v0.1 | 7.3B | INT4 Q8 FP16 | 118 tok/s 77 tok/s 44 tok/s | ~686 ms ~691 ms ~701 ms | |
- | LensVLM 9B | 9B | INT4 Q8 FP16 | 102 tok/s 65 tok/s 36 tok/s | ~842 ms ~847 ms ~859 ms | |
- | MiMo V2.6 Distill Qwen 9B | 9B | INT4 Q8 FP16 | 102 tok/s 65 tok/s 36 tok/s | ~842 ms ~847 ms ~859 ms | |
- | ChatGLM3-6B-32K | 6B | INT4 Q8 FP16 | 99 tok/s 74 tok/s 46 tok/s | ~572 ms ~576 ms ~584 ms | |
- | Yi-6B | 6B | INT4 Q8 FP16 | 99 tok/s 74 tok/s 46 tok/s | ~572 ms ~576 ms ~584 ms | |
- | Kimi-VL-A3B-Instruct | 16B (3B active) | INT4 Q8 FP16 | 95 tok/s 83 tok/s 62 tok/s | ~355 ms ~356 ms ~360 ms | |
- | Falcon3-10B | 10B | INT4 Q8 FP16 | 94 tok/s 60 tok/s 33 tok/s | ~932 ms ~938 ms ~952 ms | |
- | Falcon2-11B | 11B | INT4 Q8 FP16 | 91 tok/s 56 tok/s 31 tok/s | ~1.0s ~1.0s ~1.0s | |
- | Hunyuan Lite | 7B | INT4 Q8 FP16 | 90 tok/s 66 tok/s 41 tok/s | ~663 ms ~667 ms ~676 ms | |
- | OLMo 3 7B Base | 7B | INT4 Q8 FP16 | 90 tok/s 66 tok/s 41 tok/s | ~663 ms ~667 ms ~676 ms | |
- | SEA-LION-7B | 7.1B | INT4 Q8 FP16 | 90 tok/s 65 tok/s 40 tok/s | ~672 ms ~676 ms ~685 ms | |
- | SEA-LION-7B-Instruct | 7.1B | INT4 Q8 FP16 | 90 tok/s 65 tok/s 40 tok/s | ~672 ms ~676 ms ~685 ms | |
- | Sahabat-AI-Llama3-8B-Instruct | 8B | INT4 Q8 FP16 | 83 tok/s 60 tok/s 36 tok/s | ~753 ms ~758 ms ~768 ms | |
- | Typhoon-2-8B | 8B | INT4 Q8 FP16 | 83 tok/s 60 tok/s 36 tok/s | ~753 ms ~758 ms ~768 ms | |
- | GLM-4-9B | 9B | INT4 Q8 FP16 | 76 tok/s 54 tok/s 33 tok/s | ~845 ms ~850 ms ~862 ms | |
- | GLM-4-9B-Chat | 9B | INT4 Q8 FP16 | 76 tok/s 54 tok/s 33 tok/s | ~845 ms ~850 ms ~862 ms | |
- | GLM-4-9B-Chat-1M | 9B | INT4 Q8 FP16 | 76 tok/s 54 tok/s 33 tok/s | ~845 ms ~850 ms ~862 ms | |
- | Yi-9B | 9B | INT4 Q8 FP16 | 76 tok/s 54 tok/s 33 tok/s | ~845 ms ~850 ms ~862 ms | |
- | Sahabat-AI-Gemma2-9B | 9.2B | INT4 Q8 FP16 | 75 tok/s 53 tok/s 32 tok/s | ~863 ms ~868 ms ~881 ms | |
- | Sahabat-AI-Gemma2-9B-Instruct | 9.2B | INT4 Q8 FP16 | 75 tok/s 53 tok/s 32 tok/s | ~863 ms ~868 ms ~881 ms | |
- | GreenMind-14B-R1 | 14B | INT4 Q8 FP16 | 55 tok/s 38 tok/s 22 tok/s | ~1.3s ~1.3s ~1.3s | |
- | Falcon-40B | 40B | INT4 Q8 | 31 tok/s 17 tok/s | ~3.6s ~3.9s | |
- | Typhoon-2-70B | 70B | INT4 | 13 tok/s | ~7.4s | |
- | Kimi-Dev-72B | 72B | INT4 | 12 tok/s | ~7.6s | |
Maximum model parameter class runnable by weight precision.
Context:
4-bit
32B Models
8-bit
32B Models
16-bit
14B Models
Hardware capacity for local training and adapter fine-tuning.
Context Length:
QLoRA
32B Models
LoRA
14B Models
Full Parameter Training
7B-8B Models
Guidance for optimal precision and operational ceilings on Radeon PRO W7900 (48GB).
Inference Sweet Spot
Optimized for 14B models at uncompressed or Q8 precision, and 32B models at Q4 with up to 32k context.
Bandwidth & Speed Profile
With 864 GB/s aggregate bandwidth, batch size 1 inference operates in a memory-bandwidth bound regime. Generates approximately 192 tok/s on an 8B Q4 model and 23 tok/s on a 70B Q4 model.
©2025 ApX Machine Learning
Assistant
Online