趋近智
Radeon PRO W7900 (48GB) 提供 48 GB 显存/内存与 864 GB/s 带宽,支持通过 ROCm 与 Vulkan 加速进行本地推理。
总显存
48 GB
可用显存上限
48 GB
显存带宽
864 GB/s
最大推理模型级别
32B 模型 (Q4)
热设计功耗
295W
随上下文长度增长的显存需求评估。当曲线超过参考线时将导致显存不足(OOM)。
量化精度:
主流开源大模型在 Radeon PRO W7900 (48GB) 上的推理速度、显存兼容性与生成吞吐表现。
排序:
上下文长度:
KV 缓存:
显卡数量:
| 排名 | 模型 | 参数量 | 量化精度 | 预估 TPS | TTFT | 可运行 |
|---|---|---|---|---|---|---|
#33 | Qwen 3.8 27B | 27B | INT4 Q8 | 42 tok/s 25 tok/s | ~2.5s ~2.5s | |
#48 | Agnes 3.0 Flash | 33B | INT4 Q8 | 35 tok/s 21 tok/s | ~3.0s ~3.0s | |
#72 | K2 Horizon MoVA 36B A4B | 36B (4B active) | INT4 Q8 | 147 tok/s 109 tok/s | ~486 ms ~488 ms | |
#83 | Qwen3.5-27B | 27B | INT4 Q8 | 42 tok/s 25 tok/s | ~2.5s ~2.5s | |
#92 | Sarvam-30B | 32B (2.4B active) | INT4 Q8 | 180 tok/s 144 tok/s | ~340 ms ~342 ms | |
#94 | Qwen3.6 35B A3B | 35B (3B active) | INT4 Q8 | 166 tok/s 128 tok/s | ~396 ms ~398 ms | |
#96 | Muse Glimmer 30B | 30B | INT4 Q8 | 39 tok/s 22 tok/s | ~2.7s ~2.7s | |
#100 | Phi-4 Reasoning Plus | 14B | INT4 Q8 FP16 | 55 tok/s 38 tok/s 22 tok/s | ~1.3s ~1.3s ~1.3s | |
#101 | MiMo V2 Flash | 15B (309B active) | INT4 Q8 FP16 | 4 tok/s 2 tok/s 1 tok/s | ~26.8s ~27.0s ~27.5s | |
#108 | Gemma 4 26B A4B | 25.2B (3.8B active) | INT4 Q8 | 155 tok/s 115 tok/s | ~445 ms ~447 ms | |
#109 | Gemma 4 12B | 11.95B | INT4 Q8 FP16 | 62 tok/s 43 tok/s 25 tok/s | ~1.1s ~1.1s ~1.1s | |
#113 | Qwen3.5-9B | 9B | INT4 Q8 FP16 | 102 tok/s 65 tok/s 36 tok/s | ~842 ms ~847 ms ~859 ms | |
#114 | Qwen3.5-35B-A3B | 35B (3B active) | INT4 Q8 | 166 tok/s 128 tok/s | ~396 ms ~398 ms | |
#118 | K2 Horizon 7B | 7B | INT4 Q8 FP16 | 121 tok/s 79 tok/s 45 tok/s | ~660 ms ~664 ms ~674 ms | |
#128 | NVIDIA Nemotron 3 Nano 30B-A3B | 3.5B (30B active) | INT4 Q8 FP16 | 37 tok/s 22 tok/s 12 tok/s | ~2.6s ~2.7s ~2.7s | |
#129 | Gemma 4 31B | 30.7B | INT4 Q8 | 38 tok/s 22 tok/s | ~2.8s ~2.8s | |
#131 | Nemotron 3.5 Lightning | 30B (3B active) | INT4 Q8 | 75 tok/s 69 tok/s | ~396 ms ~397 ms | |
#132 | Qwen3.5-4B | 4B | INT4 Q8 FP16 | 168 tok/s 119 tok/s 72 tok/s | ~389 ms ~392 ms ~397 ms | |
#133 | Qwen3-30B-A3B | 30B (3B active) | INT4 Q8 | 168 tok/s 129 tok/s | ~389 ms ~390 ms | |
#136 | GPT-OSS 20B | 21B (3.6B active) | INT4 Q8 FP16 | 83 tok/s 73 tok/s 48 tok/s | ~422 ms ~424 ms ~502 ms | |
#146 | Granite 4.2 8B | 8B | INT4 Q8 FP16 | 111 tok/s 72 tok/s 40 tok/s | ~750 ms ~755 ms ~766 ms | |
#150 | Gemma 4 E4B | 8B | INT4 Q8 FP16 | 111 tok/s 72 tok/s 40 tok/s | ~750 ms ~755 ms ~766 ms | |
#151 | Nemotron 3.5 Lightning 30B A3B | 30B (3B active) | INT4 Q8 | 168 tok/s 129 tok/s | ~389 ms ~390 ms | |
#153 | Qwen3-32B | 32B | INT4 Q8 | 36 tok/s 21 tok/s | ~2.9s ~2.9s | |
#154 | Qwen2.5-72B | 72B | INT4 | 16 tok/s | ~7.0s | |
#155 | Mistral Large 3 | 41B (675B active) | INT4 | 2 tok/s | ~58.6s | |
#156 | GLM-4 | 32B | INT4 Q8 | 29 tok/s 18 tok/s | ~2.9s ~3.2s | |
#157 | DeepSeek-R1 70B | 70B | INT4 | 18 tok/s | ~6.3s | |
#158 | GLM-4V | 9B | INT4 Q8 FP16 | 76 tok/s 54 tok/s 33 tok/s | ~845 ms ~850 ms ~862 ms | |
#159 | Gemma 3 27B | 27B | INT4 Q8 | 42 tok/s 25 tok/s | ~2.5s ~2.5s | |
#160 | Phi-4 | 14B | INT4 Q8 FP16 | 73 tok/s 45 tok/s 24 tok/s | ~1.3s ~1.3s ~1.3s | |
#161 | Llama 3.3 70B | 70B | INT4 | 18 tok/s | ~6.3s | |
#162 | DeepSeek-R1 32B | 32B | INT4 Q8 | 37 tok/s 21 tok/s | ~2.9s ~2.9s | |
#163 | Hunyuan Standard | 52B (389B active) | INT4 | 3 tok/s | ~33.9s | |
#164 | Qwen2.5-32B | 32B | INT4 Q8 | 36 tok/s 21 tok/s | ~2.9s ~2.9s | |
#168 | Magistral Small | 24B | INT4 Q8 | 36 tok/s 24 tok/s | ~2.2s ~2.2s | |
#169 | OLMo 3 7B Think | 7B | INT4 Q8 FP16 | 90 tok/s 66 tok/s 41 tok/s | ~663 ms ~667 ms ~676 ms | |
#170 | OLMo 3.1 32B Instruct | 32B | INT4 Q8 | 29 tok/s 18 tok/s | ~2.9s ~3.2s | |
#171 | Llama 3.1 70B | 70B | INT4 | 18 tok/s | ~6.3s | |
#172 | DeepSeek-R1 14B | 14B | INT4 Q8 FP16 | 75 tok/s 45 tok/s 24 tok/s | ~1.3s ~1.3s ~1.3s | |
#173 | Ministral 3 14B | 14B | INT4 Q8 FP16 | 55 tok/s 38 tok/s 22 tok/s | ~1.3s ~1.3s ~1.3s | |
#177 | Gemma 3 12B | 12B | INT4 Q8 FP16 | 82 tok/s 51 tok/s 28 tok/s | ~1.1s ~1.1s ~1.1s | |
#179 | Qwen2-72B | 72B | INT4 | 16 tok/s | ~7.0s | |
#180 | OLMo 3 32B Base | 32B | INT4 Q8 | 29 tok/s 18 tok/s | ~2.9s ~3.2s | |
#181 | Mistral-Small-2501 | 24B | INT4 Q8 FP16 | 47 tok/s 28 tok/s 13 tok/s | ~2.2s ~2.2s ~2.6s | |
#182 | Ministral 3 8B | 8B | INT4 Q8 FP16 | 83 tok/s 60 tok/s 36 tok/s | ~753 ms ~758 ms ~768 ms | |
#183 | Qwen3.5-2B | 2B | INT4 Q8 FP16 | 226 tok/s 177 tok/s 119 tok/s | ~210 ms ~211 ms ~214 ms | |
#184 | MiniCPM5-2B | 2B | INT4 Q8 FP16 | 226 tok/s 177 tok/s 119 tok/s | ~210 ms ~211 ms ~214 ms | |
#185 | Qwen2.5-14B | 14B | INT4 Q8 FP16 | 73 tok/s 45 tok/s 24 tok/s | ~1.3s ~1.3s ~1.3s | |
#186 | Gemma 2 27B | 27B | INT4 Q8 | 42 tok/s 25 tok/s | ~2.5s ~2.5s | |
#187 | OLMo 3.1 32B Think | 32B | INT4 Q8 | 29 tok/s 18 tok/s | ~2.9s ~3.2s | |
#188 | Gemma 4 E2B | 5.1B | INT4 Q8 FP16 | 147 tok/s 100 tok/s 59 tok/s | ~489 ms ~492 ms ~499 ms | |
#189 | Qwen3-4B | 4B | INT4 Q8 FP16 | 168 tok/s 119 tok/s 72 tok/s | ~389 ms ~392 ms ~397 ms | |
#190 | DeepSeek-R1 8B | 8B | INT4 Q8 FP16 | 113 tok/s 72 tok/s 40 tok/s | ~750 ms ~755 ms ~766 ms | |
#191 | Llama 3 70B | 70B | INT4 | 18 tok/s | ~6.3s | |
#193 | Ministral 3 3B | 3B | INT4 Q8 FP16 | 141 tok/s 114 tok/s 78 tok/s | ~301 ms ~303 ms ~307 ms | |
#195 | Qwen3-14B | 14B | INT4 Q8 FP16 | 73 tok/s 45 tok/s 24 tok/s | ~1.3s ~1.3s ~1.3s | |
#196 | Kimi Linear 48B A3B Instruct | 48B (3B active) | INT4 | 65 tok/s | ~429 ms | |
#197 | Gemma 2 9B | 9B | INT4 Q8 FP16 | 102 tok/s 65 tok/s 36 tok/s | ~842 ms ~847 ms ~859 ms | |
#198 | Qwen2.5-7B | 7B | INT4 Q8 FP16 | 121 tok/s 79 tok/s 45 tok/s | ~660 ms ~664 ms ~674 ms | |
#199 | Qwen3-8B | 8B | INT4 Q8 FP16 | 111 tok/s 72 tok/s 40 tok/s | ~750 ms ~755 ms ~766 ms | |
#200 | Gemma 3 4B | 4B | INT4 Q8 FP16 | 168 tok/s 119 tok/s 72 tok/s | ~389 ms ~392 ms ~397 ms | |
#201 | DeepSeek-R1 7B | 7B | INT4 Q8 FP16 | 123 tok/s 80 tok/s 46 tok/s | ~660 ms ~664 ms ~674 ms | |
#202 | Llama 3.1 8B | 8B | INT4 Q8 FP16 | 111 tok/s 72 tok/s 40 tok/s | ~750 ms ~755 ms ~766 ms | |
#204 | Qwen3-1.7B | 1.7B | INT4 Q8 FP16 | 239 tok/s 192 tok/s 133 tok/s | ~180 ms ~181 ms ~184 ms | |
#205 | Command R | 35B | INT4 Q8 | 27 tok/s 16 tok/s | ~3.2s ~3.5s | |
#206 | Gemma 3 270M | 0.27B | INT4 Q8 FP16 | 322 tok/s 307 tok/s 276 tok/s | ~34 ms ~34 ms ~35 ms | |
#208 | Llama 3 8B | 8B | INT4 Q8 FP16 | 111 tok/s 72 tok/s 40 tok/s | ~750 ms ~755 ms ~766 ms | |
#209 | Qwen3-0.6B | 0.6B | INT4 Q8 FP16 | 311 tok/s 279 tok/s 227 tok/s | ~68 ms ~68 ms ~69 ms | |
#210 | Phi-4-Mini | 3.8B | INT4 Q8 FP16 | 172 tok/s 123 tok/s 75 tok/s | ~371 ms ~374 ms ~379 ms | |
#211 | Mixtral-8x7B-v0.1 | 46.7B (7B active) | INT4 Q8 | 109 tok/s 67 tok/s | ~765 ms ~902 ms | |
#212 | Ministral-8B-2410 | 8B | INT4 Q8 FP16 | 111 tok/s 72 tok/s 40 tok/s | ~750 ms ~755 ms ~766 ms | |
#213 | DeepSeek-R1 1.5B | 1.5B | INT4 Q8 FP16 | 250 tok/s 203 tok/s 144 tok/s | ~160 ms ~161 ms ~163 ms | |
#214 | Llama 3.2 3B | 3B | INT4 Q8 FP16 | 193 tok/s 142 tok/s 90 tok/s | ~299 ms ~301 ms ~305 ms | |
#215 | Qwen3.5-0.8B | 0.8B | INT4 Q8 FP16 | 294 tok/s 257 tok/s 201 tok/s | ~89 ms ~90 ms ~91 ms | |
#216 | Phi-3-mini | 3.8B | INT4 Q8 FP16 | 172 tok/s 123 tok/s 75 tok/s | ~371 ms ~374 ms ~379 ms | |
#217 | Gemma 3n E2B IT | 6B (2B active) | INT4 Q8 FP16 | 141 tok/s 123 tok/s 92 tok/s | ~226 ms ~227 ms ~230 ms | |
#218 | Mistral-7B-Instruct-v0.1 | 7.3B | INT4 Q8 FP16 | 118 tok/s 77 tok/s 44 tok/s | ~686 ms ~691 ms ~701 ms | |
#219 | Llama 3.2 1B | 1B | INT4 Q8 FP16 | 279 tok/s 238 tok/s 180 tok/s | ~112 ms ~112 ms ~114 ms | |
#220 | Gemma 2 2B | 2B | INT4 Q8 FP16 | 226 tok/s 177 tok/s 119 tok/s | ~210 ms ~211 ms ~214 ms | |
#221 | Phi-3-medium | 14B | INT4 Q8 FP16 | 73 tok/s 45 tok/s 24 tok/s | ~1.3s ~1.3s ~1.3s | |
#222 | OLMo 3 7B Instruct | 7B | INT4 Q8 FP16 | 90 tok/s 66 tok/s 41 tok/s | ~663 ms ~667 ms ~676 ms | |
#223 | Yi-34B | 34B | INT4 Q8 | 27 tok/s 17 tok/s | ~3.1s ~3.4s | |
#224 | Qwen2-7B | 7B | INT4 Q8 FP16 | 121 tok/s 79 tok/s 45 tok/s | ~660 ms ~664 ms ~674 ms | |
#225 | Phi-3-small | 7B | INT4 Q8 FP16 | 121 tok/s 79 tok/s 45 tok/s | ~660 ms ~664 ms ~674 ms | |
#226 | Gemma 3 1B | 1B | INT4 Q8 FP16 | 279 tok/s 238 tok/s 180 tok/s | ~112 ms ~112 ms ~114 ms | |
#227 | Mistral-7B-Instruct-v0.2 | 7.3B | INT4 Q8 FP16 | 118 tok/s 77 tok/s 44 tok/s | ~686 ms ~691 ms ~701 ms | |
#229 | Gemma 1 7B | 7B | INT4 Q8 FP16 | 90 tok/s 66 tok/s 41 tok/s | ~663 ms ~667 ms ~676 ms | |
#230 | Gemma 1 2B | 2B | INT4 Q8 FP16 | 236 tok/s 183 tok/s 122 tok/s | ~209 ms ~211 ms ~213 ms | |
#231 | ChatGLM3-6B | 6B | INT4 Q8 FP16 | 99 tok/s 74 tok/s 46 tok/s | ~572 ms ~576 ms ~584 ms | |
#232 | ChatGLM2-6B | 6B | INT4 Q8 FP16 | 99 tok/s 74 tok/s 46 tok/s | ~572 ms ~576 ms ~584 ms | |
#233 | ChatGLM-6B | 6B | INT4 Q8 FP16 | 99 tok/s 74 tok/s 46 tok/s | ~572 ms ~576 ms ~584 ms | |
未上榜模型(按推理速度排序) | ||||||
- | Qwen2-0.5B | 0.5B | INT4 Q8 FP16 | 320 tok/s 291 tok/s 243 tok/s | ~57 ms ~58 ms ~58 ms | |
- | Qwen2.5-0.5B | 0.5B | INT4 Q8 FP16 | 320 tok/s 291 tok/s 243 tok/s | ~57 ms ~58 ms ~58 ms | |
- | ERNIE-4.5-0.3B | 0.3B | INT4 Q8 FP16 | 317 tok/s 301 tok/s 268 tok/s | ~37 ms ~37 ms ~38 ms | |
- | ERNIE-4.5-0.3B-Base | 0.3B | INT4 Q8 FP16 | 317 tok/s 301 tok/s 268 tok/s | ~37 ms ~37 ms ~38 ms | |
- | Falcon-1B | 1B | INT4 Q8 FP16 | 288 tok/s 244 tok/s 183 tok/s | ~112 ms ~112 ms ~114 ms | |
- | Falcon3-1B | 1B | INT4 Q8 FP16 | 279 tok/s 238 tok/s 180 tok/s | ~112 ms ~112 ms ~114 ms | |
- | Qwen2-1.5B | 1.5B | INT4 Q8 FP16 | 250 tok/s 203 tok/s 144 tok/s | ~160 ms ~161 ms ~163 ms | |
- | Qwen2.5-1.5B | 1.5B | INT4 Q8 FP16 | 250 tok/s 203 tok/s 144 tok/s | ~160 ms ~161 ms ~163 ms | |
- | Spark X2.5 1.7B | 1.7B | INT4 Q8 FP16 | 239 tok/s 192 tok/s 133 tok/s | ~180 ms ~181 ms ~184 ms | |
- | Hy-MT2 1.8B | 1.8B | INT4 Q8 FP16 | 235 tok/s 187 tok/s 128 tok/s | ~190 ms ~191 ms ~193 ms | |
- | Falcon-3B | 3B | INT4 Q8 FP16 | 201 tok/s 146 tok/s 91 tok/s | ~299 ms ~301 ms ~305 ms | |
- | CroissantLLM Base | 1.3B | INT4 Q8 FP16 | 198 tok/s 174 tok/s 133 tok/s | ~142 ms ~142 ms ~144 ms | |
- | Phi-1 | 1.3B | INT4 Q8 FP16 | 198 tok/s 174 tok/s 133 tok/s | ~142 ms ~142 ms ~144 ms | |
- | Phi-1.5 | 1.3B | INT4 Q8 FP16 | 198 tok/s 174 tok/s 133 tok/s | ~142 ms ~142 ms ~144 ms | |
- | DeepSeek-R1 3B | 3B | INT4 Q8 FP16 | 194 tok/s 143 tok/s 90 tok/s | ~299 ms ~301 ms ~305 ms | |
- | Falcon3-3B | 3B | INT4 Q8 FP16 | 193 tok/s 142 tok/s 90 tok/s | ~299 ms ~301 ms ~305 ms | |
- | Qwen2.5-3B | 3B | INT4 Q8 FP16 | 193 tok/s 142 tok/s 90 tok/s | ~299 ms ~301 ms ~305 ms | |
- | ERNIE-4.5-21B-A3B | 21B (3B active) | INT4 Q8 FP16 | 174 tok/s 132 tok/s 82 tok/s | ~364 ms ~366 ms ~401 ms | |
- | ERNIE-4.5-21B-A3B-Base | 21B (3B active) | INT4 Q8 FP16 | 174 tok/s 132 tok/s 82 tok/s | ~364 ms ~366 ms ~401 ms | |
- | ERNIE-4.5-VL-28B-A3B | 28B (3B active) | INT4 Q8 | 169 tok/s 130 tok/s | ~383 ms ~385 ms | |
- | ERNIE-4.5-VL-28B-A3B-Base | 28B (3B active) | INT4 Q8 | 169 tok/s 130 tok/s | ~383 ms ~385 ms | |
- | Hy-MT2 30B A3B | 30B (3B active) | INT4 Q8 | 168 tok/s 129 tok/s | ~389 ms ~390 ms | |
- | Spark X2.5 4B | 4B | INT4 Q8 FP16 | 168 tok/s 119 tok/s 72 tok/s | ~389 ms ~392 ms ~397 ms | |
- | Phi-2 | 2.7B | INT4 Q8 FP16 | 147 tok/s 120 tok/s 83 tok/s | ~274 ms ~276 ms ~279 ms | |
- | MaLLaM-3B | 3B | INT4 Q8 FP16 | 141 tok/s 114 tok/s 78 tok/s | ~301 ms ~303 ms ~307 ms | |
- | SmolLM3 3B | 3B | INT4 Q8 FP16 | 141 tok/s 114 tok/s 78 tok/s | ~301 ms ~303 ms ~307 ms | |
- | AliceAI Foundation 80B A3B Base | 80B (3B active) | INT4 | 132 tok/s | ~577 ms | |
- | Falcon-7B | 7B | INT4 Q8 FP16 | 125 tok/s 81 tok/s 46 tok/s | ~660 ms ~664 ms ~674 ms | |
- | Falcon3-7B | 7B | INT4 Q8 FP16 | 121 tok/s 79 tok/s 45 tok/s | ~660 ms ~664 ms ~674 ms | |
- | Hy-MT2 7B | 7B | INT4 Q8 FP16 | 121 tok/s 79 tok/s 45 tok/s | ~660 ms ~664 ms ~674 ms | |
- | Mistral-7B-v0.1 | 7.3B | INT4 Q8 FP16 | 118 tok/s 77 tok/s 44 tok/s | ~686 ms ~691 ms ~701 ms | |
- | LensVLM 9B | 9B | INT4 Q8 FP16 | 102 tok/s 65 tok/s 36 tok/s | ~842 ms ~847 ms ~859 ms | |
- | MiMo V2.6 Distill Qwen 9B | 9B | INT4 Q8 FP16 | 102 tok/s 65 tok/s 36 tok/s | ~842 ms ~847 ms ~859 ms | |
- | ChatGLM3-6B-32K | 6B | INT4 Q8 FP16 | 99 tok/s 74 tok/s 46 tok/s | ~572 ms ~576 ms ~584 ms | |
- | Yi-6B | 6B | INT4 Q8 FP16 | 99 tok/s 74 tok/s 46 tok/s | ~572 ms ~576 ms ~584 ms | |
- | Kimi-VL-A3B-Instruct | 16B (3B active) | INT4 Q8 FP16 | 95 tok/s 83 tok/s 62 tok/s | ~355 ms ~356 ms ~360 ms | |
- | Falcon3-10B | 10B | INT4 Q8 FP16 | 94 tok/s 60 tok/s 33 tok/s | ~932 ms ~938 ms ~952 ms | |
- | Falcon2-11B | 11B | INT4 Q8 FP16 | 91 tok/s 56 tok/s 31 tok/s | ~1.0s ~1.0s ~1.0s | |
- | Hunyuan Lite | 7B | INT4 Q8 FP16 | 90 tok/s 66 tok/s 41 tok/s | ~663 ms ~667 ms ~676 ms | |
- | OLMo 3 7B Base | 7B | INT4 Q8 FP16 | 90 tok/s 66 tok/s 41 tok/s | ~663 ms ~667 ms ~676 ms | |
- | SEA-LION-7B | 7.1B | INT4 Q8 FP16 | 90 tok/s 65 tok/s 40 tok/s | ~672 ms ~676 ms ~685 ms | |
- | SEA-LION-7B-Instruct | 7.1B | INT4 Q8 FP16 | 90 tok/s 65 tok/s 40 tok/s | ~672 ms ~676 ms ~685 ms | |
- | Sahabat-AI-Llama3-8B-Instruct | 8B | INT4 Q8 FP16 | 83 tok/s 60 tok/s 36 tok/s | ~753 ms ~758 ms ~768 ms | |
- | Typhoon-2-8B | 8B | INT4 Q8 FP16 | 83 tok/s 60 tok/s 36 tok/s | ~753 ms ~758 ms ~768 ms | |
- | GLM-4-9B | 9B | INT4 Q8 FP16 | 76 tok/s 54 tok/s 33 tok/s | ~845 ms ~850 ms ~862 ms | |
- | GLM-4-9B-Chat | 9B | INT4 Q8 FP16 | 76 tok/s 54 tok/s 33 tok/s | ~845 ms ~850 ms ~862 ms | |
- | GLM-4-9B-Chat-1M | 9B | INT4 Q8 FP16 | 76 tok/s 54 tok/s 33 tok/s | ~845 ms ~850 ms ~862 ms | |
- | Yi-9B | 9B | INT4 Q8 FP16 | 76 tok/s 54 tok/s 33 tok/s | ~845 ms ~850 ms ~862 ms | |
- | Sahabat-AI-Gemma2-9B | 9.2B | INT4 Q8 FP16 | 75 tok/s 53 tok/s 32 tok/s | ~863 ms ~868 ms ~881 ms | |
- | Sahabat-AI-Gemma2-9B-Instruct | 9.2B | INT4 Q8 FP16 | 75 tok/s 53 tok/s 32 tok/s | ~863 ms ~868 ms ~881 ms | |
- | GreenMind-14B-R1 | 14B | INT4 Q8 FP16 | 55 tok/s 38 tok/s 22 tok/s | ~1.3s ~1.3s ~1.3s | |
- | Falcon-40B | 40B | INT4 Q8 | 31 tok/s 17 tok/s | ~3.6s ~3.9s | |
- | Typhoon-2-70B | 70B | INT4 | 13 tok/s | ~7.4s | |
- | Kimi-Dev-72B | 72B | INT4 | 12 tok/s | ~7.6s | |
不同量化精度下可运行的最大模型参数级别。
上下文长度:
4位量化
32B 模型
8位精度
32B 模型
16位全精度
14B 模型
本地模型训练与适配器微调支持能力。
微调上下文:
QLoRA
32B 模型
LoRA
14B 模型
全参数微调
7B-8B 模型
Radeon PRO W7900 (48GB) 上的最佳量化精度与运行规格建议。
最佳推理区间
适合在全精度或 Q8 精度下运行 14B 模型,以及在 Q4 精度下搭配最高 32k 上下文运行 32B 模型。
显存带宽与推理速率
具备 864 GB/s 聚合带宽,单批次推理处于显存带宽受限模式。8B Q4 模型预估生成速度约 192 tok/s,70B Q4 模型预估生成速度约 23 tok/s。
Assistant
在线