趋近智
AMD RX 7900 XT (20GB) 提供 20 GB 显存/内存与 800 GB/s 带宽,支持通过 ROCm 与 Vulkan 加速进行本地推理。
总显存
20 GB
可用显存上限
20 GB
显存带宽
800 GB/s
最大推理模型级别
14B 模型 (Q4)
热设计功耗
315W
随上下文长度增长的显存需求评估。当曲线超过参考线时将导致显存不足(OOM)。
量化精度:
主流开源大模型在 AMD RX 7900 XT (20GB) 上的推理速度、显存兼容性与生成吞吐表现。
排序:
上下文长度:
KV 缓存:
显卡数量:
| 排名 | 模型 | 参数量 | 量化精度 | 预估 TPS | TTFT | 可运行 |
|---|---|---|---|---|---|---|
#33 | Qwen 3.8 27B | 27B | INT4 | 39 tok/s | ~2.9s | |
#48 | Agnes 3.0 Flash | 33B | INT4 | 31 tok/s | ~3.8s | |
#72 | K2 Horizon MoVA 36B A4B | 36B (4B active) | INT4 | 126 tok/s | ~662 ms | |
#83 | Qwen3.5-27B | 27B | INT4 | 39 tok/s | ~2.9s | |
#92 | Sarvam-30B | 32B (2.4B active) | INT4 | 164 tok/s | ~428 ms | |
#94 | Qwen3.6 35B A3B | 35B (3B active) | INT4 | 143 tok/s | ~540 ms | |
#96 | Muse Glimmer 30B | 30B | INT4 | 34 tok/s | ~3.4s | |
#100 | Phi-4 Reasoning Plus | 14B | INT4 Q8 | 51 tok/s 33 tok/s | ~1.5s ~1.6s | |
#101 | MiMo V2 Flash | 15B (309B active) | INT4 | 4 tok/s | ~31.2s | |
#108 | Gemma 4 26B A4B | 25.2B (3.8B active) | INT4 | 148 tok/s | ~516 ms | |
#109 | Gemma 4 12B | 11.95B | INT4 Q8 | 58 tok/s 38 tok/s | ~1.3s ~1.4s | |
#113 | Qwen3.5-9B | 9B | INT4 Q8 FP16 | 96 tok/s 61 tok/s 30 tok/s | ~978 ms ~984 ms ~1.2s | |
#114 | Qwen3.5-35B-A3B | 35B (3B active) | INT4 | 143 tok/s | ~540 ms | |
#118 | K2 Horizon 7B | 7B | INT4 Q8 FP16 | 115 tok/s 75 tok/s 42 tok/s | ~766 ms ~771 ms ~781 ms | |
#128 | NVIDIA Nemotron 3 Nano 30B-A3B | 3.5B (30B active) | INT4 Q8 FP16 | 34 tok/s 20 tok/s 11 tok/s | ~3.1s ~3.1s ~3.1s | |
#129 | Gemma 4 31B | 30.7B | INT4 | 33 tok/s | ~3.5s | |
#132 | Qwen3.5-4B | 4B | INT4 Q8 FP16 | 161 tok/s 113 tok/s 68 tok/s | ~452 ms ~454 ms ~460 ms | |
#133 | Qwen3-30B-A3B | 30B (3B active) | INT4 | 153 tok/s | ~490 ms | |
#136 | GPT-OSS 20B | 21B (3.6B active) | INT4 | 74 tok/s | ~531 ms | |
#146 | Granite 4.2 8B | 8B | INT4 Q8 FP16 | 105 tok/s 67 tok/s 36 tok/s | ~871 ms ~877 ms ~964 ms | |
#150 | Gemma 4 E4B | 8B | INT4 Q8 FP16 | 105 tok/s 67 tok/s 36 tok/s | ~871 ms ~877 ms ~964 ms | |
#151 | Nemotron 3.5 Lightning 30B A3B | 30B (3B active) | INT4 | 153 tok/s | ~490 ms | |
#153 | Qwen3-32B | 32B | INT4 | 32 tok/s | ~3.7s | |
#158 | GLM-4V | 9B | INT4 Q8 | 72 tok/s 51 tok/s | ~981 ms ~987 ms | |
#159 | Gemma 3 27B | 27B | INT4 | 39 tok/s | ~2.9s | |
#160 | Phi-4 | 14B | INT4 Q8 | 69 tok/s 42 tok/s | ~1.5s ~1.5s | |
#162 | DeepSeek-R1 32B | 32B | INT4 | 33 tok/s | ~3.7s | |
#164 | Qwen2.5-32B | 32B | INT4 | 32 tok/s | ~3.7s | |
#168 | Magistral Small | 24B | INT4 | 32 tok/s | ~2.8s | |
#169 | OLMo 3 7B Think | 7B | INT4 Q8 FP16 | 85 tok/s 62 tok/s 36 tok/s | ~769 ms ~774 ms ~851 ms | |
#172 | DeepSeek-R1 14B | 14B | INT4 Q8 | 70 tok/s 42 tok/s | ~1.5s ~1.5s | |
#173 | Ministral 3 14B | 14B | INT4 Q8 | 51 tok/s 33 tok/s | ~1.5s ~1.6s | |
#177 | Gemma 3 12B | 12B | INT4 Q8 | 77 tok/s 48 tok/s | ~1.3s ~1.3s | |
#181 | Mistral-Small-2501 | 24B | INT4 | 44 tok/s | ~2.5s | |
#182 | Ministral 3 8B | 8B | INT4 Q8 FP16 | 78 tok/s 56 tok/s 30 tok/s | ~874 ms ~880 ms ~1.0s | |
#183 | Qwen3.5-2B | 2B | INT4 Q8 FP16 | 219 tok/s 170 tok/s 113 tok/s | ~243 ms ~244 ms ~247 ms | |
#184 | MiniCPM5-2B | 2B | INT4 Q8 FP16 | 219 tok/s 170 tok/s 113 tok/s | ~243 ms ~244 ms ~247 ms | |
#185 | Qwen2.5-14B | 14B | INT4 Q8 | 69 tok/s 42 tok/s | ~1.5s ~1.5s | |
#186 | Gemma 2 27B | 27B | INT4 | 39 tok/s | ~2.9s | |
#188 | Gemma 4 E2B | 5.1B | INT4 Q8 FP16 | 140 tok/s 95 tok/s 55 tok/s | ~567 ms ~571 ms ~578 ms | |
#189 | Qwen3-4B | 4B | INT4 Q8 FP16 | 161 tok/s 113 tok/s 68 tok/s | ~452 ms ~454 ms ~460 ms | |
#190 | DeepSeek-R1 8B | 8B | INT4 Q8 FP16 | 107 tok/s 68 tok/s 36 tok/s | ~871 ms ~876 ms ~964 ms | |
#193 | Ministral 3 3B | 3B | INT4 Q8 FP16 | 134 tok/s 108 tok/s 73 tok/s | ~349 ms ~351 ms ~355 ms | |
#195 | Qwen3-14B | 14B | INT4 Q8 | 69 tok/s 42 tok/s | ~1.5s ~1.5s | |
#197 | Gemma 2 9B | 9B | INT4 Q8 FP16 | 96 tok/s 61 tok/s 30 tok/s | ~978 ms ~984 ms ~1.2s | |
#198 | Qwen2.5-7B | 7B | INT4 Q8 FP16 | 115 tok/s 75 tok/s 42 tok/s | ~766 ms ~771 ms ~781 ms | |
#199 | Qwen3-8B | 8B | INT4 Q8 FP16 | 105 tok/s 67 tok/s 36 tok/s | ~871 ms ~877 ms ~964 ms | |
#200 | Gemma 3 4B | 4B | INT4 Q8 FP16 | 161 tok/s 113 tok/s 68 tok/s | ~452 ms ~454 ms ~460 ms | |
#201 | DeepSeek-R1 7B | 7B | INT4 Q8 FP16 | 117 tok/s 76 tok/s 43 tok/s | ~766 ms ~771 ms ~781 ms | |
#202 | Llama 3.1 8B | 8B | INT4 Q8 FP16 | 105 tok/s 67 tok/s 36 tok/s | ~871 ms ~877 ms ~964 ms | |
#204 | Qwen3-1.7B | 1.7B | INT4 Q8 FP16 | 233 tok/s 185 tok/s 126 tok/s | ~209 ms ~210 ms ~212 ms | |
#206 | Gemma 3 270M | 0.27B | INT4 Q8 FP16 | 319 tok/s 303 tok/s 271 tok/s | ~38 ms ~39 ms ~39 ms | |
#208 | Llama 3 8B | 8B | INT4 Q8 FP16 | 105 tok/s 67 tok/s 36 tok/s | ~871 ms ~877 ms ~964 ms | |
#209 | Qwen3-0.6B | 0.6B | INT4 Q8 FP16 | 307 tok/s 274 tok/s 221 tok/s | ~78 ms ~78 ms ~79 ms | |
#210 | Phi-4-Mini | 3.8B | INT4 Q8 FP16 | 165 tok/s 116 tok/s 71 tok/s | ~431 ms ~433 ms ~439 ms | |
#212 | Ministral-8B-2410 | 8B | INT4 Q8 FP16 | 105 tok/s 67 tok/s 36 tok/s | ~871 ms ~877 ms ~964 ms | |
#213 | DeepSeek-R1 1.5B | 1.5B | INT4 Q8 FP16 | 243 tok/s 196 tok/s 137 tok/s | ~185 ms ~186 ms ~188 ms | |
#214 | Llama 3.2 3B | 3B | INT4 Q8 FP16 | 185 tok/s 135 tok/s 85 tok/s | ~347 ms ~349 ms ~353 ms | |
#215 | Qwen3.5-0.8B | 0.8B | INT4 Q8 FP16 | 290 tok/s 251 tok/s 194 tok/s | ~103 ms ~103 ms ~104 ms | |
#216 | Phi-3-mini | 3.8B | INT4 Q8 FP16 | 165 tok/s 116 tok/s 71 tok/s | ~431 ms ~433 ms ~439 ms | |
#217 | Gemma 3n E2B IT | 6B (2B active) | INT4 Q8 FP16 | 134 tok/s 117 tok/s 87 tok/s | ~262 ms ~263 ms ~266 ms | |
#218 | Mistral-7B-Instruct-v0.1 | 7.3B | INT4 Q8 FP16 | 111 tok/s 72 tok/s 41 tok/s | ~797 ms ~802 ms ~813 ms | |
#219 | Llama 3.2 1B | 1B | INT4 Q8 FP16 | 273 tok/s 232 tok/s 173 tok/s | ~129 ms ~129 ms ~131 ms | |
#220 | Gemma 2 2B | 2B | INT4 Q8 FP16 | 219 tok/s 170 tok/s 113 tok/s | ~243 ms ~244 ms ~247 ms | |
#221 | Phi-3-medium | 14B | INT4 Q8 | 69 tok/s 42 tok/s | ~1.5s ~1.5s | |
#222 | OLMo 3 7B Instruct | 7B | INT4 Q8 FP16 | 85 tok/s 62 tok/s 36 tok/s | ~769 ms ~774 ms ~851 ms | |
#224 | Qwen2-7B | 7B | INT4 Q8 FP16 | 115 tok/s 75 tok/s 42 tok/s | ~766 ms ~771 ms ~781 ms | |
#225 | Phi-3-small | 7B | INT4 Q8 FP16 | 115 tok/s 75 tok/s 42 tok/s | ~766 ms ~771 ms ~781 ms | |
#226 | Gemma 3 1B | 1B | INT4 Q8 FP16 | 273 tok/s 232 tok/s 173 tok/s | ~129 ms ~129 ms ~131 ms | |
#227 | Mistral-7B-Instruct-v0.2 | 7.3B | INT4 Q8 FP16 | 111 tok/s 72 tok/s 41 tok/s | ~797 ms ~802 ms ~813 ms | |
#229 | Gemma 1 7B | 7B | INT4 Q8 FP16 | 85 tok/s 62 tok/s 36 tok/s | ~769 ms ~774 ms ~851 ms | |
#230 | Gemma 1 2B | 2B | INT4 Q8 FP16 | 229 tok/s 175 tok/s 116 tok/s | ~243 ms ~244 ms ~247 ms | |
#231 | ChatGLM3-6B | 6B | INT4 Q8 FP16 | 94 tok/s 69 tok/s 43 tok/s | ~664 ms ~668 ms ~677 ms | |
#232 | ChatGLM2-6B | 6B | INT4 Q8 FP16 | 94 tok/s 69 tok/s 43 tok/s | ~664 ms ~668 ms ~677 ms | |
#233 | ChatGLM-6B | 6B | INT4 Q8 FP16 | 94 tok/s 69 tok/s 43 tok/s | ~664 ms ~668 ms ~677 ms | |
未上榜模型(按推理速度排序) | ||||||
- | Qwen2-0.5B | 0.5B | INT4 Q8 FP16 | 317 tok/s 287 tok/s 237 tok/s | ~65 ms ~66 ms ~66 ms | |
- | Qwen2.5-0.5B | 0.5B | INT4 Q8 FP16 | 317 tok/s 287 tok/s 237 tok/s | ~65 ms ~66 ms ~66 ms | |
- | ERNIE-4.5-0.3B | 0.3B | INT4 Q8 FP16 | 313 tok/s 296 tok/s 262 tok/s | ~42 ms ~42 ms ~43 ms | |
- | ERNIE-4.5-0.3B-Base | 0.3B | INT4 Q8 FP16 | 313 tok/s 296 tok/s 262 tok/s | ~42 ms ~42 ms ~43 ms | |
- | Falcon-1B | 1B | INT4 Q8 FP16 | 283 tok/s 238 tok/s 176 tok/s | ~128 ms ~129 ms ~131 ms | |
- | Falcon3-1B | 1B | INT4 Q8 FP16 | 273 tok/s 232 tok/s 173 tok/s | ~129 ms ~129 ms ~131 ms | |
- | Qwen2-1.5B | 1.5B | INT4 Q8 FP16 | 243 tok/s 196 tok/s 137 tok/s | ~185 ms ~186 ms ~188 ms | |
- | Qwen2.5-1.5B | 1.5B | INT4 Q8 FP16 | 243 tok/s 196 tok/s 137 tok/s | ~185 ms ~186 ms ~188 ms | |
- | Spark X2.5 1.7B | 1.7B | INT4 Q8 FP16 | 233 tok/s 185 tok/s 126 tok/s | ~209 ms ~210 ms ~212 ms | |
- | Hy-MT2 1.8B | 1.8B | INT4 Q8 FP16 | 228 tok/s 180 tok/s 122 tok/s | ~219 ms ~220 ms ~223 ms | |
- | Falcon-3B | 3B | INT4 Q8 FP16 | 193 tok/s 139 tok/s 86 tok/s | ~347 ms ~349 ms ~353 ms | |
- | CroissantLLM Base | 1.3B | INT4 Q8 FP16 | 191 tok/s 167 tok/s 127 tok/s | ~163 ms ~164 ms ~166 ms | |
- | Phi-1 | 1.3B | INT4 Q8 FP16 | 191 tok/s 167 tok/s 127 tok/s | ~163 ms ~164 ms ~166 ms | |
- | Phi-1.5 | 1.3B | INT4 Q8 FP16 | 191 tok/s 167 tok/s 127 tok/s | ~163 ms ~164 ms ~166 ms | |
- | DeepSeek-R1 3B | 3B | INT4 Q8 FP16 | 187 tok/s 136 tok/s 85 tok/s | ~347 ms ~349 ms ~353 ms | |
- | Falcon3-3B | 3B | INT4 Q8 FP16 | 185 tok/s 135 tok/s 85 tok/s | ~347 ms ~349 ms ~353 ms | |
- | Qwen2.5-3B | 3B | INT4 Q8 FP16 | 185 tok/s 135 tok/s 85 tok/s | ~347 ms ~349 ms ~353 ms | |
- | ERNIE-4.5-21B-A3B | 21B (3B active) | INT4 | 167 tok/s | ~423 ms | |
- | ERNIE-4.5-21B-A3B-Base | 21B (3B active) | INT4 | 167 tok/s | ~423 ms | |
- | Spark X2.5 4B | 4B | INT4 Q8 FP16 | 161 tok/s 113 tok/s 68 tok/s | ~452 ms ~454 ms ~460 ms | |
- | ERNIE-4.5-VL-28B-A3B | 28B (3B active) | INT4 | 154 tok/s | ~482 ms | |
- | ERNIE-4.5-VL-28B-A3B-Base | 28B (3B active) | INT4 | 154 tok/s | ~482 ms | |
- | Hy-MT2 30B A3B | 30B (3B active) | INT4 | 153 tok/s | ~490 ms | |
- | Phi-2 | 2.7B | INT4 Q8 FP16 | 140 tok/s 114 tok/s 78 tok/s | ~318 ms ~319 ms ~323 ms | |
- | MaLLaM-3B | 3B | INT4 Q8 FP16 | 134 tok/s 108 tok/s 73 tok/s | ~349 ms ~351 ms ~355 ms | |
- | SmolLM3 3B | 3B | INT4 Q8 FP16 | 134 tok/s 108 tok/s 73 tok/s | ~349 ms ~351 ms ~355 ms | |
- | Falcon-7B | 7B | INT4 Q8 FP16 | 119 tok/s 76 tok/s 43 tok/s | ~766 ms ~771 ms ~781 ms | |
- | Falcon3-7B | 7B | INT4 Q8 FP16 | 115 tok/s 75 tok/s 42 tok/s | ~766 ms ~771 ms ~781 ms | |
- | Hy-MT2 7B | 7B | INT4 Q8 FP16 | 115 tok/s 75 tok/s 42 tok/s | ~766 ms ~771 ms ~781 ms | |
- | Mistral-7B-v0.1 | 7.3B | INT4 Q8 FP16 | 111 tok/s 72 tok/s 41 tok/s | ~797 ms ~802 ms ~813 ms | |
- | LensVLM 9B | 9B | INT4 Q8 FP16 | 96 tok/s 61 tok/s 30 tok/s | ~978 ms ~984 ms ~1.2s | |
- | MiMo V2.6 Distill Qwen 9B | 9B | INT4 Q8 FP16 | 96 tok/s 61 tok/s 30 tok/s | ~978 ms ~984 ms ~1.2s | |
- | ChatGLM3-6B-32K | 6B | INT4 Q8 FP16 | 94 tok/s 69 tok/s 43 tok/s | ~664 ms ~668 ms ~677 ms | |
- | Yi-6B | 6B | INT4 Q8 FP16 | 94 tok/s 69 tok/s 43 tok/s | ~664 ms ~668 ms ~677 ms | |
- | Falcon3-10B | 10B | INT4 Q8 | 89 tok/s 56 tok/s | ~1.1s ~1.1s | |
- | Kimi-VL-A3B-Instruct | 16B (3B active) | INT4 Q8 | 89 tok/s 71 tok/s | ~411 ms ~483 ms | |
- | Falcon2-11B | 11B | INT4 Q8 | 86 tok/s 53 tok/s | ~1.2s ~1.2s | |
- | Hunyuan Lite | 7B | INT4 Q8 FP16 | 85 tok/s 62 tok/s 36 tok/s | ~769 ms ~774 ms ~851 ms | |
- | OLMo 3 7B Base | 7B | INT4 Q8 FP16 | 85 tok/s 62 tok/s 36 tok/s | ~769 ms ~774 ms ~851 ms | |
- | SEA-LION-7B | 7.1B | INT4 Q8 FP16 | 85 tok/s 61 tok/s 36 tok/s | ~780 ms ~784 ms ~862 ms | |
- | SEA-LION-7B-Instruct | 7.1B | INT4 Q8 FP16 | 85 tok/s 61 tok/s 36 tok/s | ~780 ms ~784 ms ~862 ms | |
- | Sahabat-AI-Llama3-8B-Instruct | 8B | INT4 Q8 FP16 | 78 tok/s 56 tok/s 30 tok/s | ~874 ms ~880 ms ~1.0s | |
- | Typhoon-2-8B | 8B | INT4 Q8 FP16 | 78 tok/s 56 tok/s 30 tok/s | ~874 ms ~880 ms ~1.0s | |
- | GLM-4-9B | 9B | INT4 Q8 | 72 tok/s 51 tok/s | ~981 ms ~987 ms | |
- | GLM-4-9B-Chat | 9B | INT4 Q8 | 72 tok/s 51 tok/s | ~981 ms ~987 ms | |
- | GLM-4-9B-Chat-1M | 9B | INT4 Q8 | 72 tok/s 51 tok/s | ~981 ms ~987 ms | |
- | Yi-9B | 9B | INT4 Q8 | 72 tok/s 51 tok/s | ~981 ms ~987 ms | |
- | Sahabat-AI-Gemma2-9B | 9.2B | INT4 Q8 | 71 tok/s 50 tok/s | ~1.0s ~1.0s | |
- | Sahabat-AI-Gemma2-9B-Instruct | 9.2B | INT4 Q8 | 71 tok/s 50 tok/s | ~1.0s ~1.0s | |
- | GreenMind-14B-R1 | 14B | INT4 Q8 | 51 tok/s 33 tok/s | ~1.5s ~1.6s | |
不同量化精度下可运行的最大模型参数级别。
上下文长度:
4位量化
14B 模型
8位精度
14B 模型
16位全精度
8B 模型
本地模型训练与适配器微调支持能力。
微调上下文:
QLoRA
32B 模型
LoRA
8B 模型
全参数微调
1B 模型
AMD RX 7900 XT (20GB) 上的最佳量化精度与运行规格建议。
最佳推理区间
适合在全精度或 Q8 精度下运行 14B 模型,以及在 Q4 精度下搭配最高 32k 上下文运行 32B 模型。
显存带宽与推理速率
具备 800 GB/s 聚合带宽,单批次推理处于显存带宽受限模式。8B Q4 模型预估生成速度约 178 tok/s,70B Q4 模型预估生成速度约 21 tok/s。
Assistant
在线