趋近智
AMD RX 7900 XTX (24GB) 提供 24 GB 显存/内存与 960 GB/s 带宽,支持通过 ROCm 与 Vulkan 加速进行本地推理。
总显存
24 GB
可用显存上限
24 GB
显存带宽
960 GB/s
最大推理模型级别
32B 模型 (Q4)
热设计功耗
355W
随上下文长度增长的显存需求评估。当曲线超过参考线时将导致显存不足(OOM)。
量化精度:
主流开源大模型在 AMD RX 7900 XTX (24GB) 上的推理速度、显存兼容性与生成吞吐表现。
排序:
上下文长度:
KV 缓存:
显卡数量:
| 排名 | 模型 | 参数量 | 量化精度 | 预估 TPS | TTFT | 可运行 |
|---|---|---|---|---|---|---|
#33 | Qwen 3.8 27B | 27B | INT4 | 46 tok/s | ~2.4s | |
#48 | Agnes 3.0 Flash | 33B | INT4 | 39 tok/s | ~2.9s | |
#72 | K2 Horizon MoVA 36B A4B | 36B (4B active) | INT4 | 149 tok/s | ~514 ms | |
#83 | Qwen3.5-27B | 27B | INT4 | 46 tok/s | ~2.4s | |
#92 | Sarvam-30B | 32B (2.4B active) | INT4 | 190 tok/s | ~332 ms | |
#94 | Qwen3.6 35B A3B | 35B (3B active) | INT4 | 167 tok/s | ~420 ms | |
#96 | Muse Glimmer 30B | 30B | INT4 | 42 tok/s | ~2.7s | |
#100 | Phi-4 Reasoning Plus | 14B | INT4 Q8 | 60 tok/s 41 tok/s | ~1.3s ~1.3s | |
#101 | MiMo V2 Flash | 15B (309B active) | INT4 Q8 | 5 tok/s 2 tok/s | ~26.2s ~28.6s | |
#108 | Gemma 4 26B A4B | 25.2B (3.8B active) | INT4 | 165 tok/s | ~434 ms | |
#109 | Gemma 4 12B | 11.95B | INT4 Q8 | 67 tok/s 47 tok/s | ~1.1s ~1.1s | |
#113 | Qwen3.5-9B | 9B | INT4 Q8 FP16 | 110 tok/s 71 tok/s 38 tok/s | ~821 ms ~826 ms ~908 ms | |
#114 | Qwen3.5-35B-A3B | 35B (3B active) | INT4 | 167 tok/s | ~420 ms | |
#118 | K2 Horizon 7B | 7B | INT4 Q8 FP16 | 130 tok/s 86 tok/s 50 tok/s | ~644 ms ~648 ms ~656 ms | |
#128 | NVIDIA Nemotron 3 Nano 30B-A3B | 3.5B (30B active) | INT4 Q8 FP16 | 40 tok/s 24 tok/s 13 tok/s | ~2.6s ~2.6s ~2.6s | |
#129 | Gemma 4 31B | 30.7B | INT4 | 42 tok/s | ~2.7s | |
#131 | Nemotron 3.5 Lightning | 30B (3B active) | INT4 | 78 tok/s | ~418 ms | |
#132 | Qwen3.5-4B | 4B | INT4 Q8 FP16 | 177 tok/s 127 tok/s 78 tok/s | ~380 ms ~382 ms ~387 ms | |
#133 | Qwen3-30B-A3B | 30B (3B active) | INT4 | 177 tok/s | ~379 ms | |
#136 | GPT-OSS 20B | 21B (3.6B active) | INT4 | 90 tok/s | ~411 ms | |
#146 | Granite 4.2 8B | 8B | INT4 Q8 FP16 | 119 tok/s 78 tok/s 44 tok/s | ~731 ms ~736 ms ~746 ms | |
#150 | Gemma 4 E4B | 8B | INT4 Q8 FP16 | 119 tok/s 78 tok/s 44 tok/s | ~731 ms ~736 ms ~746 ms | |
#151 | Nemotron 3.5 Lightning 30B A3B | 30B (3B active) | INT4 | 177 tok/s | ~379 ms | |
#153 | Qwen3-32B | 32B | INT4 | 40 tok/s | ~2.8s | |
#156 | GLM-4 | 32B | INT4 | 28 tok/s | ~3.3s | |
#158 | GLM-4V | 9B | INT4 Q8 FP16 | 83 tok/s 59 tok/s 34 tok/s | ~824 ms ~829 ms ~911 ms | |
#159 | Gemma 3 27B | 27B | INT4 | 46 tok/s | ~2.4s | |
#160 | Phi-4 | 14B | INT4 Q8 | 79 tok/s 49 tok/s | ~1.3s ~1.3s | |
#162 | DeepSeek-R1 32B | 32B | INT4 | 41 tok/s | ~2.8s | |
#164 | Qwen2.5-32B | 32B | INT4 | 40 tok/s | ~2.8s | |
#168 | Magistral Small | 24B | INT4 | 40 tok/s | ~2.1s | |
#169 | OLMo 3 7B Think | 7B | INT4 Q8 FP16 | 98 tok/s 72 tok/s 44 tok/s | ~646 ms ~650 ms ~658 ms | |
#170 | OLMo 3.1 32B Instruct | 32B | INT4 | 28 tok/s | ~3.3s | |
#172 | DeepSeek-R1 14B | 14B | INT4 Q8 | 81 tok/s 50 tok/s | ~1.3s ~1.3s | |
#173 | Ministral 3 14B | 14B | INT4 Q8 | 60 tok/s 41 tok/s | ~1.3s ~1.3s | |
#177 | Gemma 3 12B | 12B | INT4 Q8 FP16 | 89 tok/s 56 tok/s 28 tok/s | ~1.1s ~1.1s ~1.3s | |
#180 | OLMo 3 32B Base | 32B | INT4 | 28 tok/s | ~3.3s | |
#181 | Mistral-Small-2501 | 24B | INT4 | 51 tok/s | ~2.1s | |
#182 | Ministral 3 8B | 8B | INT4 Q8 FP16 | 90 tok/s 65 tok/s 38 tok/s | ~734 ms ~738 ms ~812 ms | |
#183 | Qwen3.5-2B | 2B | INT4 Q8 FP16 | 235 tok/s 187 tok/s 128 tok/s | ~205 ms ~206 ms ~208 ms | |
#184 | MiniCPM5-2B | 2B | INT4 Q8 FP16 | 235 tok/s 187 tok/s 128 tok/s | ~205 ms ~206 ms ~208 ms | |
#185 | Qwen2.5-14B | 14B | INT4 Q8 | 79 tok/s 49 tok/s | ~1.3s ~1.3s | |
#186 | Gemma 2 27B | 27B | INT4 | 46 tok/s | ~2.4s | |
#187 | OLMo 3.1 32B Think | 32B | INT4 | 28 tok/s | ~3.3s | |
#188 | Gemma 4 E2B | 5.1B | INT4 Q8 FP16 | 156 tok/s 108 tok/s 65 tok/s | ~477 ms ~479 ms ~486 ms | |
#189 | Qwen3-4B | 4B | INT4 Q8 FP16 | 177 tok/s 127 tok/s 78 tok/s | ~380 ms ~382 ms ~387 ms | |
#190 | DeepSeek-R1 8B | 8B | INT4 Q8 FP16 | 121 tok/s 79 tok/s 44 tok/s | ~731 ms ~736 ms ~746 ms | |
#193 | Ministral 3 3B | 3B | INT4 Q8 FP16 | 150 tok/s 122 tok/s 84 tok/s | ~294 ms ~295 ms ~299 ms | |
#195 | Qwen3-14B | 14B | INT4 Q8 | 79 tok/s 49 tok/s | ~1.3s ~1.3s | |
#197 | Gemma 2 9B | 9B | INT4 Q8 FP16 | 110 tok/s 71 tok/s 38 tok/s | ~821 ms ~826 ms ~908 ms | |
#198 | Qwen2.5-7B | 7B | INT4 Q8 FP16 | 130 tok/s 86 tok/s 50 tok/s | ~644 ms ~648 ms ~656 ms | |
#199 | Qwen3-8B | 8B | INT4 Q8 FP16 | 119 tok/s 78 tok/s 44 tok/s | ~731 ms ~736 ms ~746 ms | |
#200 | Gemma 3 4B | 4B | INT4 Q8 FP16 | 177 tok/s 127 tok/s 78 tok/s | ~380 ms ~382 ms ~387 ms | |
#201 | DeepSeek-R1 7B | 7B | INT4 Q8 FP16 | 132 tok/s 87 tok/s 50 tok/s | ~644 ms ~647 ms ~656 ms | |
#202 | Llama 3.1 8B | 8B | INT4 Q8 FP16 | 119 tok/s 78 tok/s 44 tok/s | ~731 ms ~736 ms ~746 ms | |
#204 | Qwen3-1.7B | 1.7B | INT4 Q8 FP16 | 248 tok/s 201 tok/s 142 tok/s | ~176 ms ~177 ms ~179 ms | |
#205 | Command R | 35B | INT4 | 26 tok/s | ~3.6s | |
#206 | Gemma 3 270M | 0.27B | INT4 Q8 FP16 | 327 tok/s 313 tok/s 283 tok/s | ~34 ms ~34 ms ~34 ms | |
#208 | Llama 3 8B | 8B | INT4 Q8 FP16 | 119 tok/s 78 tok/s 44 tok/s | ~731 ms ~736 ms ~746 ms | |
#209 | Qwen3-0.6B | 0.6B | INT4 Q8 FP16 | 316 tok/s 286 tok/s 237 tok/s | ~66 ms ~67 ms ~67 ms | |
#210 | Phi-4-Mini | 3.8B | INT4 Q8 FP16 | 182 tok/s 132 tok/s 82 tok/s | ~362 ms ~364 ms ~369 ms | |
#212 | Ministral-8B-2410 | 8B | INT4 Q8 FP16 | 119 tok/s 78 tok/s 44 tok/s | ~731 ms ~736 ms ~746 ms | |
#213 | DeepSeek-R1 1.5B | 1.5B | INT4 Q8 FP16 | 258 tok/s 213 tok/s 153 tok/s | ~157 ms ~157 ms ~159 ms | |
#214 | Llama 3.2 3B | 3B | INT4 Q8 FP16 | 202 tok/s 151 tok/s 97 tok/s | ~292 ms ~294 ms ~297 ms | |
#215 | Qwen3.5-0.8B | 0.8B | INT4 Q8 FP16 | 300 tok/s 265 tok/s 211 tok/s | ~87 ms ~88 ms ~89 ms | |
#216 | Phi-3-mini | 3.8B | INT4 Q8 FP16 | 182 tok/s 132 tok/s 82 tok/s | ~362 ms ~364 ms ~369 ms | |
#217 | Gemma 3n E2B IT | 6B (2B active) | INT4 Q8 FP16 | 150 tok/s 132 tok/s 100 tok/s | ~220 ms ~221 ms ~224 ms | |
#218 | Mistral-7B-Instruct-v0.1 | 7.3B | INT4 Q8 FP16 | 126 tok/s 83 tok/s 48 tok/s | ~670 ms ~674 ms ~683 ms | |
#219 | Llama 3.2 1B | 1B | INT4 Q8 FP16 | 286 tok/s 247 tok/s 190 tok/s | ~109 ms ~110 ms ~111 ms | |
#220 | Gemma 2 2B | 2B | INT4 Q8 FP16 | 235 tok/s 187 tok/s 128 tok/s | ~205 ms ~206 ms ~208 ms | |
#221 | Phi-3-medium | 14B | INT4 Q8 | 79 tok/s 49 tok/s | ~1.3s ~1.3s | |
#222 | OLMo 3 7B Instruct | 7B | INT4 Q8 FP16 | 98 tok/s 72 tok/s 44 tok/s | ~646 ms ~650 ms ~658 ms | |
#223 | Yi-34B | 34B | INT4 | 27 tok/s | ~3.5s | |
#224 | Qwen2-7B | 7B | INT4 Q8 FP16 | 130 tok/s 86 tok/s 50 tok/s | ~644 ms ~648 ms ~656 ms | |
#225 | Phi-3-small | 7B | INT4 Q8 FP16 | 130 tok/s 86 tok/s 50 tok/s | ~644 ms ~648 ms ~656 ms | |
#226 | Gemma 3 1B | 1B | INT4 Q8 FP16 | 286 tok/s 247 tok/s 190 tok/s | ~109 ms ~110 ms ~111 ms | |
#227 | Mistral-7B-Instruct-v0.2 | 7.3B | INT4 Q8 FP16 | 126 tok/s 83 tok/s 48 tok/s | ~670 ms ~674 ms ~683 ms | |
#229 | Gemma 1 7B | 7B | INT4 Q8 FP16 | 98 tok/s 72 tok/s 44 tok/s | ~646 ms ~650 ms ~658 ms | |
#230 | Gemma 1 2B | 2B | INT4 Q8 FP16 | 245 tok/s 192 tok/s 131 tok/s | ~205 ms ~206 ms ~208 ms | |
#231 | ChatGLM3-6B | 6B | INT4 Q8 FP16 | 107 tok/s 80 tok/s 50 tok/s | ~558 ms ~561 ms ~569 ms | |
#232 | ChatGLM2-6B | 6B | INT4 Q8 FP16 | 107 tok/s 80 tok/s 50 tok/s | ~558 ms ~561 ms ~569 ms | |
#233 | ChatGLM-6B | 6B | INT4 Q8 FP16 | 107 tok/s 80 tok/s 50 tok/s | ~558 ms ~561 ms ~569 ms | |
未上榜模型(按推理速度排序) | ||||||
- | Qwen2-0.5B | 0.5B | INT4 Q8 FP16 | 324 tok/s 298 tok/s 252 tok/s | ~56 ms ~56 ms ~57 ms | |
- | Qwen2.5-0.5B | 0.5B | INT4 Q8 FP16 | 324 tok/s 298 tok/s 252 tok/s | ~56 ms ~56 ms ~57 ms | |
- | ERNIE-4.5-0.3B | 0.3B | INT4 Q8 FP16 | 321 tok/s 306 tok/s 275 tok/s | ~37 ms ~37 ms ~37 ms | |
- | ERNIE-4.5-0.3B-Base | 0.3B | INT4 Q8 FP16 | 321 tok/s 306 tok/s 275 tok/s | ~37 ms ~37 ms ~37 ms | |
- | Falcon-1B | 1B | INT4 Q8 FP16 | 294 tok/s 253 tok/s 193 tok/s | ~109 ms ~110 ms ~111 ms | |
- | Falcon3-1B | 1B | INT4 Q8 FP16 | 286 tok/s 247 tok/s 190 tok/s | ~109 ms ~110 ms ~111 ms | |
- | Qwen2-1.5B | 1.5B | INT4 Q8 FP16 | 258 tok/s 213 tok/s 153 tok/s | ~157 ms ~157 ms ~159 ms | |
- | Qwen2.5-1.5B | 1.5B | INT4 Q8 FP16 | 258 tok/s 213 tok/s 153 tok/s | ~157 ms ~157 ms ~159 ms | |
- | Spark X2.5 1.7B | 1.7B | INT4 Q8 FP16 | 248 tok/s 201 tok/s 142 tok/s | ~176 ms ~177 ms ~179 ms | |
- | Hy-MT2 1.8B | 1.8B | INT4 Q8 FP16 | 244 tok/s 196 tok/s 137 tok/s | ~185 ms ~186 ms ~188 ms | |
- | Falcon-3B | 3B | INT4 Q8 FP16 | 210 tok/s 156 tok/s 99 tok/s | ~292 ms ~293 ms ~297 ms | |
- | CroissantLLM Base | 1.3B | INT4 Q8 FP16 | 208 tok/s 184 tok/s 142 tok/s | ~138 ms ~139 ms ~140 ms | |
- | Phi-1 | 1.3B | INT4 Q8 FP16 | 208 tok/s 184 tok/s 142 tok/s | ~138 ms ~139 ms ~140 ms | |
- | Phi-1.5 | 1.3B | INT4 Q8 FP16 | 208 tok/s 184 tok/s 142 tok/s | ~138 ms ~139 ms ~140 ms | |
- | DeepSeek-R1 3B | 3B | INT4 Q8 FP16 | 204 tok/s 152 tok/s 98 tok/s | ~292 ms ~294 ms ~297 ms | |
- | Falcon3-3B | 3B | INT4 Q8 FP16 | 202 tok/s 151 tok/s 97 tok/s | ~292 ms ~294 ms ~297 ms | |
- | Qwen2.5-3B | 3B | INT4 Q8 FP16 | 202 tok/s 151 tok/s 97 tok/s | ~292 ms ~294 ms ~297 ms | |
- | ERNIE-4.5-21B-A3B | 21B (3B active) | INT4 Q8 | 184 tok/s 127 tok/s | ~355 ms ~418 ms | |
- | ERNIE-4.5-21B-A3B-Base | 21B (3B active) | INT4 Q8 | 184 tok/s 127 tok/s | ~355 ms ~418 ms | |
- | ERNIE-4.5-VL-28B-A3B | 28B (3B active) | INT4 | 179 tok/s | ~373 ms | |
- | ERNIE-4.5-VL-28B-A3B-Base | 28B (3B active) | INT4 | 179 tok/s | ~373 ms | |
- | Hy-MT2 30B A3B | 30B (3B active) | INT4 | 177 tok/s | ~379 ms | |
- | Spark X2.5 4B | 4B | INT4 Q8 FP16 | 177 tok/s 127 tok/s 78 tok/s | ~380 ms ~382 ms ~387 ms | |
- | Phi-2 | 2.7B | INT4 Q8 FP16 | 156 tok/s 129 tok/s 90 tok/s | ~267 ms ~269 ms ~272 ms | |
- | MaLLaM-3B | 3B | INT4 Q8 FP16 | 150 tok/s 122 tok/s 84 tok/s | ~294 ms ~295 ms ~299 ms | |
- | SmolLM3 3B | 3B | INT4 Q8 FP16 | 150 tok/s 122 tok/s 84 tok/s | ~294 ms ~295 ms ~299 ms | |
- | Falcon-7B | 7B | INT4 Q8 FP16 | 134 tok/s 88 tok/s 50 tok/s | ~643 ms ~647 ms ~656 ms | |
- | Falcon3-7B | 7B | INT4 Q8 FP16 | 130 tok/s 86 tok/s 50 tok/s | ~644 ms ~648 ms ~656 ms | |
- | Hy-MT2 7B | 7B | INT4 Q8 FP16 | 130 tok/s 86 tok/s 50 tok/s | ~644 ms ~648 ms ~656 ms | |
- | Mistral-7B-v0.1 | 7.3B | INT4 Q8 FP16 | 126 tok/s 83 tok/s 48 tok/s | ~670 ms ~674 ms ~683 ms | |
- | LensVLM 9B | 9B | INT4 Q8 FP16 | 110 tok/s 71 tok/s 38 tok/s | ~821 ms ~826 ms ~908 ms | |
- | MiMo V2.6 Distill Qwen 9B | 9B | INT4 Q8 FP16 | 110 tok/s 71 tok/s 38 tok/s | ~821 ms ~826 ms ~908 ms | |
- | ChatGLM3-6B-32K | 6B | INT4 Q8 FP16 | 107 tok/s 80 tok/s 50 tok/s | ~558 ms ~561 ms ~569 ms | |
- | Yi-6B | 6B | INT4 Q8 FP16 | 107 tok/s 80 tok/s 50 tok/s | ~558 ms ~561 ms ~569 ms | |
- | Falcon3-10B | 10B | INT4 Q8 FP16 | 102 tok/s 65 tok/s 34 tok/s | ~909 ms ~914 ms ~1.0s | |
- | Kimi-VL-A3B-Instruct | 16B (3B active) | INT4 Q8 | 102 tok/s 86 tok/s | ~346 ms ~376 ms | |
- | Falcon2-11B | 11B | INT4 Q8 FP16 | 99 tok/s 61 tok/s 30 tok/s | ~997 ms ~1.0s ~1.2s | |
- | Hunyuan Lite | 7B | INT4 Q8 FP16 | 98 tok/s 72 tok/s 44 tok/s | ~646 ms ~650 ms ~658 ms | |
- | OLMo 3 7B Base | 7B | INT4 Q8 FP16 | 98 tok/s 72 tok/s 44 tok/s | ~646 ms ~650 ms ~658 ms | |
- | SEA-LION-7B | 7.1B | INT4 Q8 FP16 | 97 tok/s 71 tok/s 44 tok/s | ~655 ms ~659 ms ~667 ms | |
- | SEA-LION-7B-Instruct | 7.1B | INT4 Q8 FP16 | 97 tok/s 71 tok/s 44 tok/s | ~655 ms ~659 ms ~667 ms | |
- | Sahabat-AI-Llama3-8B-Instruct | 8B | INT4 Q8 FP16 | 90 tok/s 65 tok/s 38 tok/s | ~734 ms ~738 ms ~812 ms | |
- | Typhoon-2-8B | 8B | INT4 Q8 FP16 | 90 tok/s 65 tok/s 38 tok/s | ~734 ms ~738 ms ~812 ms | |
- | GLM-4-9B | 9B | INT4 Q8 FP16 | 83 tok/s 59 tok/s 34 tok/s | ~824 ms ~829 ms ~911 ms | |
- | GLM-4-9B-Chat | 9B | INT4 Q8 FP16 | 83 tok/s 59 tok/s 34 tok/s | ~824 ms ~829 ms ~911 ms | |
- | GLM-4-9B-Chat-1M | 9B | INT4 Q8 FP16 | 83 tok/s 59 tok/s 34 tok/s | ~824 ms ~829 ms ~911 ms | |
- | Yi-9B | 9B | INT4 Q8 FP16 | 83 tok/s 59 tok/s 34 tok/s | ~824 ms ~829 ms ~911 ms | |
- | Sahabat-AI-Gemma2-9B | 9.2B | INT4 Q8 FP16 | 82 tok/s 58 tok/s 33 tok/s | ~841 ms ~846 ms ~930 ms | |
- | Sahabat-AI-Gemma2-9B-Instruct | 9.2B | INT4 Q8 FP16 | 82 tok/s 58 tok/s 33 tok/s | ~841 ms ~846 ms ~930 ms | |
- | GreenMind-14B-R1 | 14B | INT4 Q8 | 60 tok/s 41 tok/s | ~1.3s ~1.3s | |
- | Falcon-40B | 40B | INT4 | 32 tok/s | ~3.8s | |
不同量化精度下可运行的最大模型参数级别。
上下文长度:
4位量化
32B 模型
8位精度
14B 模型
16位全精度
8B 模型
本地模型训练与适配器微调支持能力。
微调上下文:
QLoRA
32B 模型
LoRA
14B 模型
全参数微调
3B 模型
AMD RX 7900 XTX (24GB) 上的最佳量化精度与运行规格建议。
最佳推理区间
适合在全精度或 Q8 精度下运行 14B 模型,以及在 Q4 精度下搭配最高 32k 上下文运行 32B 模型。
显存带宽与推理速率
具备 960 GB/s 聚合带宽,单批次推理处于显存带宽受限模式。8B Q4 模型预估生成速度约 213 tok/s,70B Q4 模型预估生成速度约 25 tok/s。
Assistant
在线