趋近智
Radeon AI PRO R9700 (32GB) 提供 32 GB 显存/内存与 643 GB/s 带宽,支持通过 ROCm 与 Vulkan 加速进行本地推理。
总显存
32 GB
可用显存上限
32 GB
显存带宽
643.2 GB/s
最大推理模型级别
32B 模型 (Q4)
热设计功耗
300W
随上下文长度增长的显存需求评估。当曲线超过参考线时将导致显存不足(OOM)。
量化精度:
主流开源大模型在 Radeon AI PRO R9700 (32GB) 上的推理速度、显存兼容性与生成吞吐表现。
排序:
上下文长度:
KV 缓存:
显卡数量:
| 排名 | 模型 | 参数量 | 量化精度 | 预估 TPS | TTFT | 可运行 |
|---|---|---|---|---|---|---|
#32 | Qwen 3.8 27B | 27B | INT4 Q8 | 32 tok/s 18 tok/s | ~1.6s ~1.7s | |
#74 | K2 Horizon MoVA 36B A4B | 36B (4B active) | INT4 | 122 tok/s | ~313 ms | |
#82 | Qwen3.5-27B | 27B | INT4 Q8 | 32 tok/s 18 tok/s | ~1.6s ~1.7s | |
#88 | Sarvam-30B | 32B (2.4B active) | INT4 | 153 tok/s | ~220 ms | |
#95 | Muse Glimmer 30B | 30B | INT4 Q8 | 29 tok/s 15 tok/s | ~1.7s ~2.1s | |
#96 | Phi-4 Reasoning Plus | 14B | INT4 Q8 FP16 | 42 tok/s 29 tok/s 15 tok/s | ~838 ms ~849 ms ~1.0s | |
#97 | MiMo V2 Flash | 15B (309B active) | INT4 Q8 | 3 tok/s 2 tok/s | ~17.2s ~17.4s | |
#108 | Qwen3.6 35B A3B | 35B (3B active) | INT4 | 139 tok/s | ~256 ms | |
#110 | Gemma 4 12B | 11.95B | INT4 Q8 FP16 | 48 tok/s 33 tok/s 18 tok/s | ~718 ms ~728 ms ~812 ms | |
#112 | Qwen3.5-35B-A3B | 35B (3B active) | INT4 | 139 tok/s | ~256 ms | |
#116 | Gemma 4 26B A4B | 25.2B (3.8B active) | INT4 Q8 | 129 tok/s 88 tok/s | ~287 ms ~315 ms | |
#118 | K2 Horizon 7B | 7B | INT4 Q8 FP16 | 98 tok/s 63 tok/s 35 tok/s | ~425 ms ~431 ms ~443 ms | |
#130 | Nemotron 3.5 Lightning | 30B (3B active) | INT4 | 59 tok/s | ~261 ms | |
#132 | Qwen3.5-4B | 4B | INT4 Q8 FP16 | 141 tok/s 96 tok/s 56 tok/s | ~252 ms ~255 ms ~262 ms | |
#133 | Qwen3.5-9B | 9B | INT4 Q8 FP16 | 81 tok/s 51 tok/s 28 tok/s | ~541 ms ~549 ms ~565 ms | |
#136 | GPT-OSS 20B | 21B (3.6B active) | INT4 Q8 | 66 tok/s 54 tok/s | ~277 ms ~302 ms | |
#137 | Gemma 4 31B | 30.7B | INT4 Q8 | 29 tok/s 15 tok/s | ~1.8s ~2.1s | |
#141 | NVIDIA Nemotron 3 Nano 30B-A3B | 3.5B (30B active) | INT4 Q8 FP16 | 28 tok/s 17 tok/s 9 tok/s | ~1.7s ~1.7s ~1.8s | |
#143 | Qwen3-30B-A3B | 30B (3B active) | INT4 Q8 | 141 tok/s 95 tok/s | ~251 ms ~297 ms | |
#149 | Granite 4.2 8B | 8B | INT4 Q8 FP16 | 89 tok/s 56 tok/s 31 tok/s | ~482 ms ~489 ms ~504 ms | |
#153 | Nemotron 3.5 Lightning 30B A3B | 30B (3B active) | INT4 Q8 | 141 tok/s 95 tok/s | ~251 ms ~297 ms | |
#155 | Gemma 4 E4B | 8B | INT4 Q8 FP16 | 89 tok/s 56 tok/s 31 tok/s | ~482 ms ~489 ms ~504 ms | |
#156 | Mistral Large 3 | 41B (675B active) | INT4 | 1 tok/s | ~44.0s | |
#158 | GLM-4 | 32B | INT4 | 22 tok/s | ~1.9s | |
#159 | Gemma 3 27B | 27B | INT4 Q8 | 32 tok/s 18 tok/s | ~1.6s ~1.7s | |
#161 | Phi-4 | 14B | INT4 Q8 FP16 | 57 tok/s 34 tok/s 17 tok/s | ~832 ms ~843 ms ~942 ms | |
#163 | GLM-4V | 9B | INT4 Q8 FP16 | 60 tok/s 42 tok/s 25 tok/s | ~546 ms ~553 ms ~569 ms | |
#164 | Qwen3-32B | 32B | INT4 | 28 tok/s | ~1.9s | |
#166 | Qwen2.5-32B | 32B | INT4 | 28 tok/s | ~1.9s | |
#169 | DeepSeek-R1 32B | 32B | INT4 Q8 | 29 tok/s 15 tok/s | ~1.9s ~2.2s | |
#170 | Magistral Small | 24B | INT4 Q8 | 27 tok/s 17 tok/s | ~1.4s ~1.6s | |
#173 | Ministral 3 14B | 14B | INT4 Q8 FP16 | 42 tok/s 29 tok/s 15 tok/s | ~838 ms ~849 ms ~1.0s | |
#174 | OLMo 3.1 32B Instruct | 32B | INT4 | 22 tok/s | ~1.9s | |
#176 | DeepSeek-R1 14B | 14B | INT4 Q8 FP16 | 59 tok/s 35 tok/s 18 tok/s | ~831 ms ~843 ms ~941 ms | |
#177 | Gemma 3 12B | 12B | INT4 Q8 FP16 | 65 tok/s 39 tok/s 21 tok/s | ~716 ms ~726 ms ~748 ms | |
#182 | Mistral-Small-2501 | 24B | INT4 Q8 | 36 tok/s 20 tok/s | ~1.4s ~1.5s | |
#183 | Ministral 3 8B | 8B | INT4 Q8 FP16 | 66 tok/s 46 tok/s 28 tok/s | ~486 ms ~493 ms ~507 ms | |
#184 | Qwen3.5-2B | 2B | INT4 Q8 FP16 | 199 tok/s 150 tok/s 97 tok/s | ~137 ms ~139 ms ~142 ms | |
#185 | Qwen2.5-14B | 14B | INT4 Q8 FP16 | 57 tok/s 34 tok/s 17 tok/s | ~832 ms ~843 ms ~942 ms | |
#186 | MiniCPM5-2B | 2B | INT4 Q8 FP16 | 199 tok/s 150 tok/s 97 tok/s | ~137 ms ~139 ms ~142 ms | |
#187 | Gemma 2 27B | 27B | INT4 Q8 | 32 tok/s 18 tok/s | ~1.6s ~1.7s | |
#188 | OLMo 3 7B Think | 7B | INT4 Q8 FP16 | 72 tok/s 51 tok/s 31 tok/s | ~429 ms ~434 ms ~447 ms | |
#189 | OLMo 3.1 32B Think | 32B | INT4 | 22 tok/s | ~1.9s | |
#190 | Gemma 4 E2B | 5.1B | INT4 Q8 FP16 | 122 tok/s 80 tok/s 46 tok/s | ~315 ms ~319 ms ~329 ms | |
#192 | Ministral 3 3B | 3B | INT4 Q8 FP16 | 116 tok/s 92 tok/s 61 tok/s | ~197 ms ~199 ms ~204 ms | |
#194 | DeepSeek-R1 8B | 8B | INT4 Q8 FP16 | 91 tok/s 57 tok/s 31 tok/s | ~482 ms ~489 ms ~504 ms | |
#195 | Gemma 2 9B | 9B | INT4 Q8 FP16 | 81 tok/s 51 tok/s 28 tok/s | ~541 ms ~549 ms ~565 ms | |
#197 | Gemma 3 4B | 4B | INT4 Q8 FP16 | 141 tok/s 96 tok/s 56 tok/s | ~252 ms ~255 ms ~262 ms | |
#198 | Qwen2.5-7B | 7B | INT4 Q8 FP16 | 98 tok/s 63 tok/s 35 tok/s | ~425 ms ~431 ms ~443 ms | |
#199 | DeepSeek-R1 7B | 7B | INT4 Q8 FP16 | 100 tok/s 63 tok/s 35 tok/s | ~425 ms ~430 ms ~443 ms | |
#199 | Qwen3-14B | 14B | INT4 Q8 FP16 | 57 tok/s 34 tok/s 17 tok/s | ~832 ms ~843 ms ~942 ms | |
#201 | Kimi Linear 48B A3B Instruct | 48B (3B active) | INT4 | 46 tok/s | ~331 ms | |
#202 | Qwen3-8B | 8B | INT4 Q8 FP16 | 89 tok/s 56 tok/s 31 tok/s | ~482 ms ~489 ms ~504 ms | |
#203 | Llama 3.1 8B | 8B | INT4 Q8 FP16 | 89 tok/s 56 tok/s 31 tok/s | ~482 ms ~489 ms ~504 ms | |
#204 | Qwen3-4B | 4B | INT4 Q8 FP16 | 141 tok/s 96 tok/s 56 tok/s | ~252 ms ~255 ms ~262 ms | |
#205 | OLMo 3 32B Base | 32B | INT4 | 22 tok/s | ~1.9s | |
#207 | Command R | 35B | INT4 | 20 tok/s | ~2.0s | |
#209 | Llama 3 8B | 8B | INT4 Q8 FP16 | 89 tok/s 56 tok/s 31 tok/s | ~482 ms ~489 ms ~504 ms | |
#210 | Phi-4-Mini | 3.8B | INT4 Q8 FP16 | 145 tok/s 100 tok/s 59 tok/s | ~240 ms ~243 ms ~250 ms | |
#211 | Gemma 3 270M | 0.27B | INT4 Q8 FP16 | 309 tok/s 290 tok/s 254 tok/s | ~25 ms ~25 ms ~25 ms | |
#212 | Qwen3-1.7B | 1.7B | INT4 Q8 FP16 | 214 tok/s 164 tok/s 109 tok/s | ~118 ms ~120 ms ~123 ms | |
#213 | Qwen3-0.6B | 0.6B | INT4 Q8 FP16 | 295 tok/s 258 tok/s 201 tok/s | ~46 ms ~47 ms ~48 ms | |
#214 | Ministral-8B-2410 | 8B | INT4 Q8 FP16 | 89 tok/s 56 tok/s 31 tok/s | ~482 ms ~489 ms ~504 ms | |
#215 | Mixtral-8x7B-v0.1 | 46.7B (7B active) | INT4 | 83 tok/s | ~533 ms | |
#216 | DeepSeek-R1 1.5B | 1.5B | INT4 Q8 FP16 | 225 tok/s 176 tok/s 119 tok/s | ~105 ms ~107 ms ~109 ms | |
#217 | Llama 3.2 3B | 3B | INT4 Q8 FP16 | 165 tok/s 117 tok/s 71 tok/s | ~194 ms ~197 ms ~202 ms | |
#218 | Phi-3-mini | 3.8B | INT4 Q8 FP16 | 145 tok/s 100 tok/s 59 tok/s | ~240 ms ~243 ms ~250 ms | |
#219 | Qwen3.5-0.8B | 0.8B | INT4 Q8 FP16 | 275 tok/s 233 tok/s 174 tok/s | ~60 ms ~61 ms ~62 ms | |
#220 | Gemma 3n E2B IT | 6B (2B active) | INT4 Q8 FP16 | 116 tok/s 100 tok/s 73 tok/s | ~149 ms ~150 ms ~154 ms | |
#221 | Gemma 2 2B | 2B | INT4 Q8 FP16 | 199 tok/s 150 tok/s 97 tok/s | ~137 ms ~139 ms ~142 ms | |
#222 | Phi-3-medium | 14B | INT4 Q8 FP16 | 57 tok/s 34 tok/s 17 tok/s | ~832 ms ~843 ms ~942 ms | |
#223 | Mistral-7B-Instruct-v0.1 | 7.3B | INT4 Q8 FP16 | 95 tok/s 60 tok/s 33 tok/s | ~442 ms ~448 ms ~461 ms | |
#224 | Llama 3.2 1B | 1B | INT4 Q8 FP16 | 257 tok/s 212 tok/s 153 tok/s | ~74 ms ~75 ms ~77 ms | |
#225 | Yi-34B | 34B | INT4 | 21 tok/s | ~2.0s | |
#226 | OLMo 3 7B Instruct | 7B | INT4 Q8 FP16 | 72 tok/s 51 tok/s 31 tok/s | ~429 ms ~434 ms ~447 ms | |
#227 | Qwen2-7B | 7B | INT4 Q8 FP16 | 98 tok/s 63 tok/s 35 tok/s | ~425 ms ~431 ms ~443 ms | |
#228 | Phi-3-small | 7B | INT4 Q8 FP16 | 98 tok/s 63 tok/s 35 tok/s | ~425 ms ~431 ms ~443 ms | |
#229 | Gemma 3 1B | 1B | INT4 Q8 FP16 | 257 tok/s 212 tok/s 153 tok/s | ~74 ms ~75 ms ~77 ms | |
#230 | Mistral-7B-Instruct-v0.2 | 7.3B | INT4 Q8 FP16 | 95 tok/s 60 tok/s 33 tok/s | ~442 ms ~448 ms ~461 ms | |
#232 | Gemma 1 7B | 7B | INT4 Q8 FP16 | 72 tok/s 51 tok/s 31 tok/s | ~429 ms ~434 ms ~447 ms | |
#233 | Gemma 1 2B | 2B | INT4 Q8 FP16 | 210 tok/s 155 tok/s 99 tok/s | ~137 ms ~138 ms ~142 ms | |
#234 | ChatGLM3-6B | 6B | INT4 Q8 FP16 | 79 tok/s 58 tok/s 35 tok/s | ~371 ms ~375 ms ~386 ms | |
#235 | ChatGLM2-6B | 6B | INT4 Q8 FP16 | 79 tok/s 58 tok/s 35 tok/s | ~371 ms ~375 ms ~386 ms | |
#236 | ChatGLM-6B | 6B | INT4 Q8 FP16 | 79 tok/s 58 tok/s 35 tok/s | ~371 ms ~375 ms ~386 ms | |
未上榜模型(按推理速度排序) | ||||||
- | Qwen2-0.5B | 0.5B | INT4 Q8 FP16 | 306 tok/s 272 tok/s 218 tok/s | ~39 ms ~40 ms ~41 ms | |
- | Qwen2.5-0.5B | 0.5B | INT4 Q8 FP16 | 306 tok/s 272 tok/s 218 tok/s | ~39 ms ~40 ms ~41 ms | |
- | ERNIE-4.5-0.3B | 0.3B | INT4 Q8 FP16 | 302 tok/s 282 tok/s 245 tok/s | ~27 ms ~27 ms ~28 ms | |
- | ERNIE-4.5-0.3B-Base | 0.3B | INT4 Q8 FP16 | 302 tok/s 282 tok/s 245 tok/s | ~27 ms ~27 ms ~28 ms | |
- | Liquid D1-Omni 600M | 0.6B | INT4 Q8 FP16 | 295 tok/s 258 tok/s 201 tok/s | ~46 ms ~47 ms ~48 ms | |
- | Falcon-1B | 1B | INT4 Q8 FP16 | 267 tok/s 219 tok/s 156 tok/s | ~74 ms ~75 ms ~77 ms | |
- | Falcon3-1B | 1B | INT4 Q8 FP16 | 257 tok/s 212 tok/s 153 tok/s | ~74 ms ~75 ms ~77 ms | |
- | Qwen2-1.5B | 1.5B | INT4 Q8 FP16 | 225 tok/s 176 tok/s 119 tok/s | ~105 ms ~107 ms ~109 ms | |
- | Qwen2.5-1.5B | 1.5B | INT4 Q8 FP16 | 225 tok/s 176 tok/s 119 tok/s | ~105 ms ~107 ms ~109 ms | |
- | Spark X2.5 1.7B | 1.7B | INT4 Q8 FP16 | 214 tok/s 164 tok/s 109 tok/s | ~118 ms ~120 ms ~123 ms | |
- | Hy-MT2 1.8B | 1.8B | INT4 Q8 FP16 | 209 tok/s 160 tok/s 105 tok/s | ~124 ms ~125 ms ~129 ms | |
- | Falcon-3B | 3B | INT4 Q8 FP16 | 173 tok/s 121 tok/s 73 tok/s | ~194 ms ~196 ms ~202 ms | |
- | CroissantLLM Base | 1.3B | INT4 Q8 FP16 | 171 tok/s 147 tok/s 109 tok/s | ~94 ms ~95 ms ~98 ms | |
- | Phi-1 | 1.3B | INT4 Q8 FP16 | 171 tok/s 147 tok/s 109 tok/s | ~94 ms ~95 ms ~98 ms | |
- | Phi-1.5 | 1.3B | INT4 Q8 FP16 | 171 tok/s 147 tok/s 109 tok/s | ~94 ms ~95 ms ~98 ms | |
- | DeepSeek-R1 3B | 3B | INT4 Q8 FP16 | 167 tok/s 118 tok/s 72 tok/s | ~194 ms ~197 ms ~202 ms | |
- | Mellum 2.1 12B A2.5B Thinking | 12B (2.5B active) | INT4 Q8 FP16 | 167 tok/s 125 tok/s 80 tok/s | ~190 ms ~192 ms ~196 ms | |
- | Falcon3-3B | 3B | INT4 Q8 FP16 | 165 tok/s 117 tok/s 71 tok/s | ~194 ms ~197 ms ~202 ms | |
- | LFM2-VL 3B | 3B | INT4 Q8 FP16 | 165 tok/s 117 tok/s 71 tok/s | ~194 ms ~197 ms ~202 ms | |
- | Liquid LFM2-VL 3B D1 | 3B | INT4 Q8 FP16 | 165 tok/s 117 tok/s 71 tok/s | ~194 ms ~197 ms ~202 ms | |
- | Qwen2.5-3B | 3B | INT4 Q8 FP16 | 165 tok/s 117 tok/s 71 tok/s | ~194 ms ~197 ms ~202 ms | |
- | ERNIE-4.5-21B-A3B | 21B (3B active) | INT4 Q8 | 147 tok/s 108 tok/s | ~236 ms ~238 ms | |
- | ERNIE-4.5-21B-A3B-Base | 21B (3B active) | INT4 Q8 | 147 tok/s 108 tok/s | ~236 ms ~238 ms | |
- | ERNIE-4.5-VL-28B-A3B | 28B (3B active) | INT4 Q8 | 143 tok/s 101 tok/s | ~247 ms ~271 ms | |
- | ERNIE-4.5-VL-28B-A3B-Base | 28B (3B active) | INT4 Q8 | 143 tok/s 101 tok/s | ~247 ms ~271 ms | |
- | FrogNano 4B | 4B | INT4 Q8 FP16 | 141 tok/s 96 tok/s 56 tok/s | ~252 ms ~255 ms ~262 ms | |
- | Hy-MT2 30B A3B | 30B (3B active) | INT4 Q8 | 141 tok/s 95 tok/s | ~251 ms ~297 ms | |
- | Spark X2.5 4B | 4B | INT4 Q8 FP16 | 141 tok/s 96 tok/s 56 tok/s | ~252 ms ~255 ms ~262 ms | |
- | EmbeddingGemma 2 | 2B | INT4 Q8 FP16 | 136 tok/s 113 tok/s 80 tok/s | ~139 ms ~141 ms ~144 ms | |
- | Phi-2 | 2.7B | INT4 Q8 FP16 | 121 tok/s 97 tok/s 66 tok/s | ~179 ms ~182 ms ~186 ms | |
- | MaLLaM-3B | 3B | INT4 Q8 FP16 | 116 tok/s 92 tok/s 61 tok/s | ~197 ms ~199 ms ~204 ms | |
- | SmolLM3 3B | 3B | INT4 Q8 FP16 | 116 tok/s 92 tok/s 61 tok/s | ~197 ms ~199 ms ~204 ms | |
- | Falcon-7B | 7B | INT4 Q8 FP16 | 102 tok/s 64 tok/s 35 tok/s | ~424 ms ~430 ms ~443 ms | |
- | Falcon3-7B | 7B | INT4 Q8 FP16 | 98 tok/s 63 tok/s 35 tok/s | ~425 ms ~431 ms ~443 ms | |
- | Hy-MT2 7B | 7B | INT4 Q8 FP16 | 98 tok/s 63 tok/s 35 tok/s | ~425 ms ~431 ms ~443 ms | |
- | Mistral-7B-v0.1 | 7.3B | INT4 Q8 FP16 | 95 tok/s 60 tok/s 33 tok/s | ~442 ms ~448 ms ~461 ms | |
- | LensVLM 9B | 9B | INT4 Q8 FP16 | 81 tok/s 51 tok/s 28 tok/s | ~541 ms ~549 ms ~565 ms | |
- | MiMo V2.6 Distill Qwen 9B | 9B | INT4 Q8 FP16 | 81 tok/s 51 tok/s 28 tok/s | ~541 ms ~549 ms ~565 ms | |
- | ChatGLM3-6B-32K | 6B | INT4 Q8 FP16 | 79 tok/s 58 tok/s 35 tok/s | ~371 ms ~375 ms ~386 ms | |
- | Yi-6B | 6B | INT4 Q8 FP16 | 79 tok/s 58 tok/s 35 tok/s | ~371 ms ~375 ms ~386 ms | |
- | Falcon3-10B | 10B | INT4 Q8 FP16 | 75 tok/s 46 tok/s 25 tok/s | ~599 ms ~607 ms ~625 ms | |
- | Kimi-VL-A3B-Instruct | 16B (3B active) | INT4 Q8 | 75 tok/s 66 tok/s | ~233 ms ~235 ms | |
- | Falcon2-11B | 11B | INT4 Q8 FP16 | 72 tok/s 44 tok/s 23 tok/s | ~656 ms ~665 ms ~685 ms | |
- | Hunyuan Lite | 7B | INT4 Q8 FP16 | 72 tok/s 51 tok/s 31 tok/s | ~429 ms ~434 ms ~447 ms | |
- | OLMo 3 7B Base | 7B | INT4 Q8 FP16 | 72 tok/s 51 tok/s 31 tok/s | ~429 ms ~434 ms ~447 ms | |
- | SEA-LION-7B | 7.1B | INT4 Q8 FP16 | 71 tok/s 51 tok/s 31 tok/s | ~434 ms ~440 ms ~453 ms | |
- | SEA-LION-7B-Instruct | 7.1B | INT4 Q8 FP16 | 71 tok/s 51 tok/s 31 tok/s | ~434 ms ~440 ms ~453 ms | |
- | Sahabat-AI-Llama3-8B-Instruct | 8B | INT4 Q8 FP16 | 66 tok/s 46 tok/s 28 tok/s | ~486 ms ~493 ms ~507 ms | |
- | Typhoon-2-8B | 8B | INT4 Q8 FP16 | 66 tok/s 46 tok/s 28 tok/s | ~486 ms ~493 ms ~507 ms | |
- | GLM-4-9B | 9B | INT4 Q8 FP16 | 60 tok/s 42 tok/s 25 tok/s | ~546 ms ~553 ms ~569 ms | |
- | GLM-4-9B-Chat | 9B | INT4 Q8 FP16 | 60 tok/s 42 tok/s 25 tok/s | ~546 ms ~553 ms ~569 ms | |
- | GLM-4-9B-Chat-1M | 9B | INT4 Q8 FP16 | 60 tok/s 42 tok/s 25 tok/s | ~546 ms ~553 ms ~569 ms | |
- | Yi-9B | 9B | INT4 Q8 FP16 | 60 tok/s 42 tok/s 25 tok/s | ~546 ms ~553 ms ~569 ms | |
- | Sahabat-AI-Gemma2-9B | 9.2B | INT4 Q8 FP16 | 59 tok/s 41 tok/s 24 tok/s | ~557 ms ~564 ms ~581 ms | |
- | Sahabat-AI-Gemma2-9B-Instruct | 9.2B | INT4 Q8 FP16 | 59 tok/s 41 tok/s 24 tok/s | ~557 ms ~564 ms ~581 ms | |
- | GreenMind-14B-R1 | 14B | INT4 Q8 FP16 | 42 tok/s 29 tok/s 15 tok/s | ~838 ms ~849 ms ~1.0s | |
- | AREX-2 | 27B | INT4 Q8 | 32 tok/s 18 tok/s | ~1.6s ~1.7s | |
- | PPLX Decider v1 27B | 27B | INT4 Q8 | 32 tok/s 18 tok/s | ~1.6s ~1.7s | |
- | PPLX Decider v1.1 27B | 27B | INT4 Q8 | 32 tok/s 18 tok/s | ~1.6s ~1.7s | |
- | Agnes 3.0 Flash | 33B | INT4 | 27 tok/s | ~1.9s | |
- | Falcon-40B | 40B | INT4 | 23 tok/s | ~2.3s | |
不同量化精度下可运行的最大模型参数级别。
上下文长度:
4位量化
32B 模型
8位精度
14B 模型
16位全精度
14B 模型
本地模型训练与适配器微调支持能力。
微调上下文:
QLoRA
32B 模型
LoRA
14B 模型
全参数微调
3B 模型
Radeon AI PRO R9700 (32GB) 上的最佳量化精度与运行规格建议。
最佳推理区间
适合在全精度或 Q8 精度下运行 14B 模型,以及在 Q4 精度下搭配最高 32k 上下文运行 32B 模型。
显存带宽与推理速率
具备 643.2 GB/s 聚合带宽,单批次推理处于显存带宽受限模式。8B Q4 模型预估生成速度约 143 tok/s,70B Q4 模型预估生成速度约 17 tok/s。
Assistant
在线