趋近智
Instinct MI350X (288GB) 提供 288 GB 显存/内存与 8000 GB/s 带宽,支持通过 ROCm 与 Vulkan 加速进行本地推理。
总显存
288 GB
可用显存上限
288 GB
显存带宽
8000 GB/s
最大推理模型级别
70B+ 模型 (Q4)
热设计功耗
1000W
随上下文长度增长的显存需求评估。当曲线超过参考线时将导致显存不足(OOM)。
量化精度:
主流开源大模型在 Instinct MI350X (288GB) 上的推理速度、显存兼容性与生成吞吐表现。
排序:
上下文长度:
KV 缓存:
显卡数量:
| 排名 | 模型 | 参数量 | 量化精度 | 预估 TPS | TTFT | 可运行 |
|---|---|---|---|---|---|---|
#13 | DeepSeek V4.1 Flash | 552B (16B active) | INT4 | 314 tok/s | ~164 ms | |
#31 | DeepSeek-V4-Flash-Vision-Exp | 290.9B (20.4B active) | INT4 Q8 | 308 tok/s 191 tok/s | ~100 ms ~118 ms | |
#32 | Qwen 3.8 27B | 27B | INT4 Q8 FP16 | 256 tok/s 172 tok/s 100 tok/s | ~136 ms ~138 ms ~142 ms | |
#36 | DeepSeek-V4-Flash | 284B (13B active) | INT4 Q8 | 382 tok/s 254 tok/s | ~65 ms ~77 ms | |
#37 | MiMo-V2.6-Flash | 309B | INT4 | 35 tok/s | ~1.5s | |
#45 | Qwen 3.8 Flash | 176B (6B active) | INT4 Q8 | 495 tok/s 408 tok/s | ~32 ms ~32 ms | |
#46 | K2 Horizon 375B A23B | 375B (23B active) | INT4 | 232 tok/s | ~157 ms | |
#51 | GLM-4.5 | 355B (32B active) | INT4 | 93 tok/s | ~204 ms | |
#59 | Sarvam-105B | 106B (10.3B active) | INT4 Q8 FP16 | 408 tok/s 315 tok/s 209 tok/s | ~71 ms ~71 ms ~73 ms | |
#68 | GLM-4.7 | 358B (32B active) | INT4 | 92 tok/s | ~204 ms | |
#71 | Qwen3.5-397B-A17B | 397B (17B active) | INT4 | 261 tok/s | ~131 ms | |
#74 | K2 Horizon MoVA 36B A4B | 36B (4B active) | INT4 Q8 FP16 | 508 tok/s 445 tok/s 348 tok/s | ~29 ms ~30 ms ~30 ms | |
#76 | Ling 3.0 Flash VL | 124B (5.5B active) | INT4 Q8 FP16 | 489 tok/s 411 tok/s 289 tok/s | ~51 ms ~51 ms ~57 ms | |
#80 | GLM-5.3 Flash | 313.3B (17.3B active) | INT4 | 335 tok/s | ~85 ms | |
#82 | Qwen3.5-27B | 27B | INT4 Q8 FP16 | 256 tok/s 172 tok/s 100 tok/s | ~136 ms ~138 ms ~142 ms | |
#88 | Sarvam-30B | 32B (2.4B active) | INT4 Q8 FP16 | 547 tok/s 503 tok/s 423 tok/s | ~21 ms ~22 ms ~22 ms | |
#95 | Muse Glimmer 30B | 30B | INT4 Q8 FP16 | 240 tok/s 159 tok/s 91 tok/s | ~151 ms ~153 ms ~157 ms | |
#96 | Phi-4 Reasoning Plus | 14B | INT4 Q8 FP16 | 304 tok/s 236 tok/s 156 tok/s | ~74 ms ~75 ms ~77 ms | |
#97 | MiMo V2 Flash | 15B (309B active) | INT4 Q8 FP16 | 35 tok/s 20 tok/s 10 tok/s | ~1.5s ~1.5s ~1.5s | |
#102 | Inkling-Small | 276B (12B active) | INT4 | 128 tok/s | ~100 ms | |
#104 | Qwen3.5-122B-A10B | 122B (10B active) | INT4 Q8 FP16 | 362 tok/s 291 tok/s 190 tok/s | ~73 ms ~73 ms ~81 ms | |
#105 | GLM-4.5-Air | 106B (12B active) | INT4 Q8 FP16 | 186 tok/s 167 tok/s 127 tok/s | ~82 ms ~82 ms ~84 ms | |
#107 | GLM-4.6 | 357B (32B active) | INT4 | 93 tok/s | ~204 ms | |
#108 | Qwen3.6 35B A3B | 35B (3B active) | INT4 Q8 FP16 | 531 tok/s 479 tok/s 391 tok/s | ~24 ms ~25 ms ~25 ms | |
#110 | Gemma 4 12B | 11.95B | INT4 Q8 FP16 | 328 tok/s 259 tok/s 175 tok/s | ~64 ms ~64 ms ~66 ms | |
#111 | MiniMax M2 | 229B (10B active) | INT4 Q8 | 150 tok/s 135 tok/s | ~83 ms ~90 ms | |
#112 | Qwen3.5-35B-A3B | 35B (3B active) | INT4 Q8 FP16 | 531 tok/s 479 tok/s 391 tok/s | ~24 ms ~25 ms ~25 ms | |
#116 | Gemma 4 26B A4B | 25.2B (3.8B active) | INT4 Q8 FP16 | 518 tok/s 456 tok/s 359 tok/s | ~27 ms ~27 ms ~28 ms | |
#117 | Ling 3.0 Flash | 124B (5.1B active) | INT4 Q8 FP16 | 498 tok/s 422 tok/s 300 tok/s | ~49 ms ~50 ms ~54 ms | |
#118 | K2 Horizon 7B | 7B | INT4 Q8 FP16 | 467 tok/s 379 tok/s 268 tok/s | ~39 ms ~39 ms ~40 ms | |
#120 | Step 3.5 Flash | 196.81B (11B active) | INT4 Q8 | 345 tok/s 274 tok/s | ~80 ms ~81 ms | |
#123 | GPT-OSS 120B | 117B (5.1B active) | INT4 Q8 FP16 | 195 tok/s 191 tok/s 158 tok/s | ~52 ms ~52 ms ~57 ms | |
#126 | Qwen3 Next 80B A3B | 80B (79B active) | INT4 Q8 FP16 | 97 tok/s 63 tok/s 36 tok/s | ~390 ms ~395 ms ~407 ms | |
#127 | Qwen3 235B A22B Thinking | 235B (22B active) | INT4 Q8 | 129 tok/s 106 tok/s | ~140 ms ~153 ms | |
#130 | Nemotron 3.5 Lightning | 30B (3B active) | INT4 Q8 FP16 | 369 tok/s 351 tok/s 301 tok/s | ~25 ms ~25 ms ~25 ms | |
#131 | Qwen3-235B-A22B | 235B (22B active) | INT4 Q8 | 255 tok/s 175 tok/s | ~136 ms ~149 ms | |
#132 | Qwen3.5-4B | 4B | INT4 Q8 FP16 | 533 tok/s 464 tok/s 359 tok/s | ~24 ms ~24 ms ~25 ms | |
#133 | Qwen3.5-9B | 9B | INT4 Q8 FP16 | 431 tok/s 338 tok/s 229 tok/s | ~49 ms ~49 ms ~51 ms | |
#136 | GPT-OSS 20B | 21B (3.6B active) | INT4 Q8 FP16 | 389 tok/s 362 tok/s 300 tok/s | ~26 ms ~26 ms ~27 ms | |
#137 | Gemma 4 31B | 30.7B | INT4 Q8 FP16 | 237 tok/s 156 tok/s 89 tok/s | ~154 ms ~156 ms ~161 ms | |
#139 | Qwen3 Coder 480B A35B | 480B (35B active) | INT4 | 70 tok/s | ~270 ms | |
#141 | NVIDIA Nemotron 3 Nano 30B-A3B | 3.5B (30B active) | INT4 Q8 FP16 | 232 tok/s 155 tok/s 90 tok/s | ~146 ms ~148 ms ~153 ms | |
#143 | Qwen3-30B-A3B | 30B (3B active) | INT4 Q8 FP16 | 533 tok/s 481 tok/s 393 tok/s | ~24 ms ~24 ms ~25 ms | |
#145 | MiniMax M3 | 428B | INT4 | 21 tok/s | ~2.2s | |
#146 | Mistral Medium 3.5 128B | 128B | INT4 Q8 FP16 | 64 tok/s 41 tok/s 21 tok/s | ~628 ms ~637 ms ~712 ms | |
#149 | Granite 4.2 8B | 8B | INT4 Q8 FP16 | 449 tok/s 358 tok/s 247 tok/s | ~44 ms ~44 ms ~45 ms | |
#150 | Llama 3.1 405B | 405B | INT4 | 27 tok/s | ~1.9s | |
#152 | Hunyuan Large | 389B (52B active) | INT4 | 73 tok/s | ~326 ms | |
#153 | Nemotron 3.5 Lightning 30B A3B | 30B (3B active) | INT4 Q8 FP16 | 533 tok/s 481 tok/s 393 tok/s | ~24 ms ~24 ms ~25 ms | |
#154 | Llama 4 Maverick | 400B (17B active) | INT4 | 260 tok/s | ~132 ms | |
#155 | Gemma 4 E4B | 8B | INT4 Q8 FP16 | 449 tok/s 358 tok/s 247 tok/s | ~44 ms ~44 ms ~45 ms | |
#156 | Mistral Large 3 | 41B (675B active) | INT4 Q8 FP16 | 17 tok/s 9 tok/s 5 tok/s | ~3.2s ~3.2s ~3.3s | |
#157 | Qwen2.5-72B | 72B | INT4 Q8 FP16 | 127 tok/s 77 tok/s 41 tok/s | ~354 ms ~359 ms ~370 ms | |
#158 | GLM-4 | 32B | INT4 Q8 FP16 | 192 tok/s 135 tok/s 81 tok/s | ~161 ms ~163 ms ~168 ms | |
#159 | Gemma 3 27B | 27B | INT4 Q8 FP16 | 256 tok/s 172 tok/s 100 tok/s | ~136 ms ~138 ms ~142 ms | |
#160 | Llama 3.3 70B | 70B | INT4 Q8 FP16 | 130 tok/s 79 tok/s 42 tok/s | ~344 ms ~349 ms ~360 ms | |
#161 | Phi-4 | 14B | INT4 Q8 FP16 | 362 tok/s 266 tok/s 168 tok/s | ~73 ms ~74 ms ~76 ms | |
#162 | DeepSeek-R1 70B | 70B | INT4 Q8 FP16 | 133 tok/s 80 tok/s 43 tok/s | ~344 ms ~349 ms ~360 ms | |
#163 | GLM-4V | 9B | INT4 Q8 FP16 | 371 tok/s 303 tok/s 212 tok/s | ~49 ms ~50 ms ~51 ms | |
#164 | Qwen3-32B | 32B | INT4 Q8 FP16 | 230 tok/s 151 tok/s 86 tok/s | ~160 ms ~162 ms ~167 ms | |
#165 | Hunyuan Standard | 52B (389B active) | INT4 Q8 FP16 | 28 tok/s 16 tok/s 8 tok/s | ~1.8s ~1.9s ~1.9s | |
#166 | Qwen2.5-32B | 32B | INT4 Q8 FP16 | 230 tok/s 151 tok/s 86 tok/s | ~160 ms ~162 ms ~167 ms | |
#169 | DeepSeek-R1 32B | 32B | INT4 Q8 FP16 | 235 tok/s 153 tok/s 87 tok/s | ~160 ms ~162 ms ~167 ms | |
#170 | Magistral Small | 24B | INT4 Q8 FP16 | 228 tok/s 166 tok/s 102 tok/s | ~122 ms ~124 ms ~128 ms | |
#171 | Llama 3.1 70B | 70B | INT4 Q8 FP16 | 130 tok/s 79 tok/s 42 tok/s | ~344 ms ~349 ms ~360 ms | |
#172 | Llama 4 Scout | 109B (17B active) | INT4 Q8 FP16 | 302 tok/s 223 tok/s 140 tok/s | ~103 ms ~104 ms ~107 ms | |
#173 | Ministral 3 14B | 14B | INT4 Q8 FP16 | 304 tok/s 236 tok/s 156 tok/s | ~74 ms ~75 ms ~77 ms | |
#174 | OLMo 3.1 32B Instruct | 32B | INT4 Q8 FP16 | 192 tok/s 135 tok/s 81 tok/s | ~161 ms ~163 ms ~168 ms | |
#176 | DeepSeek-R1 14B | 14B | INT4 Q8 FP16 | 367 tok/s 269 tok/s 169 tok/s | ~73 ms ~74 ms ~76 ms | |
#177 | Gemma 3 12B | 12B | INT4 Q8 FP16 | 387 tok/s 291 tok/s 188 tok/s | ~63 ms ~64 ms ~66 ms | |
#177 | Mistral-Large-2407 | 123B | INT4 Q8 FP16 | 81 tok/s 47 tok/s 24 tok/s | ~602 ms ~611 ms ~682 ms | |
#180 | Command A | 111B | INT4 Q8 FP16 | 72 tok/s 46 tok/s 24 tok/s | ~546 ms ~554 ms ~619 ms | |
#181 | Qwen2-72B | 72B | INT4 Q8 FP16 | 127 tok/s 77 tok/s 41 tok/s | ~354 ms ~359 ms ~370 ms | |
#182 | Mistral-Small-2501 | 24B | INT4 Q8 FP16 | 275 tok/s 187 tok/s 110 tok/s | ~122 ms ~123 ms ~127 ms | |
#183 | Ministral 3 8B | 8B | INT4 Q8 FP16 | 389 tok/s 321 tok/s 229 tok/s | ~44 ms ~45 ms ~46 ms | |
#184 | Qwen3.5-2B | 2B | INT4 Q8 FP16 | 589 tok/s 544 tok/s 465 tok/s | ~14 ms ~15 ms ~15 ms | |
#185 | Qwen2.5-14B | 14B | INT4 Q8 FP16 | 362 tok/s 266 tok/s 168 tok/s | ~73 ms ~74 ms ~76 ms | |
#186 | MiniCPM5-2B | 2B | INT4 Q8 FP16 | 589 tok/s 544 tok/s 465 tok/s | ~14 ms ~15 ms ~15 ms | |
#187 | Gemma 2 27B | 27B | INT4 Q8 FP16 | 256 tok/s 172 tok/s 100 tok/s | ~136 ms ~138 ms ~142 ms | |
#188 | OLMo 3 7B Think | 7B | INT4 Q8 FP16 | 407 tok/s 341 tok/s 249 tok/s | ~39 ms ~40 ms ~41 ms | |
#189 | OLMo 3.1 32B Think | 32B | INT4 Q8 FP16 | 192 tok/s 135 tok/s 81 tok/s | ~161 ms ~163 ms ~168 ms | |
#190 | Gemma 4 E2B | 5.1B | INT4 Q8 FP16 | 507 tok/s 429 tok/s 320 tok/s | ~30 ms ~30 ms ~31 ms | |
#191 | Llama 3 70B | 70B | INT4 Q8 FP16 | 130 tok/s 79 tok/s 42 tok/s | ~344 ms ~349 ms ~360 ms | |
#192 | Ministral 3 3B | 3B | INT4 Q8 FP16 | 499 tok/s 455 tok/s 375 tok/s | ~19 ms ~20 ms ~20 ms | |
#193 | Command R Plus | 104B | INT4 Q8 FP16 | 76 tok/s 49 tok/s 27 tok/s | ~512 ms ~519 ms ~536 ms | |
#194 | DeepSeek-R1 8B | 8B | INT4 Q8 FP16 | 453 tok/s 360 tok/s 248 tok/s | ~44 ms ~44 ms ~45 ms | |
#195 | Gemma 2 9B | 9B | INT4 Q8 FP16 | 431 tok/s 338 tok/s 229 tok/s | ~49 ms ~49 ms ~51 ms | |
#196 | ERNIE-4.5-300B-A47B | 300B (47B active) | INT4 Q8 | 161 tok/s 95 tok/s | ~263 ms ~312 ms | |
#197 | Gemma 3 4B | 4B | INT4 Q8 FP16 | 533 tok/s 464 tok/s 359 tok/s | ~24 ms ~24 ms ~25 ms | |
#198 | Qwen2.5-7B | 7B | INT4 Q8 FP16 | 467 tok/s 379 tok/s 268 tok/s | ~39 ms ~39 ms ~40 ms | |
#199 | DeepSeek-R1 7B | 7B | INT4 Q8 FP16 | 472 tok/s 382 tok/s 269 tok/s | ~39 ms ~39 ms ~40 ms | |
#199 | Qwen3-14B | 14B | INT4 Q8 FP16 | 362 tok/s 266 tok/s 168 tok/s | ~73 ms ~74 ms ~76 ms | |
#201 | Kimi Linear 48B A3B Instruct | 48B (3B active) | INT4 Q8 FP16 | 339 tok/s 326 tok/s 282 tok/s | ~27 ms ~27 ms ~27 ms | |
#202 | Qwen3-8B | 8B | INT4 Q8 FP16 | 449 tok/s 358 tok/s 247 tok/s | ~44 ms ~44 ms ~45 ms | |
#203 | Llama 3.1 8B | 8B | INT4 Q8 FP16 | 449 tok/s 358 tok/s 247 tok/s | ~44 ms ~44 ms ~45 ms | |
#204 | Qwen3-4B | 4B | INT4 Q8 FP16 | 533 tok/s 464 tok/s 359 tok/s | ~24 ms ~24 ms ~25 ms | |
#205 | OLMo 3 32B Base | 32B | INT4 Q8 FP16 | 192 tok/s 135 tok/s 81 tok/s | ~161 ms ~163 ms ~168 ms | |
#206 | Mixtral-8x22B-v0.1 | 176B (22B active) | INT4 Q8 | 265 tok/s 188 tok/s | ~129 ms ~130 ms | |
#207 | Command R | 35B | INT4 Q8 FP16 | 182 tok/s 127 tok/s 75 tok/s | ~175 ms ~178 ms ~183 ms | |
#209 | Llama 3 8B | 8B | INT4 Q8 FP16 | 449 tok/s 358 tok/s 247 tok/s | ~44 ms ~44 ms ~45 ms | |
#210 | Phi-4-Mini | 3.8B | INT4 Q8 FP16 | 539 tok/s 471 tok/s 368 tok/s | ~23 ms ~23 ms ~24 ms | |
#211 | Gemma 3 270M | 0.27B | INT4 Q8 FP16 | 647 tok/s 640 tok/s 623 tok/s | ~5 ms ~5 ms ~5 ms | |
#212 | Qwen3-1.7B | 1.7B | INT4 Q8 FP16 | 599 tok/s 559 tok/s 487 tok/s | ~13 ms ~13 ms ~13 ms | |
#213 | Qwen3-0.6B | 0.6B | INT4 Q8 FP16 | 641 tok/s 625 tok/s 590 tok/s | ~7 ms ~7 ms ~7 ms | |
#214 | Ministral-8B-2410 | 8B | INT4 Q8 FP16 | 449 tok/s 358 tok/s 247 tok/s | ~44 ms ~44 ms ~45 ms | |
#215 | Mixtral-8x7B-v0.1 | 46.7B (7B active) | INT4 Q8 FP16 | 446 tok/s 366 tok/s 261 tok/s | ~44 ms ~45 ms ~46 ms | |
#216 | DeepSeek-R1 1.5B | 1.5B | INT4 Q8 FP16 | 606 tok/s 570 tok/s 503 tok/s | ~12 ms ~12 ms ~12 ms | |
#217 | Llama 3.2 3B | 3B | INT4 Q8 FP16 | 560 tok/s 501 tok/s 405 tok/s | ~19 ms ~19 ms ~20 ms | |
#218 | Phi-3-mini | 3.8B | INT4 Q8 FP16 | 539 tok/s 471 tok/s 368 tok/s | ~23 ms ~23 ms ~24 ms | |
#219 | Qwen3.5-0.8B | 0.8B | INT4 Q8 FP16 | 633 tok/s 611 tok/s 568 tok/s | ~8 ms ~8 ms ~8 ms | |
#220 | Gemma 3n E2B IT | 6B (2B active) | INT4 Q8 FP16 | 498 tok/s 471 tok/s 411 tok/s | ~15 ms ~16 ms ~16 ms | |
#221 | Gemma 2 2B | 2B | INT4 Q8 FP16 | 589 tok/s 544 tok/s 465 tok/s | ~14 ms ~15 ms ~15 ms | |
#222 | Phi-3-medium | 14B | INT4 Q8 FP16 | 362 tok/s 266 tok/s 168 tok/s | ~73 ms ~74 ms ~76 ms | |
#223 | Mistral-7B-Instruct-v0.1 | 7.3B | INT4 Q8 FP16 | 462 tok/s 373 tok/s 262 tok/s | ~40 ms ~41 ms ~42 ms | |
#224 | Llama 3.2 1B | 1B | INT4 Q8 FP16 | 624 tok/s 598 tok/s 547 tok/s | ~9 ms ~9 ms ~9 ms | |
#225 | Yi-34B | 34B | INT4 Q8 FP16 | 185 tok/s 129 tok/s 77 tok/s | ~171 ms ~173 ms ~178 ms | |
#226 | OLMo 3 7B Instruct | 7B | INT4 Q8 FP16 | 407 tok/s 341 tok/s 249 tok/s | ~39 ms ~40 ms ~41 ms | |
#227 | Qwen2-7B | 7B | INT4 Q8 FP16 | 467 tok/s 379 tok/s 268 tok/s | ~39 ms ~39 ms ~40 ms | |
#228 | Phi-3-small | 7B | INT4 Q8 FP16 | 467 tok/s 379 tok/s 268 tok/s | ~39 ms ~39 ms ~40 ms | |
#229 | Gemma 3 1B | 1B | INT4 Q8 FP16 | 624 tok/s 598 tok/s 547 tok/s | ~9 ms ~9 ms ~9 ms | |
#230 | Mistral-7B-Instruct-v0.2 | 7.3B | INT4 Q8 FP16 | 462 tok/s 373 tok/s 262 tok/s | ~40 ms ~41 ms ~42 ms | |
#231 | Falcon-180B | 180B | INT4 Q8 | 59 tok/s 34 tok/s | ~869 ms ~882 ms | |
#232 | Gemma 1 7B | 7B | INT4 Q8 FP16 | 407 tok/s 341 tok/s 249 tok/s | ~39 ms ~40 ms ~41 ms | |
#233 | Gemma 1 2B | 2B | INT4 Q8 FP16 | 596 tok/s 550 tok/s 469 tok/s | ~14 ms ~15 ms ~15 ms | |
#234 | ChatGLM3-6B | 6B | INT4 Q8 FP16 | 426 tok/s 364 tok/s 271 tok/s | ~34 ms ~35 ms ~36 ms | |
#235 | ChatGLM2-6B | 6B | INT4 Q8 FP16 | 426 tok/s 364 tok/s 271 tok/s | ~34 ms ~35 ms ~36 ms | |
#236 | ChatGLM-6B | 6B | INT4 Q8 FP16 | 426 tok/s 364 tok/s 271 tok/s | ~34 ms ~35 ms ~36 ms | |
未上榜模型(按推理速度排序) | ||||||
- | Qwen2-0.5B | 0.5B | INT4 Q8 FP16 | 646 tok/s 631 tok/s 602 tok/s | ~6 ms ~6 ms ~6 ms | |
- | Qwen2.5-0.5B | 0.5B | INT4 Q8 FP16 | 646 tok/s 631 tok/s 602 tok/s | ~6 ms ~6 ms ~6 ms | |
- | ERNIE-4.5-0.3B | 0.3B | INT4 Q8 FP16 | 644 tok/s 636 tok/s 618 tok/s | ~5 ms ~5 ms ~5 ms | |
- | ERNIE-4.5-0.3B-Base | 0.3B | INT4 Q8 FP16 | 644 tok/s 636 tok/s 618 tok/s | ~5 ms ~5 ms ~5 ms | |
- | Liquid D1-Omni 600M | 0.6B | INT4 Q8 FP16 | 641 tok/s 625 tok/s 590 tok/s | ~7 ms ~7 ms ~7 ms | |
- | Falcon-1B | 1B | INT4 Q8 FP16 | 629 tok/s 602 tok/s 551 tok/s | ~9 ms ~9 ms ~9 ms | |
- | Falcon3-1B | 1B | INT4 Q8 FP16 | 624 tok/s 598 tok/s 547 tok/s | ~9 ms ~9 ms ~9 ms | |
- | Qwen2-1.5B | 1.5B | INT4 Q8 FP16 | 606 tok/s 570 tok/s 503 tok/s | ~12 ms ~12 ms ~12 ms | |
- | Qwen2.5-1.5B | 1.5B | INT4 Q8 FP16 | 606 tok/s 570 tok/s 503 tok/s | ~12 ms ~12 ms ~12 ms | |
- | Spark X2.5 1.7B | 1.7B | INT4 Q8 FP16 | 599 tok/s 559 tok/s 487 tok/s | ~13 ms ~13 ms ~13 ms | |
- | Hy-MT2 1.8B | 1.8B | INT4 Q8 FP16 | 596 tok/s 554 tok/s 479 tok/s | ~13 ms ~13 ms ~14 ms | |
- | Falcon-3B | 3B | INT4 Q8 FP16 | 567 tok/s 506 tok/s 409 tok/s | ~19 ms ~19 ms ~20 ms | |
- | CroissantLLM Base | 1.3B | INT4 Q8 FP16 | 565 tok/s 541 tok/s 487 tok/s | ~11 ms ~11 ms ~11 ms | |
- | Phi-1 | 1.3B | INT4 Q8 FP16 | 565 tok/s 541 tok/s 487 tok/s | ~11 ms ~11 ms ~11 ms | |
- | Phi-1.5 | 1.3B | INT4 Q8 FP16 | 565 tok/s 541 tok/s 487 tok/s | ~11 ms ~11 ms ~11 ms | |
- | DeepSeek-R1 3B | 3B | INT4 Q8 FP16 | 562 tok/s 502 tok/s 406 tok/s | ~19 ms ~19 ms ~20 ms | |
- | Mellum 2.1 12B A2.5B Thinking | 12B (2.5B active) | INT4 Q8 FP16 | 562 tok/s 512 tok/s 427 tok/s | ~19 ms ~19 ms ~19 ms | |
- | Falcon3-3B | 3B | INT4 Q8 FP16 | 560 tok/s 501 tok/s 405 tok/s | ~19 ms ~19 ms ~20 ms | |
- | LFM2-VL 3B | 3B | INT4 Q8 FP16 | 560 tok/s 501 tok/s 405 tok/s | ~19 ms ~19 ms ~20 ms | |
- | Liquid LFM2-VL 3B D1 | 3B | INT4 Q8 FP16 | 560 tok/s 501 tok/s 405 tok/s | ~19 ms ~19 ms ~20 ms | |
- | Qwen2.5-3B | 3B | INT4 Q8 FP16 | 560 tok/s 501 tok/s 405 tok/s | ~19 ms ~19 ms ~20 ms | |
- | ERNIE-4.5-21B-A3B | 21B (3B active) | INT4 Q8 FP16 | 540 tok/s 486 tok/s 396 tok/s | ~23 ms ~23 ms ~23 ms | |
- | ERNIE-4.5-21B-A3B-Base | 21B (3B active) | INT4 Q8 FP16 | 540 tok/s 486 tok/s 396 tok/s | ~23 ms ~23 ms ~23 ms | |
- | ERNIE-4.5-VL-28B-A3B | 28B (3B active) | INT4 Q8 FP16 | 535 tok/s 482 tok/s 393 tok/s | ~24 ms ~24 ms ~24 ms | |
- | ERNIE-4.5-VL-28B-A3B-Base | 28B (3B active) | INT4 Q8 FP16 | 535 tok/s 482 tok/s 393 tok/s | ~24 ms ~24 ms ~24 ms | |
- | FrogNano 4B | 4B | INT4 Q8 FP16 | 533 tok/s 464 tok/s 359 tok/s | ~24 ms ~24 ms ~25 ms | |
- | Hy-MT2 30B A3B | 30B (3B active) | INT4 Q8 FP16 | 533 tok/s 481 tok/s 393 tok/s | ~24 ms ~24 ms ~25 ms | |
- | Spark X2.5 4B | 4B | INT4 Q8 FP16 | 533 tok/s 464 tok/s 359 tok/s | ~24 ms ~24 ms ~25 ms | |
- | EmbeddingGemma 2 | 2B | INT4 Q8 FP16 | 527 tok/s 495 tok/s 428 tok/s | ~15 ms ~15 ms ~15 ms | |
- | Phi-2 | 2.7B | INT4 Q8 FP16 | 507 tok/s 466 tok/s 389 tok/s | ~18 ms ~18 ms ~19 ms | |
- | MaLLaM-3B | 3B | INT4 Q8 FP16 | 499 tok/s 455 tok/s 375 tok/s | ~19 ms ~20 ms ~20 ms | |
- | SmolLM3 3B | 3B | INT4 Q8 FP16 | 499 tok/s 455 tok/s 375 tok/s | ~19 ms ~20 ms ~20 ms | |
- | AliceAI Foundation 80B A3B Base | 80B (3B active) | INT4 Q8 FP16 | 496 tok/s 453 tok/s 374 tok/s | ~32 ms ~32 ms ~32 ms | |
- | Kolibri 1 | 78B (3.5B active) | INT4 Q8 FP16 | 487 tok/s 438 tok/s 354 tok/s | ~34 ms ~34 ms ~34 ms | |
- | Falcon-7B | 7B | INT4 Q8 FP16 | 475 tok/s 384 tok/s 270 tok/s | ~39 ms ~39 ms ~40 ms | |
- | Falcon3-7B | 7B | INT4 Q8 FP16 | 467 tok/s 379 tok/s 268 tok/s | ~39 ms ~39 ms ~40 ms | |
- | Hy-MT2 7B | 7B | INT4 Q8 FP16 | 467 tok/s 379 tok/s 268 tok/s | ~39 ms ~39 ms ~40 ms | |
- | Mistral-7B-v0.1 | 7.3B | INT4 Q8 FP16 | 462 tok/s 373 tok/s 262 tok/s | ~40 ms ~41 ms ~42 ms | |
- | LensVLM 9B | 9B | INT4 Q8 FP16 | 431 tok/s 338 tok/s 229 tok/s | ~49 ms ~49 ms ~51 ms | |
- | MiMo V2.6 Distill Qwen 9B | 9B | INT4 Q8 FP16 | 431 tok/s 338 tok/s 229 tok/s | ~49 ms ~49 ms ~51 ms | |
- | ChatGLM3-6B-32K | 6B | INT4 Q8 FP16 | 426 tok/s 364 tok/s 271 tok/s | ~34 ms ~35 ms ~36 ms | |
- | Yi-6B | 6B | INT4 Q8 FP16 | 426 tok/s 364 tok/s 271 tok/s | ~34 ms ~35 ms ~36 ms | |
- | Kimi-VL-A3B-Instruct | 16B (3B active) | INT4 Q8 FP16 | 416 tok/s 390 tok/s 329 tok/s | ~23 ms ~23 ms ~23 ms | |
- | Falcon3-10B | 10B | INT4 Q8 FP16 | 415 tok/s 321 tok/s 214 tok/s | ~53 ms ~54 ms ~56 ms | |
- | Falcon2-11B | 11B | INT4 Q8 FP16 | 408 tok/s 309 tok/s 202 tok/s | ~58 ms ~59 ms ~61 ms | |
- | Hunyuan Lite | 7B | INT4 Q8 FP16 | 407 tok/s 341 tok/s 249 tok/s | ~39 ms ~40 ms ~41 ms | |
- | OLMo 3 7B Base | 7B | INT4 Q8 FP16 | 407 tok/s 341 tok/s 249 tok/s | ~39 ms ~40 ms ~41 ms | |
- | SEA-LION-7B | 7.1B | INT4 Q8 FP16 | 405 tok/s 339 tok/s 247 tok/s | ~40 ms ~40 ms ~41 ms | |
- | SEA-LION-7B-Instruct | 7.1B | INT4 Q8 FP16 | 405 tok/s 339 tok/s 247 tok/s | ~40 ms ~40 ms ~41 ms | |
- | Sahabat-AI-Llama3-8B-Instruct | 8B | INT4 Q8 FP16 | 389 tok/s 321 tok/s 229 tok/s | ~44 ms ~45 ms ~46 ms | |
- | Typhoon-2-8B | 8B | INT4 Q8 FP16 | 389 tok/s 321 tok/s 229 tok/s | ~44 ms ~45 ms ~46 ms | |
- | Laguna S 2.1 | 118B (8B active) | INT4 Q8 FP16 | 388 tok/s 321 tok/s 217 tok/s | ~63 ms ~63 ms ~70 ms | |
- | GLM-4-9B | 9B | INT4 Q8 FP16 | 371 tok/s 303 tok/s 212 tok/s | ~49 ms ~50 ms ~51 ms | |
- | GLM-4-9B-Chat | 9B | INT4 Q8 FP16 | 371 tok/s 303 tok/s 212 tok/s | ~49 ms ~50 ms ~51 ms | |
- | GLM-4-9B-Chat-1M | 9B | INT4 Q8 FP16 | 371 tok/s 303 tok/s 212 tok/s | ~49 ms ~50 ms ~51 ms | |
- | Yi-9B | 9B | INT4 Q8 FP16 | 371 tok/s 303 tok/s 212 tok/s | ~49 ms ~50 ms ~51 ms | |
- | Sahabat-AI-Gemma2-9B | 9.2B | INT4 Q8 FP16 | 368 tok/s 300 tok/s 209 tok/s | ~50 ms ~51 ms ~52 ms | |
- | Sahabat-AI-Gemma2-9B-Instruct | 9.2B | INT4 Q8 FP16 | 368 tok/s 300 tok/s 209 tok/s | ~50 ms ~51 ms ~52 ms | |
- | GreenMind-14B-R1 | 14B | INT4 Q8 FP16 | 304 tok/s 236 tok/s 156 tok/s | ~74 ms ~75 ms ~77 ms | |
- | AREX-2 | 27B | INT4 Q8 FP16 | 256 tok/s 172 tok/s 100 tok/s | ~136 ms ~138 ms ~142 ms | |
- | PPLX Decider v1 27B | 27B | INT4 Q8 FP16 | 256 tok/s 172 tok/s 100 tok/s | ~136 ms ~138 ms ~142 ms | |
- | PPLX Decider v1.1 27B | 27B | INT4 Q8 FP16 | 256 tok/s 172 tok/s 100 tok/s | ~136 ms ~138 ms ~142 ms | |
- | Agnes 3.0 Flash | 33B | INT4 Q8 FP16 | 226 tok/s 148 tok/s 84 tok/s | ~165 ms ~167 ms ~172 ms | |
- | Hunyuan A13B | 80B (13B active) | INT4 Q8 FP16 | 213 tok/s 184 tok/s 134 tok/s | ~80 ms ~81 ms ~83 ms | |
- | Falcon-40B | 40B | INT4 Q8 FP16 | 203 tok/s 129 tok/s 71 tok/s | ~198 ms ~201 ms ~207 ms | |
- | ERNIE-4.5-300B-A47B-Base | 300B (47B active) | INT4 Q8 | 161 tok/s 95 tok/s | ~263 ms ~312 ms | |
- | ERNIE-4.5-VL-424B-A47B | 424B (47B active) | INT4 | 155 tok/s | ~275 ms | |
- | ERNIE-4.5-VL-424B-A47B-Base | 424B (47B active) | INT4 | 155 tok/s | ~275 ms | |
- | MiMo V2.6 Flash RL | 309B (15B active) | INT4 | 115 tok/s | ~119 ms | |
- | Typhoon-2-70B | 70B | INT4 Q8 FP16 | 108 tok/s 71 tok/s 40 tok/s | ~345 ms ~350 ms ~361 ms | |
- | Kimi-Dev-72B | 72B | INT4 Q8 FP16 | 105 tok/s 69 tok/s 39 tok/s | ~355 ms ~360 ms ~371 ms | |
- | GLM-130B | 130B | INT4 Q8 FP16 | 63 tok/s 40 tok/s 20 tok/s | ~638 ms ~647 ms ~779 ms | |
不同量化精度下可运行的最大模型参数级别。
上下文长度:
4位量化
70B+ 模型
8位精度
70B 模型
16位全精度
70B 模型
本地模型训练与适配器微调支持能力。
微调上下文:
QLoRA
70B+ 模型
LoRA
70B 模型
全参数微调
7B-8B 模型
Instinct MI350X (288GB) 上的最佳量化精度与运行规格建议。
最佳推理区间
适合在 Q4/Q8 精度下运行 70B 参数级模型并支持 32k 上下文扩展,或对中小型模型进行高并发批处理推理。
显存带宽与推理速率
具备 8000 GB/s 聚合带宽,单批次推理处于显存带宽受限模式。8B Q4 模型预估生成速度约 1778 tok/s,70B Q4 模型预估生成速度约 211 tok/s。
Assistant
在线