ApX 标志ApX 标志

趋近智

AMD Ryzen AI 9 HX 370 (64GB system, 48GB GPU-accessible)

The AMD Ryzen AI 9 HX 370 (64GB system, 48GB GPU-accessible) provides 48 GB of memory with 102 GB/s bandwidth, supporting local inference via ROCm and Vulkan acceleration.

总显存

48 GB

可用显存上限

48 GB

显存带宽

102.4 GB/s

最大推理模型级别

32B Models (Q4)

热设计功耗

54W

显存占用随上下文长度变化曲线

随上下文增长模拟的显存需求。当曲线超过参考线时将导致显存不足(OOM)。

量化精度:

模型兼容性与生成速度矩阵

主流开源大模型的推理吞吐量与显存可行性模拟。

上下文长度:

KV 缓存:

显卡数量:

模型参数量量化精度预估 TPSTTFT可运行
Llama 3.2 1B

1.2B

INT4

191 tok/s

~297 ms

Llama 3.2 1B

1.2B

Q8

143 tok/s

~298 ms

Llama 3.2 1B

1.2B

FP16

92 tok/s

~302 ms

Llama 3.2 3B

3.2B

INT4

110 tok/s

~731 ms

Llama 3.2 3B

3.2B

Q8

73 tok/s

~736 ms

Llama 3.2 3B

3.2B

FP16

41 tok/s

~746 ms

Mistral 7B

7.2B

INT4

61 tok/s

~1573 ms

Mistral 7B

7.2B

Q8

37 tok/s

~1584 ms

Mistral 7B

7.2B

FP16

-

-

Llama 3.1 8B

8.0B

INT4

56 tok/s

~1742 ms

Llama 3.1 8B

8.0B

Q8

32 tok/s

~1905 ms

Llama 3.1 8B

8.0B

FP16

-

-

Mistral Nemo 12B

12.2B

INT4

39 tok/s

~2636 ms

Mistral Nemo 12B

12.2B

Q8

-

-

Mistral Nemo 12B

12.2B

FP16

-

-

Qwen 2.5 14B

14.7B

INT4

31 tok/s

~3436 ms

Qwen 2.5 14B

14.7B

Q8

-

-

Qwen 2.5 14B

14.7B

FP16

-

-

DeepSeek R1 32B

32.5B

INT4

-

-

DeepSeek R1 32B

32.5B

Q8

-

-

DeepSeek R1 32B

32.5B

FP16

-

-

Llama 3.3 70B

70.6B

INT4

-

-

Llama 3.3 70B

70.6B

Q8

-

-

Llama 3.3 70B

70.6B

FP16

-

-

Qwen 2.5 72B

72.7B

INT4

-

-

Qwen 2.5 72B

72.7B

Q8

-

-

Qwen 2.5 72B

72.7B

FP16

-

-

DeepSeek V3 671B

671B (37B active)

INT4

-

-

需要评估自定义模型架构、CPU 内存卸载或分布式多节点集群?

进入完整显存计算器

推理可行性评估

不同量化精度下可运行的最大模型参数级别。

上下文长度:

4位量化

Q4

32B Models

8位精度

Q8

32B Models

16位全精度

FP16

14B Models

微调可行性评估

本地模型训练与适配器微调支持能力。

微调上下文:

QLoRA

4-bit

32B Models

LoRA

16-bit

14B Models

全参数微调

7B-8B Models

Workload Recommendations

Guidance for optimal precision and operational ceilings on AMD Ryzen AI 9 HX 370 (64GB system, 48GB GPU-accessible).

Inference Sweet Spot

Optimized for 14B models at uncompressed or Q8 precision, and 32B models at Q4 with up to 32k context.

Bandwidth & Speed Profile

With 102.4 GB/s aggregate bandwidth, batch size 1 inference operates in a memory-bandwidth bound regime. Generates approximately 23 tok/s on an 8B Q4 model and 3 tok/s on a 70B Q4 model.