ApX 标志ApX 标志

趋近智

AMD RX 6700 XT (12GB)

The AMD RX 6700 XT (12GB) provides 12 GB of memory with 384 GB/s bandwidth, supporting local inference via ROCm and Vulkan acceleration.

总显存

12 GB

可用显存上限

12 GB

显存带宽

384 GB/s

最大推理模型级别

14B Models (Q4)

热设计功耗

230W

显存占用随上下文长度变化曲线

随上下文增长模拟的显存需求。当曲线超过参考线时将导致显存不足(OOM)。

量化精度:

模型兼容性与生成速度矩阵

主流开源大模型的推理吞吐量与显存可行性模拟。

上下文长度:

KV 缓存:

显卡数量:

模型参数量量化精度预估 TPSTTFT可运行
Llama 3.2 1B

1.2B

INT4

191 tok/s

~297 ms

Llama 3.2 1B

1.2B

Q8

143 tok/s

~298 ms

Llama 3.2 1B

1.2B

FP16

92 tok/s

~302 ms

Llama 3.2 3B

3.2B

INT4

110 tok/s

~731 ms

Llama 3.2 3B

3.2B

Q8

73 tok/s

~736 ms

Llama 3.2 3B

3.2B

FP16

41 tok/s

~746 ms

Mistral 7B

7.2B

INT4

61 tok/s

~1573 ms

Mistral 7B

7.2B

Q8

37 tok/s

~1584 ms

Mistral 7B

7.2B

FP16

-

-

Llama 3.1 8B

8.0B

INT4

56 tok/s

~1742 ms

Llama 3.1 8B

8.0B

Q8

32 tok/s

~1905 ms

Llama 3.1 8B

8.0B

FP16

-

-

Mistral Nemo 12B

12.2B

INT4

39 tok/s

~2636 ms

Mistral Nemo 12B

12.2B

Q8

-

-

Mistral Nemo 12B

12.2B

FP16

-

-

Qwen 2.5 14B

14.7B

INT4

31 tok/s

~3436 ms

Qwen 2.5 14B

14.7B

Q8

-

-

Qwen 2.5 14B

14.7B

FP16

-

-

DeepSeek R1 32B

32.5B

INT4

-

-

Llama 3.3 70B

70.6B

INT4

-

-

Qwen 2.5 72B

72.7B

INT4

-

-

DeepSeek V3 671B

671B (37B active)

INT4

-

-

需要评估自定义模型架构、CPU 内存卸载或分布式多节点集群?

进入完整显存计算器

推理可行性评估

不同量化精度下可运行的最大模型参数级别。

上下文长度:

4位量化

Q4

14B Models

8位精度

Q8

8B Models

16位全精度

FP16

3B Models

微调可行性评估

本地模型训练与适配器微调支持能力。

微调上下文:

QLoRA

4-bit

14B Models

LoRA

16-bit

8B Models

全参数微调

1B Models

Workload Recommendations

Guidance for optimal precision and operational ceilings on AMD RX 6700 XT (12GB).

Inference Sweet Spot

Optimal for 8B models across extended context (32k+). 14B models fit comfortably at Q4 precision with standard context.

Bandwidth & Speed Profile

With 384 GB/s aggregate bandwidth, batch size 1 inference operates in a memory-bandwidth bound regime. Generates approximately 85 tok/s on an 8B Q4 model and 10 tok/s on a 70B Q4 model.