ApX 标志ApX 标志

趋近智

在启动集群之前,
先了解能运行什么。

评估任意开源 model 在物理 GPU 上的显存、每秒 Token 数、首字延迟(TTFT)及每小时成本。基于实际运行数据评估。

选择规格

装得下

模型

Llama-3-70B

量化方式

4比特 (INT4)

推荐 GPU

2x H100 (80GB)

上下文长度

8,192

并发用户数

4

总显存 (VRAM)

52.5 GB

估算吞吐量

约 91 tok/s/用户

估算首字延迟 (TTFT)

约 1154 ms

估算每小时成本

$4.58 / 小时

开源模型是免费的,但 GPU 算力不是。

拉取容器

CUDA 匹配的 wheels

下载 140 GB 权重

显存溢出 (OOM)

权重装得下,KV 缓存装不下。

在生产级上下文长度和活跃并发下,缓存才是耗尽显存的元凶。内存溢出(OOM)错误往往在模型加载完成后才出现。

单并发基准测试看起来不错。

在并发压力下,每位用户的每秒 Token 数仅为单并发测试的一小部分。当批次容量达到饱和时,排队延迟将占据主导地位。

两张 GPU 本应是两倍速度。

如果互连架构选择错误,并非如此。高延迟的通信开销占据主导,导致张量并行执行受限于总线带宽瓶颈。

每一个都是算术问题。所有这些都可以在配置任何设备前计算清楚。

账单到来前,先算一笔账。

在实际租用设备前,避开所有需要付出高昂代价才能发现的配置陷阱:了解适配情况、每小时成本、并发流量下的表现,以及增加 GPU 到底能带来速度提升还是仅仅增加成本。

显存占用细分

模型权重: 35.8 GB

KV 缓存: 10.7 GB

框架开销: 6.0 GB

68.2%

20.5%

11.4%

所需显存

52.5 GB

推荐最少 GPU

2x A100 (40GB)

最大批次大小

28

估算吞吐量

约 91 tok/s

在规划集群规模前,值得校验的测试结果。

总吞吐量饱和,而用户单流速度持续下降。

超过饱和批次后,总吞吐量基本持平,而单用户延迟激增。交叉点决定了最佳的部署决策。

INT4 量化将吞吐量饱和的批次大小缩减至四分之一,从而提升了服务容量。 验证 →

权重低比特量化对 KV 缓存毫无帮助。

在长上下文场景下,缓存是导致显存溢出的关键因素。将权重压缩到 INT4 并不能缩减缓存体积。

一个 30B/3B 激活的混合专家模型(MoE)在批次大小为 1 时表现如 3B,随着并发增加会漂移向 30B。 验证 →

增加 GPU 并不等同于提升速度。

增加算力有时只是增加了瓶颈。

Prefill 阶段是统一内存架构停止带来速度收益的地方。 验证 →

基于实际基准测试数据评估。

每一项预测都会与回归测试集中的实际运行数据进行验证:公开发布的文件大小、基准测试结果以及实际使用的硬件,涵盖显存、解码速度和微调吞吐量等数百个案例。我们公开所有偏差与边缘案例,保持完全透明。

在配置 8 台还是 16 台 GPU 之前,先验证数学计算。

广泛应用于全球领先科技公司与高校的科研人员及工程师

Stanford University
Massachusetts Institute of Technology
Oxford University
Tsinghua University
Peking University
Carnegie Mellon University
Nvidia
Google Cloud
Amazon Web Services
Alibaba
Huawei
Bytedance

估算背后的基础数据。

提供每个开源模型的架构、注意结构、层数与头数、上下文长度以及不同量化下的硬件要求;同时收录社区提交的基准测试实测数据。

模型参数量 (总/激活)注意力机制上下文长度INT4 下显存占用运行硬件
Llama-3-70B70.6BGQA8,19239.2 GB2x 24GB
Mistral-8x7B46.7B (12.9B)GQA32,76825.3 GB1x 32GB
Qwen-1.5-72B72.7BGQA32,76840.5 GB2x 24GB
Llama-3-8B8.0BGQA8,1925.7 GB1x 16GB
探索模型目录 →

解释这些数字的同一份参考资料。

包含一个关于构建大型语言模型的 30 章大师课,以及涵盖 Transformer 内部机制、注意力、量化、微调与推理的工程课程库。

从工具获取准确的数据,并在课程中学习其背后的原理。

进行多节点集群规划或模拟生产负载?

最新分析

olve ChatGPT action discovery probe errors by handling POST discovery probes with valid JSON-RPC fallback responses

The updated AI Engagement Index ranks nations by their engagement in technical AI content, offering a fresh perspective on the global AI adoption.

机器学习基础算法,用于构建高效、可扩展且经过优化的技术方案。