ApX 标志ApX 标志

趋近智

Command R

参数

35B

上下文长度

128K

模态

Text

架构

Dense

许可证

CC-BY-NC

发布日期

11 Mar 2024

训练数据截止日期

Jun 2024

系统要求

不同量化方法和上下文大小的显存要求

1024 个令牌

75.18 GB VRAM

消费级

4x RTX 4090

24GB VRAM

数据中心

1x NVIDIA A100

80GB VRAM

Apple Silicon

1x Apple M3 Max

128GB VRAM

128000 个令牌

97.02 GB VRAM

消费级

5x RTX 4090

24GB VRAM

数据中心

2x NVIDIA A100

80GB VRAM

Apple Silicon

1x Apple M3 Max

128GB VRAM

架构图

Input TokensToken EmbeddingPosition: AbsoluteHidden: 8.2k · Context: 128Kx 40 layersLayerNormPre-AttentionMulti-Head Attention64Q / 8KV headsHead dim: 128+LayerNormPre-FFNFeed-Forward NetworkSwiGLU+Final LayerNormOutput Logits

评估基准

排名

#168

基准分数排名

0.02

156

通用文本

Text Arena

1226

160

排名

排名

#168

编程排名

-

关于 Command R

Cohere Command R 是一款生成式语言模型,专为高性能企业级工作负载而设计,侧重于长上下文处理和工具增强型工作流。该模型基于优化的仅解码器(decoder-only)Transformer 架构,利用分组查询注意力(GQA)技术,在维持 128,000 标记(token)超长上下文窗口的同时,有效降低了大规模注意力机制通常带来的内存开销。通过在推理效率与高保真输出之间取得平衡,它旨在促进从实验性原型向生产级部署的平稳过渡。

该模型经过了多阶段训练过程,包括在多样化多语言语料库上的广泛预训练,以及随后通过监督微调和偏好优化进行的对齐。其核心架构特性在于针对有据生成(grounded generation)的原生训练,使模型能够生成带有外部文档源精确行内引用的回答。这使其在检索增强生成(RAG)流水线中表现尤为出色,能够满足保持事实一致性和来源可追溯性的核心要求。此外,Command R 支持复杂的多步工具调用,使其能够作为智能体(agent)运行,通过与外部 API、数据库和软件工具交互来推理并处理复杂任务。

Command R 针对全球商业应用进行了优化,提供对 10 种语言的原生支持,并总计经过 23 种语言的训练,确保了在国际市场上的多功能性。其架构采用了旋转位置嵌入(RoPE)和层归一化(Layer Normalization)等先进组件,以确保在处理大规模输入序列时的稳定性和连贯性。通过专注于文档摘要、复杂推理和结构化数据分析等实用任务,Command R 为自动化企业系统和智能体工作流提供了可扩展的核心支撑。

技术规格

注意力

注意力结构

Multi-Head Attention

注意力头

64

键值头

8

注意力头维度

-

位置嵌入

Absolute Position Embedding

RoPE Theta

-

滑动窗口注意力

-

滑动窗口大小

-

滑动窗口比例

-

线性注意力

-

线性注意力比例

-

归一化

Layer Normalization

激活函数

SwigLU

维度

隐藏维度大小

8,192

层数

40

FFN 中间层大小(稠密层)

-

多 Token 预测头数

-

分词器

词汇量大小

-

关于 Command


其他 Command 模型