ApX 标志ApX 标志

趋近智

Command R Plus

参数

104B

上下文长度

128K

模态

Text

架构

Dense

许可证

CC-BY-NC

发布日期

4 Apr 2024

训练数据截止日期

Feb 2023

API 价格 (每 1M)

输入: $2.50 · 输出: $10.00

系统要求

不同量化方法和上下文大小的显存要求

1024 个令牌

220.18 GB VRAM

消费级

11x RTX 4090

24GB VRAM

数据中心

3x NVIDIA A100

80GB VRAM

Apple Silicon

2x Apple M3 Max

128GB VRAM

128000 个令牌

255.13 GB VRAM

消费级

13x RTX 4090

24GB VRAM

数据中心

4x NVIDIA A100

80GB VRAM

Apple Silicon

3x Apple M3 Max

128GB VRAM

架构图

Input TokensToken EmbeddingPosition: AbsoluteHidden: 12.3k · Context: 128Kx 64 layersLayerNormPre-AttentionMulti-Head Attention96Q / 8KV headsHead dim: 128+LayerNormPre-FFNFeed-Forward NetworkActivation+Final LayerNormOutput Logits

评估基准

排名

#165

基准分数排名

通用文本

Text Arena

1261

148

1

249

通用知识

参考指标
MMLU

0.757

22

排名

排名

#165

编程排名

-

关于 Command R Plus

Command R Plus 是由 Cohere 开发的大规模生成式模型,旨在支持要求最严苛的企业级人工智能应用。它专门针对处理复杂的多步智能体工作流和大规模的高级检索增强生成 (RAG) 进行了架构设计。该模型通过提供高度的可靠性,特别是在通过行内引用实现响应溯源以及管理长文本对话历史方面,旨在弥补实验原型与生产就绪系统之间的差距。其多语言能力十分广泛,在十种全球主要商业语言中表现稳健,并经过了超过 23 种语言的训练,确保了其在各种国际化运营环境中的实用性。

从技术角度来看,Command R Plus 采用了拥有 1040 亿参数的稠密、仅解码器(decoder-only)Transformer 架构。它结合了分组查询注意力 (GQA) 机制以优化推理延迟和内存效率,这对于处理其 128,000 token 的超大上下文窗口至关重要。该模型采用旋转位置嵌入 (RoPE) 和层归一化 (Layer Normalization),以确保在长序列上的训练稳定性和精确的 token 依赖管理。其对齐过程结合了严谨的有监督微调 (SFT) 和偏好训练,从而提升了模型遵循复杂系统指令以及高成功率调用外部工具的能力,包括在工具调用失败时的自我修正能力。

运行性能是 Command R Plus 变体的一大特色,该版本经过重大更新,在不增加硬件需求的前提下提升了吞吐量并降低了延迟。它针对高产量的生产环境工作负载进行了优化,在这些场景中,成本效益和速度与准确性同样关键。该模型的设计便于无缝集成到 CRM 和 ERP 等现有业务生态系统中,从而实现结构化数据分析的自动化并执行多步推理任务。通过在非商业许可证下提供开放权重,Cohere 允许研究人员和开发人员在私有环境中部署和检查模型能力,从而为企业级 AI 部署提供了一种透明化的方案。

技术规格

注意力

注意力结构

Multi-Head Attention

注意力头

96

键值头

8

注意力头维度

-

位置嵌入

Absolute Position Embedding

RoPE Theta

-

滑动窗口注意力

-

滑动窗口大小

-

滑动窗口比例

-

线性注意力

-

线性注意力比例

-

归一化

Layer Normalization

激活函数

-

维度

隐藏维度大小

12,288

层数

64

FFN 中间层大小(稠密层)

-

多 Token 预测头数

-

分词器

词汇量大小

-

关于 Command


其他 Command 模型
Command R Plus:规格和 GPU 显存要求