趋近智
参数
104B
上下文长度
128K
模态
Text
架构
Dense
许可证
CC-BY-NC
发布日期
4 Apr 2024
训练数据截止日期
Feb 2023
API 价格 (每 1M)
输入: $2.50 · 输出: $10.00
不同量化方法和上下文大小的显存要求
1024 个令牌
消费级
11x RTX 4090
24GB VRAM
数据中心
3x NVIDIA A100
80GB VRAM
Apple Silicon
2x Apple M3 Max
128GB VRAM
128000 个令牌
消费级
13x RTX 4090
24GB VRAM
数据中心
4x NVIDIA A100
80GB VRAM
Apple Silicon
3x Apple M3 Max
128GB VRAM
排名
#165
| 基准 | 分数 | 排名 |
|---|---|---|
通用文本 | 1261 | 148 |
1 | 249 | |
通用知识 参考指标 | 0.757 | 22 |
排名
#165
编程排名
-
Command R Plus 是由 Cohere 开发的大规模生成式模型,旨在支持要求最严苛的企业级人工智能应用。它专门针对处理复杂的多步智能体工作流和大规模的高级检索增强生成 (RAG) 进行了架构设计。该模型通过提供高度的可靠性,特别是在通过行内引用实现响应溯源以及管理长文本对话历史方面,旨在弥补实验原型与生产就绪系统之间的差距。其多语言能力十分广泛,在十种全球主要商业语言中表现稳健,并经过了超过 23 种语言的训练,确保了其在各种国际化运营环境中的实用性。
从技术角度来看,Command R Plus 采用了拥有 1040 亿参数的稠密、仅解码器(decoder-only)Transformer 架构。它结合了分组查询注意力 (GQA) 机制以优化推理延迟和内存效率,这对于处理其 128,000 token 的超大上下文窗口至关重要。该模型采用旋转位置嵌入 (RoPE) 和层归一化 (Layer Normalization),以确保在长序列上的训练稳定性和精确的 token 依赖管理。其对齐过程结合了严谨的有监督微调 (SFT) 和偏好训练,从而提升了模型遵循复杂系统指令以及高成功率调用外部工具的能力,包括在工具调用失败时的自我修正能力。
运行性能是 Command R Plus 变体的一大特色,该版本经过重大更新,在不增加硬件需求的前提下提升了吞吐量并降低了延迟。它针对高产量的生产环境工作负载进行了优化,在这些场景中,成本效益和速度与准确性同样关键。该模型的设计便于无缝集成到 CRM 和 ERP 等现有业务生态系统中,从而实现结构化数据分析的自动化并执行多步推理任务。通过在非商业许可证下提供开放权重,Cohere 允许研究人员和开发人员在私有环境中部署和检查模型能力,从而为企业级 AI 部署提供了一种透明化的方案。
注意力
注意力结构
Multi-Head Attention
注意力头
96
键值头
8
注意力头维度
-
位置嵌入
Absolute Position Embedding
RoPE Theta
-
滑动窗口注意力
-
滑动窗口大小
-
滑动窗口比例
-
线性注意力
-
线性注意力比例
-
归一化
Layer Normalization
激活函数
-
维度
隐藏维度大小
12,288
层数
64
FFN 中间层大小(稠密层)
-
多 Token 预测头数
-
分词器
词汇量大小
-
APX AI
在线