ApX 标志ApX 标志

趋近智

Command A

参数

111B

上下文长度

256K

模态

Text

架构

Dense

许可证

CC-BY-NC

发布日期

13 Mar 2025

训练数据截止日期

Jun 2024

API 价格 (每 1M)

输入: $2.50 · 输出: $10.00

系统要求

不同量化方法和上下文大小的显存要求

1024 个令牌

234.74 GB VRAM

消费级

12x RTX 4090

24GB VRAM

数据中心

4x NVIDIA A100

80GB VRAM

Apple Silicon

3x Apple M3 Max

128GB VRAM

256000 个令牌

269.83 GB VRAM

消费级

14x RTX 4090

24GB VRAM

数据中心

4x NVIDIA A100

80GB VRAM

Apple Silicon

3x Apple M3 Max

128GB VRAM

架构图

Input TokensToken EmbeddingPosition: AbsoluteContext: 256Kx N layersNormPre-AttentionMulti-Head Attention+NormPre-FFNFeed-Forward NetworkSwiGLU+Final NormOutput Logits

评估基准

排名

#153

基准分数排名

0.229

34

通用文本

Text Arena

1354

112

0.07

233

文本摘要

已归档
ProLLM Summarization

0.858

8

编程

已归档
Aider Coding

0.12

22

排名

排名

#153

编程排名

#122

关于 Command A

Cohere Command A 是一款专为高性能企业级工作流设计的大规模生成式模型,特别适用于涉及工具调用、智能体(Agents)和检索增强生成(RAG)的场景。作为面向生产环境的高吞吐量方案,该模型在保持 1110 亿参数规模的同时,针对常见的双 GPU 硬件配置进行了部署优化。其设计重点在于满足业务关键型的准确性与速度需求,支持 256,000 密令(tokens)的标准上下文窗口,以便处理海量的企业文档和长篇对话历史。

该模型采用仅解码器(decoder-only)的 Transformer 架构,并利用多种先进的结构创新来平衡局部与全局上下文。其特色在于混合注意力机制:四分之三的层采用滑动窗口注意力(Sliding Window Attention)以实现高效的局部建模,而每隔四层则使用一次全局注意力机制,以维持长程依赖关系。技术规范包括:使用分组查询注意力(GQA)以优化推理吞吐量;采用 SwiGLU 激活函数以改善梯度流;以及省去偏置项以稳定训练过程。位置信息在局部注意力层中通过旋转位置嵌入(RoPE)处理,而全局层则采用位置无关的方法。

Command A 针对全球企业部署进行了优化,支持包括英语、法语、西班牙语、中文和阿拉伯语在内的 23 种主要商业语言的训练。该模型针对对话式工具调用进行了专门对齐,使其能够高精度地与外部 API、数据库和搜索引擎交互。通过监督微调(SFT)和偏好优化(Preference Optimization)实现的这种对齐,使其在多步智能体推理和金融数据处理(如从复杂上下文中提取数值细节)方面表现尤为出色。

技术规格

注意力

注意力结构

Multi-Head Attention

注意力头

-

键值头

-

注意力头维度

-

位置嵌入

Absolute Position Embedding

RoPE Theta

-

滑动窗口注意力

-

滑动窗口大小

-

滑动窗口比例

-

线性注意力

-

线性注意力比例

-

归一化

-

激活函数

SwigLU

维度

隐藏维度大小

-

层数

-

FFN 中间层大小(稠密层)

-

多 Token 预测头数

-

分词器

词汇量大小

-

关于 Command


其他 Command 模型