趋近智
参数
111B
上下文长度
256K
模态
Text
架构
Dense
许可证
CC-BY-NC
发布日期
13 Mar 2025
训练数据截止日期
Jun 2024
API 价格 (每 1M)
输入: $2.50 · 输出: $10.00
不同量化方法和上下文大小的显存要求
1024 个令牌
消费级
12x RTX 4090
24GB VRAM
数据中心
4x NVIDIA A100
80GB VRAM
Apple Silicon
3x Apple M3 Max
128GB VRAM
256000 个令牌
消费级
14x RTX 4090
24GB VRAM
数据中心
4x NVIDIA A100
80GB VRAM
Apple Silicon
3x Apple M3 Max
128GB VRAM
排名
#153
| 基准 | 分数 | 排名 |
|---|---|---|
StackUnseen | 0.229 | 34 |
通用文本 | 1354 | 112 |
0.07 | 233 | |
文本摘要 已归档 | 0.858 | 8 |
编程 已归档 | 0.12 | 22 |
排名
#153
编程排名
#122
Cohere Command A 是一款专为高性能企业级工作流设计的大规模生成式模型,特别适用于涉及工具调用、智能体(Agents)和检索增强生成(RAG)的场景。作为面向生产环境的高吞吐量方案,该模型在保持 1110 亿参数规模的同时,针对常见的双 GPU 硬件配置进行了部署优化。其设计重点在于满足业务关键型的准确性与速度需求,支持 256,000 密令(tokens)的标准上下文窗口,以便处理海量的企业文档和长篇对话历史。
该模型采用仅解码器(decoder-only)的 Transformer 架构,并利用多种先进的结构创新来平衡局部与全局上下文。其特色在于混合注意力机制:四分之三的层采用滑动窗口注意力(Sliding Window Attention)以实现高效的局部建模,而每隔四层则使用一次全局注意力机制,以维持长程依赖关系。技术规范包括:使用分组查询注意力(GQA)以优化推理吞吐量;采用 SwiGLU 激活函数以改善梯度流;以及省去偏置项以稳定训练过程。位置信息在局部注意力层中通过旋转位置嵌入(RoPE)处理,而全局层则采用位置无关的方法。
Command A 针对全球企业部署进行了优化,支持包括英语、法语、西班牙语、中文和阿拉伯语在内的 23 种主要商业语言的训练。该模型针对对话式工具调用进行了专门对齐,使其能够高精度地与外部 API、数据库和搜索引擎交互。通过监督微调(SFT)和偏好优化(Preference Optimization)实现的这种对齐,使其在多步智能体推理和金融数据处理(如从复杂上下文中提取数值细节)方面表现尤为出色。
注意力
注意力结构
Multi-Head Attention
注意力头
-
键值头
-
注意力头维度
-
位置嵌入
Absolute Position Embedding
RoPE Theta
-
滑动窗口注意力
-
滑动窗口大小
-
滑动窗口比例
-
线性注意力
-
线性注意力比例
-
归一化
-
激活函数
SwigLU
维度
隐藏维度大小
-
层数
-
FFN 中间层大小(稠密层)
-
多 Token 预测头数
-
分词器
词汇量大小
-
APX AI
在线