趋近智
不同量化方法和上下文大小的显存要求
1024 个令牌
消费级
4x RTX 4090
24GB VRAM
数据中心
1x NVIDIA A100
80GB VRAM
Apple Silicon
1x Apple M3 Max
128GB VRAM
128000 个令牌
消费级
5x RTX 4090
24GB VRAM
数据中心
2x NVIDIA A100
80GB VRAM
Apple Silicon
1x Apple M3 Max
128GB VRAM
排名
#168
| 基准 | 分数 | 排名 |
|---|---|---|
0.02 | 156 | |
通用文本 | 1226 | 160 |
排名
#168
编程排名
-
Cohere Command R 是一款生成式语言模型,专为高性能企业级工作负载而设计,侧重于长上下文处理和工具增强型工作流。该模型基于优化的仅解码器(decoder-only)Transformer 架构,利用分组查询注意力(GQA)技术,在维持 128,000 标记(token)超长上下文窗口的同时,有效降低了大规模注意力机制通常带来的内存开销。通过在推理效率与高保真输出之间取得平衡,它旨在促进从实验性原型向生产级部署的平稳过渡。
该模型经过了多阶段训练过程,包括在多样化多语言语料库上的广泛预训练,以及随后通过监督微调和偏好优化进行的对齐。其核心架构特性在于针对有据生成(grounded generation)的原生训练,使模型能够生成带有外部文档源精确行内引用的回答。这使其在检索增强生成(RAG)流水线中表现尤为出色,能够满足保持事实一致性和来源可追溯性的核心要求。此外,Command R 支持复杂的多步工具调用,使其能够作为智能体(agent)运行,通过与外部 API、数据库和软件工具交互来推理并处理复杂任务。
Command R 针对全球商业应用进行了优化,提供对 10 种语言的原生支持,并总计经过 23 种语言的训练,确保了在国际市场上的多功能性。其架构采用了旋转位置嵌入(RoPE)和层归一化(Layer Normalization)等先进组件,以确保在处理大规模输入序列时的稳定性和连贯性。通过专注于文档摘要、复杂推理和结构化数据分析等实用任务,Command R 为自动化企业系统和智能体工作流提供了可扩展的核心支撑。
注意力
注意力结构
Multi-Head Attention
注意力头
64
键值头
8
注意力头维度
-
位置嵌入
Absolute Position Embedding
RoPE Theta
-
滑动窗口注意力
-
滑动窗口大小
-
滑动窗口比例
-
线性注意力
-
线性注意力比例
-
归一化
Layer Normalization
激活函数
SwigLU
维度
隐藏维度大小
8,192
层数
40
FFN 中间层大小(稠密层)
-
多 Token 预测头数
-
分词器
词汇量大小
-
APX AI
在线