趋近智
活跃参数
70B (估算)
上下文长度
32K
模态
Text
架构
Mixture of Experts (MoE)
许可证
专有
发布日期
22 Aug 2025
训练数据截止日期
Dec 2024
API 价格 (每 1M)
输入: $0.14 · 输出: $0.56
排名
#86
| 基准 | 分数 | 排名 |
|---|---|---|
通用文本 | 1387 | 104 |
排名
#86
编程排名
-
腾讯混元 T1 是一款专为深度分析任务、逻辑问题解决和高级科学探究而设计的高性能推理模型。作为混元生态系统中的核心“慢思考”推理引擎,它旨在通过强化结构化逻辑和长文本一致性,与当前最先进的模型竞争。该模型基于 TurboS 基座构建,标志着架构上的重大转变,即将状态空间模型集成到大规模生产环境中,以显著提升计算效率。
混元 T1 的技术基础是混合 Transformer-Mamba 混合专家 (MoE) 架构。该设计结合了用于全局上下文感知的 Transformer 块与提供线性扩展能力和卓越序列建模内存效率的 Mamba-2 状态空间层。模型共包含 16 个专家,通过动态路由为每个 Token 激活约 520 亿个参数。这种混合方案专门用于缓解传统注意力机制的平方复杂度问题,使模型在支持高达 256,000 个 Token 上下文长度的同时,保持比同类稠密 Transformer 模型快约两倍的解码速度。
在运行优化方面,混元 T1 采用了一套高度侧重于大规模强化学习的后训练方案,超过 96% 的计算资源被投入到该阶段。它利用课程学习来逐步提升推理复杂度,并采用跨层注意力 (CLA) 机制以进一步降低推理时的内存开销。这些技术创新使其非常适合处理复杂的代码生成、数学定理证明及多步逻辑推演等企业级任务,在这些领域中,高精度和低上下文损耗至关重要。
专有模型的架构规格未公开。
注意力
注意力结构
Multi-Head Attention
注意力头
未公开
键值头
未公开
注意力头维度
未公开
位置嵌入
Absolute Position Embedding
RoPE Theta
未公开
滑动窗口注意力
未公开
滑动窗口大小
未公开
滑动窗口比例
未公开
线性注意力
未公开
线性注意力比例
未公开
归一化
RMS Normalization
激活函数
SwigLU
维度
隐藏维度大小
未公开
层数
128
FFN 中间层大小(稠密层)
未公开
多 Token 预测头数
未公开
分词器
词汇量大小
未公开
混合专家
专家参数总数
52.0B
专家数量
16
活跃专家
2
共享专家数
未公开
FFN 中间层大小(每专家)
未公开
MoE 前的稠密层数
未公开
具备多种能力的腾讯混元大语言模型。
APX AI
在线