ApX 标志ApX 标志

趋近智

Hunyuan T1

活跃参数

70B (估算)

上下文长度

32K

模态

Text

架构

Mixture of Experts (MoE)

许可证

专有

发布日期

22 Aug 2025

训练数据截止日期

Dec 2024

API 价格 (每 1M)

输入: $0.14 · 输出: $0.56

评估基准

排名

#86

基准分数排名

通用文本

Text Arena

1387

104

排名

排名

#86

编程排名

-

关于 Hunyuan T1

腾讯混元 T1 是一款专为深度分析任务、逻辑问题解决和高级科学探究而设计的高性能推理模型。作为混元生态系统中的核心“慢思考”推理引擎,它旨在通过强化结构化逻辑和长文本一致性,与当前最先进的模型竞争。该模型基于 TurboS 基座构建,标志着架构上的重大转变,即将状态空间模型集成到大规模生产环境中,以显著提升计算效率。

混元 T1 的技术基础是混合 Transformer-Mamba 混合专家 (MoE) 架构。该设计结合了用于全局上下文感知的 Transformer 块与提供线性扩展能力和卓越序列建模内存效率的 Mamba-2 状态空间层。模型共包含 16 个专家,通过动态路由为每个 Token 激活约 520 亿个参数。这种混合方案专门用于缓解传统注意力机制的平方复杂度问题,使模型在支持高达 256,000 个 Token 上下文长度的同时,保持比同类稠密 Transformer 模型快约两倍的解码速度。

在运行优化方面,混元 T1 采用了一套高度侧重于大规模强化学习的后训练方案,超过 96% 的计算资源被投入到该阶段。它利用课程学习来逐步提升推理复杂度,并采用跨层注意力 (CLA) 机制以进一步降低推理时的内存开销。这些技术创新使其非常适合处理复杂的代码生成、数学定理证明及多步逻辑推演等企业级任务,在这些领域中,高精度和低上下文损耗至关重要。

技术规格

专有模型的架构规格未公开。

注意力

注意力结构

Multi-Head Attention

注意力头

未公开

键值头

未公开

注意力头维度

未公开

位置嵌入

Absolute Position Embedding

RoPE Theta

未公开

滑动窗口注意力

未公开

滑动窗口大小

未公开

滑动窗口比例

未公开

线性注意力

未公开

线性注意力比例

未公开

归一化

RMS Normalization

激活函数

SwigLU

维度

隐藏维度大小

未公开

层数

128

FFN 中间层大小(稠密层)

未公开

多 Token 预测头数

未公开

分词器

词汇量大小

未公开

混合专家

专家参数总数

52.0B

专家数量

16

活跃专家

2

共享专家数

未公开

FFN 中间层大小(每专家)

未公开

MoE 前的稠密层数

未公开