趋近智
活跃参数
560B (估算)
上下文长度
32K
模态
Text
架构
Mixture of Experts (MoE)
许可证
专有
发布日期
16 Jul 2025
训练数据截止日期
Dec 2024
API 价格 (每 1M)
输入: $0.11 · 输出: $0.28
排名
#90
| 基准 | 分数 | 排名 |
|---|---|---|
通用文本 | 1383 | 106 |
排名
#90
编程排名
-
腾讯混元-TurboS(Tencent Hunyuan-TurboS)是一款高性能大语言模型,旨在优化计算效率与复杂推理之间的权衡。通过集成自适应长短思维链(CoT)机制,该模型能够动态调整其认知开销:在处理直觉性查询时采用极速的“快思考”模式,而在应对复杂任务时则切换至更严谨的分析模式。这种双路径方法使模型在保持 STEM、编程和数学解题所需的逻辑深度的同时,能够为常规交互提供近乎瞬时的响应。
在架构方面,Hunyuan-TurboS 引入了 Transformer-Mamba2 混合专家(MoE)混合框架,标志着大规模状态空间模型集成技术的进步。该结构包含 128 层,采用交错的 AMF(Attention-Mamba2-FFN)和 MF(Mamba2-FFN)块模式。这种融合架构利用 Mamba2 层实现长序列的线性扩展,并结合分组查询注意力(GQA)技术以最小化 KV 缓存(KV-Cache)的显存占用。模型的前馈网络(FFN)采用了包含 32 个专家的 MoE 设计,每个 token 会激活一个共享专家和两个专用专家,从而在优化计算开销的同时保持极高的模型容量。
Hunyuan-TurboS 专为企业级扩展性打造,支持 256,000 token 的超长上下文窗口,并经过 16 万亿高质量 token 海量语料库的预训练。其后训练阶段包括 300 万条指令的有监督微调,以及侧重于提升 STEM 准确性和通用指令遵循能力的多阶段强化学习。这些特性使 Hunyuan-TurboS 能够胜任实时对话智能体、大规模文档分析以及对延迟和成本效益有严苛要求的复杂推理任务等高吞吐量应用场景。
专有模型的架构规格未公开。
注意力
注意力结构
Multi-Head Attention
注意力头
64
键值头
8
注意力头维度
未公开
位置嵌入
Absolute Position Embedding
RoPE Theta
未公开
滑动窗口注意力
未公开
滑动窗口大小
未公开
滑动窗口比例
未公开
线性注意力
未公开
线性注意力比例
未公开
归一化
RMS Normalization
激活函数
SwigLU
维度
隐藏维度大小
5,120
层数
128
FFN 中间层大小(稠密层)
未公开
多 Token 预测头数
未公开
分词器
词汇量大小
未公开
混合专家
专家参数总数
56.0B
专家数量
32
活跃专家
3
共享专家数
未公开
FFN 中间层大小(每专家)
未公开
MoE 前的稠密层数
未公开
具备多种能力的腾讯混元大语言模型。
APX AI
在线