ApX 标志ApX 标志

趋近智

Hunyuan TurboS

活跃参数

560B (估算)

上下文长度

32K

模态

Text

架构

Mixture of Experts (MoE)

许可证

专有

发布日期

16 Jul 2025

训练数据截止日期

Dec 2024

API 价格 (每 1M)

输入: $0.11 · 输出: $0.28

评估基准

排名

#90

基准分数排名

通用文本

Text Arena

1383

106

排名

排名

#90

编程排名

-

关于 Hunyuan TurboS

腾讯混元-TurboS(Tencent Hunyuan-TurboS)是一款高性能大语言模型,旨在优化计算效率与复杂推理之间的权衡。通过集成自适应长短思维链(CoT)机制,该模型能够动态调整其认知开销:在处理直觉性查询时采用极速的“快思考”模式,而在应对复杂任务时则切换至更严谨的分析模式。这种双路径方法使模型在保持 STEM、编程和数学解题所需的逻辑深度的同时,能够为常规交互提供近乎瞬时的响应。

在架构方面,Hunyuan-TurboS 引入了 Transformer-Mamba2 混合专家(MoE)混合框架,标志着大规模状态空间模型集成技术的进步。该结构包含 128 层,采用交错的 AMF(Attention-Mamba2-FFN)和 MF(Mamba2-FFN)块模式。这种融合架构利用 Mamba2 层实现长序列的线性扩展,并结合分组查询注意力(GQA)技术以最小化 KV 缓存(KV-Cache)的显存占用。模型的前馈网络(FFN)采用了包含 32 个专家的 MoE 设计,每个 token 会激活一个共享专家和两个专用专家,从而在优化计算开销的同时保持极高的模型容量。

Hunyuan-TurboS 专为企业级扩展性打造,支持 256,000 token 的超长上下文窗口,并经过 16 万亿高质量 token 海量语料库的预训练。其后训练阶段包括 300 万条指令的有监督微调,以及侧重于提升 STEM 准确性和通用指令遵循能力的多阶段强化学习。这些特性使 Hunyuan-TurboS 能够胜任实时对话智能体、大规模文档分析以及对延迟和成本效益有严苛要求的复杂推理任务等高吞吐量应用场景。

技术规格

专有模型的架构规格未公开。

注意力

注意力结构

Multi-Head Attention

注意力头

64

键值头

8

注意力头维度

未公开

位置嵌入

Absolute Position Embedding

RoPE Theta

未公开

滑动窗口注意力

未公开

滑动窗口大小

未公开

滑动窗口比例

未公开

线性注意力

未公开

线性注意力比例

未公开

归一化

RMS Normalization

激活函数

SwigLU

维度

隐藏维度大小

5,120

层数

128

FFN 中间层大小(稠密层)

未公开

多 Token 预测头数

未公开

分词器

词汇量大小

未公开

混合专家

专家参数总数

56.0B

专家数量

32

活跃专家

3

共享专家数

未公开

FFN 中间层大小(每专家)

未公开

MoE 前的稠密层数

未公开