ApX 标志ApX 标志

趋近智

Qwen3.8 Max

活跃参数

2.4T

上下文长度

1M

模态

Multimodal

架构

Mixture of Experts (MoE)

许可证

Proprietary

发布日期

2 Aug 2026

训练数据截止日期

-

评估基准

没有可用的 Qwen3.8 Max 评估基准。

排名

排名

-

编程排名

-

关于 Qwen3.8 Max

Qwen3.8-Max 是阿里云基于 2.4 万亿参数(95B 激活)混合专家架构构建的托管旗舰级大模型。采用门控 DeltaNet 线性注意力与标准门控注意力的混合设计,具备原生视觉输入能力、默认 100 万 token 上下文窗口、思考与非思考模式切换,以及面向复杂软件工程、科研复现与长周期自主任务的内置智能体工具链。

技术规格

注意力

注意力结构

Grouped-Query Attention

注意力头

64

键值头

4

注意力头维度

256

位置嵌入

ROPE

RoPE Theta

10,000,000

滑动窗口注意力

No

滑动窗口大小

-

滑动窗口比例

-

线性注意力

Yes

线性注意力比例

75.0%

归一化

RMS Normalization

激活函数

SwigLU

维度

隐藏维度大小

8,192

层数

92

FFN 中间层大小(稠密层)

2,048

多 Token 预测头数

1

分词器

词汇量大小

248,320

混合专家

专家参数总数

95.0B

专家数量

512

活跃专家

11

共享专家数

1

FFN 中间层大小(每专家)

2,048

MoE 前的稠密层数

-

关于 Qwen 3.8

阿里巴巴的 Qwen 3.8 系列代表了面向编程、专业工作、科学研究及长周期智能体任务的前沿混合专家(MoE)架构。该系列具备 2.4 万亿总参数(每个 Token 激活 950 亿参数),将门控 DeltaNet 线性注意力与标准门控注意力相结合,同时提供开源权重与托管旗舰级 API 服务。


其他 Qwen 3.8 模型