趋近智
活跃参数
2.4T
上下文长度
1M
模态
Multimodal
架构
Mixture of Experts (MoE)
许可证
Proprietary
发布日期
2 Aug 2026
训练数据截止日期
-
没有可用的 Qwen3.8 Max 评估基准。
排名
-
编程排名
-
Qwen3.8-Max 是阿里云基于 2.4 万亿参数(95B 激活)混合专家架构构建的托管旗舰级大模型。采用门控 DeltaNet 线性注意力与标准门控注意力的混合设计,具备原生视觉输入能力、默认 100 万 token 上下文窗口、思考与非思考模式切换,以及面向复杂软件工程、科研复现与长周期自主任务的内置智能体工具链。
注意力
注意力结构
Grouped-Query Attention
注意力头
64
键值头
4
注意力头维度
256
位置嵌入
ROPE
RoPE Theta
10,000,000
滑动窗口注意力
No
滑动窗口大小
-
滑动窗口比例
-
线性注意力
Yes
线性注意力比例
75.0%
归一化
RMS Normalization
激活函数
SwigLU
维度
隐藏维度大小
8,192
层数
92
FFN 中间层大小(稠密层)
2,048
多 Token 预测头数
1
分词器
词汇量大小
248,320
混合专家
专家参数总数
95.0B
专家数量
512
活跃专家
11
共享专家数
1
FFN 中间层大小(每专家)
2,048
MoE 前的稠密层数
-
阿里巴巴的 Qwen 3.8 系列代表了面向编程、专业工作、科学研究及长周期智能体任务的前沿混合专家(MoE)架构。该系列具备 2.4 万亿总参数(每个 Token 激活 950 亿参数),将门控 DeltaNet 线性注意力与标准门控注意力相结合,同时提供开源权重与托管旗舰级 API 服务。
APX AI
在线