趋近智
参数
2.4T (估算)
上下文长度
1M
模态
Multimodal
架构
未公开
许可证
专有
发布日期
3 Sept 2026
训练数据截止日期
-
API 价格 (每 1M)
输入: $2.00 · 输出: $6.00
排名
#25
| 基准 | 分数 | 排名 |
|---|---|---|
Web 开发 | 1685 | 4 |
排名
#25
编程排名
#10
Qwen3.8 Max 0902 是阿里巴巴 Qwen 团队推出的 2.4 万亿参数混合专家模型 (MoE) 的更新快照。它支持文本、图像和视频输入,可在高级编程和分析任务中提供前沿的多模态推理能力。
专有模型的架构规格未公开。
注意力
注意力结构
未公开
注意力头
未公开
键值头
未公开
注意力头维度
未公开
位置嵌入
未公开
RoPE Theta
未公开
滑动窗口注意力
未公开
滑动窗口大小
未公开
滑动窗口比例
未公开
线性注意力
未公开
线性注意力比例
未公开
归一化
未公开
激活函数
未公开
维度
隐藏维度大小
未公开
层数
未公开
FFN 中间层大小(稠密层)
未公开
多 Token 预测头数
未公开
分词器
词汇量大小
未公开
阿里巴巴的 Qwen 3.8 系列代表了面向编程、专业工作、科学研究及长周期智能体任务的前沿混合专家(MoE)架构。该系列具备 2.4 万亿总参数(每个 Token 激活 950 亿参数),将门控 DeltaNet 线性注意力与标准门控注意力相结合,同时提供开源权重与托管旗舰级 API 服务。
APX AI
在线