Parameters
2.4T (Estimated)
Context Length
1M
Modality
Multimodal
Architecture
Undisclosed
License
Proprietary
Release Date
3 Sept 2026
Knowledge Cutoff
-
API Pricing (per 1M)
Input: $2.00 · Output: $6.00
Rank
#25
| Benchmark | Score | Rank |
|---|---|---|
Web Development | 1685 | 4 |
Overall Rank
#25
Coding Rank
#10
Qwen3.8 Max 0902 is an updated 2.4-trillion parameter mixture-of-experts snapshot from Alibaba's Qwen team. It delivers frontier multimodal reasoning across text, image, and video inputs for advanced coding and analysis.
Architecture specifications are undisclosed for proprietary models.
Attention
Attention Structure
Undisclosed
Attention Heads
Undisclosed
Key-Value Heads
Undisclosed
Attention Head Dimension
Undisclosed
Position Embedding
Undisclosed
RoPE Theta
Undisclosed
Sliding Window Attention
Undisclosed
Sliding Window Size
Undisclosed
Sliding Window Ratio
Undisclosed
Linear Attention
Undisclosed
Linear Attention Ratio
Undisclosed
Normalization
Undisclosed
Activation Function
Undisclosed
Dimensions
Hidden Dimension Size
Undisclosed
Number of Layers
Undisclosed
FFN Intermediate Size (Dense)
Undisclosed
Multi-Token Prediction Heads
Undisclosed
Tokenizer
Vocabulary Size
Undisclosed
Alibaba's Qwen 3.8 generation represents the frontier hybrid Mixture-of-Experts architecture designed for coding, professional work, research, and long-horizon agentic tasks. It features a 2.4-trillion parameter architecture (95B active per token) combining Gated DeltaNet linear attention with standard Gated Attention, available both as open weights and as a hosted flagship service.
APX AI
Online