ApX logoApX logo

Step 3.7 Flash

Active Parameters

198B (Estimated)

Context Length

Undisclosed

Modality

Text

Architecture

Mixture of Experts (MoE)

License

Proprietary

Release Date

28 May 2026

Knowledge Cutoff

-

API Pricing (per 1M)

Input: $0.20 · Output: $1.15

Evaluation Benchmarks

Rank

#108

BenchmarkScoreRank

Agentic Index

Artificial Analysis

0.22

69

0.40

98

Intelligence Index

Artificial Analysis

0.20

122

Rankings

Overall Rank

#108

Coding Rank

#85

About Step 3.7 Flash

StepFun's high-speed specialized model released May 28, 2026, engineered for rapid real-time multilingual tasks, low-latency agent coordination, and fast conversational inference. Optimized for speed-first deployments where sub-second response times and broad language coverage are paramount, Step 3.7 Flash serves as a lightweight backbone for multilingual pipelines, real-time translation workflows, and latency-sensitive multi-agent coordination tasks.

Technical Specifications

Architecture specifications are undisclosed for proprietary models.

Attention

Attention Structure

Multi-Head Attention

Attention Heads

Undisclosed

Key-Value Heads

Undisclosed

Attention Head Dimension

Undisclosed

Position Embedding

Absolute Position Embedding

RoPE Theta

Undisclosed

Sliding Window Attention

Undisclosed

Sliding Window Size

Undisclosed

Sliding Window Ratio

Undisclosed

Linear Attention

Undisclosed

Linear Attention Ratio

Undisclosed

Normalization

Undisclosed

Activation Function

Undisclosed

Dimensions

Hidden Dimension Size

Undisclosed

Number of Layers

Undisclosed

FFN Intermediate Size (Dense)

Undisclosed

Multi-Token Prediction Heads

Undisclosed

Tokenizer

Vocabulary Size

Undisclosed

Mixture of Experts

Total Expert Parameters

11.0B

Number of Experts

Undisclosed

Active Experts

Undisclosed

Shared Experts

Undisclosed

FFN Intermediate Size (per Expert)

Undisclosed

Dense Layers Before MoE

Undisclosed

About Step 3.7

StepFun's Step 3.7 generation focuses on high-speed, specialized inference for real-time multilingual tasks, rapid agent coordination, and low-latency conversational applications. The Flash tier is optimized for speed-first deployments where rapid response time and multilingual versatility are the primary requirements.


Other Step 3.7 Models
  • No related models available
Step 3.7 Flash: Model Specifications and Details