ApX logoApX logo

Kimi-Dev-72B

Parameters

72B

Context Length

131K

Modality

Text

Architecture

Dense

License

MIT License

Release Date

16 Jun 2025

Knowledge Cutoff

-

API Pricing (per 1M)

Input: $0.29 · Output: $1.15

System Requirements

VRAM requirements for different quantization methods and context sizes

1,024 tokens

153.05 GB VRAM

Consumer

8x RTX 4090

24GB VRAM

Datacenter

3x NVIDIA A100

80GB VRAM

Apple Silicon

2x Apple M3 Max

128GB VRAM

131,072 tokens

197.80 GB VRAM

Consumer

10x RTX 4090

24GB VRAM

Datacenter

3x NVIDIA A100

80GB VRAM

Apple Silicon

2x Apple M3 Max

128GB VRAM

Architecture Diagram

Input TokensToken EmbeddingPosition: AbsoluteHidden: 8.2k · Context: 131K · Vocab: 152.1kx 80 layersRMSNormPre-AttentionMulti-Head Attention64Q / 8KV headsHead dim: 128+RMSNormPre-FFNFeed-Forward NetworkSwiGLUIntermediate: 29.6k+Final RMSNormOutput Logits

Evaluation Benchmarks

No evaluation benchmarks for Kimi-Dev-72B available.

Rankings

Overall Rank

-

Coding Rank

-

About Kimi-Dev-72B

Kimi-Dev-72B is an open-weights software engineering model by Moonshot AI built on Qwen2.5-72B and fine-tuned for autonomous issue resolution. Utilizing a dual BugFixer/TestWriter architecture, it specializes in codebase localization and verified code patches.

Technical Specifications

Attention

Attention Structure

Multi-Head Attention

Attention Heads

64

Key-Value Heads

8

Attention Head Dimension

-

Position Embedding

Absolute Position Embedding

RoPE Theta

1,000,000

Sliding Window Attention

No

Sliding Window Size

131,072

Sliding Window Ratio

-

Linear Attention

-

Linear Attention Ratio

-

Normalization

RMS Normalization

Activation Function

SwigLU

Dimensions

Hidden Dimension Size

8,192

Number of Layers

80

FFN Intermediate Size (Dense)

29,568

Multi-Token Prediction Heads

-

Tokenizer

Vocabulary Size

152,064

About Kimi

Moonshot AI's Kimi model family, exemplified by Kimi K2, employs a Mixture-of-Experts architecture with one trillion total parameters. Designed for natural language generation and agentic capabilities, it features a 128K token context window. The models are open-weight and optimized with the Muon optimizer for stable training.


Other Kimi Models
  • No related models available