ApX logoApX logo

Llama 3.3 70B

Parameters

70B

Context Length

130K

Modality

Text

Architecture

Dense

License

Llama 3.3 Community License

Release Date

7 Dec 2024

Knowledge Cutoff

Dec 2023

API Pricing (per 1M)

Input: $0.66 · Output: $0.72

System Requirements

VRAM requirements for different quantization methods and context sizes

1,024 tokens

148.85 GB VRAM

Consumer

7x RTX 4090

24GB VRAM

Datacenter

2x NVIDIA A100

80GB VRAM

Apple Silicon

2x Apple M3 Max

128GB VRAM

130,000 tokens

193.23 GB VRAM

Consumer

10x RTX 4090

24GB VRAM

Datacenter

3x NVIDIA A100

80GB VRAM

Apple Silicon

2x Apple M3 Max

128GB VRAM

Architecture Diagram

Input TokensToken EmbeddingPosition: RoPEHidden: 8.2k · Context: 130K · Vocab: 128.3kx 80 layersRMSNormPre-AttentionGrouped-Query Attention64Q / 8KV headsHead dim: 128+RMSNormPre-FFNFeed-Forward NetworkSwiGLUIntermediate: 28.7k+Final RMSNormOutput Logits

Evaluation Benchmarks

Rank

#132

BenchmarkScoreRank

Professional Knowledge

MMLU Pro

0.689

36

Graduate-Level QA

GPQA

0.505

88

General Text

Text Arena

1317

118

0.12

128

Intelligence Index

Artificial Analysis

0.08

212

General Knowledge

Reference
MMLU

0.86

9

StackEval

Archived
ProLLM Stack Eval

0.848

12

QA Assistant

Archived
ProLLM QA Assistant

0.895

15

Summarization

Archived
ProLLM Summarization

0.681

22

Rankings

Overall Rank

#132

Coding Rank

#121

About Llama 3.3 70B

Llama 3.3 70B is Meta's cost-efficient dense transformer model delivering 405B-class conversational and coding performance in a 70B footprint. It supports multilingual chat across 8 languages and tool integration over a 130K context window.

Technical Specifications

Attention

Attention Structure

Grouped-Query Attention

Attention Heads

64

Key-Value Heads

8

Attention Head Dimension

128

Position Embedding

ROPE

RoPE Theta

500,000

Sliding Window Attention

No

Sliding Window Size

-

Sliding Window Ratio

-

Linear Attention

-

Linear Attention Ratio

-

Normalization

RMS Normalization

Activation Function

SwigLU

Dimensions

Hidden Dimension Size

8,192

Number of Layers

80

FFN Intermediate Size (Dense)

28,672

Multi-Token Prediction Heads

-

Tokenizer

Vocabulary Size

128,256

About Llama 3.3

Meta's Llama 3.3 is a 70 billion parameter, multilingual large language model. It utilizes an optimized transformer architecture, incorporating Grouped-Query Attention for enhanced inference efficiency. The model features an extended 128k token context window and is designed to support quantization, facilitating deployment on varied hardware configurations.


Other Llama 3.3 Models
  • No related models available