ApX logoApX logo

GPT-4o

Parameters

200B (Estimated)

Context Length

128K

Modality

Multimodal

Architecture

Undisclosed

License

Proprietary

Release Date

13 May 2024

Knowledge Cutoff

Oct 2023

API Pricing (per 1M)

Input: $5.00 · Output: $15.00

Evaluation Benchmarks

Rank

#118

BenchmarkScoreRank

Professional Knowledge

MMLU Pro

0.747

27

Software Engineering

SWE-bench Verified

0.39

32

Graduate-Level QA

GPQA

0.701

70

0.24

113

General Text

Text Arena

1346

122

Intelligence Index

Artificial Analysis

0.09

178

Refactoring

Archived
Aider Refactoring

0.63

🥇

1

StackEval

Archived
ProLLM Stack Eval

0.961

4

General Knowledge

Reference
MMLU

0.887

4

QA Assistant

Archived
ProLLM QA Assistant

0.956

8

Summarization

Archived
ProLLM Summarization

0.753

15

Coding

Archived
Aider Coding

0.45

16

Rankings

Overall Rank

#118

Coding Rank

#103

About GPT-4o

GPT-4o is OpenAI's flagship omni-modal model combining text, vision, and audio in a unified architecture. Features real-time responsiveness with superior performance across diverse tasks including reasoning, coding, multilingual understanding, and creative writing. Offers 128K context window with efficient token usage. Represents significant advancement in multimodal AI with seamless integration of different modalities for natural human-computer interaction.

Technical Specifications

Architecture specifications are undisclosed for proprietary models.

Attention

Attention Structure

Multi-Head Attention

Attention Heads

Undisclosed

Key-Value Heads

Undisclosed

Attention Head Dimension

Undisclosed

Position Embedding

Absolute Position Embedding

RoPE Theta

Undisclosed

Sliding Window Attention

Undisclosed

Sliding Window Size

Undisclosed

Sliding Window Ratio

Undisclosed

Linear Attention

Undisclosed

Linear Attention Ratio

Undisclosed

Normalization

Undisclosed

Activation Function

Undisclosed

Dimensions

Hidden Dimension Size

Undisclosed

Number of Layers

Undisclosed

FFN Intermediate Size (Dense)

Undisclosed

Multi-Token Prediction Heads

Undisclosed

Tokenizer

Vocabulary Size

Undisclosed

About GPT-4o

GPT-4o ("o" for "omni") is OpenAI's flagship multimodal model combining text, vision, and audio understanding in a unified architecture. Features real-time responsiveness, superior multilingual capabilities, and enhanced reasoning. Represents the evolution of the GPT-4 series with improved efficiency and broader modality support.


Other GPT-4o Models
  • No related models available