Parameters
Undisclosed
Context Length
Undisclosed
Modality
Multimodal
Architecture
Undisclosed
License
Proprietary
Release Date
19 May 2026
Knowledge Cutoff
-
API Pricing (per 1M)
-
No evaluation benchmarks for Gemini Omni Flash available.
Overall Rank
-
Coding Rank
-
The first model in Google's new Omni family, released at Google I/O on May 19, 2026. Gemini Omni Flash is a native video-generation model that accepts any combination of text, images, audio, and video as input and produces high-quality video output grounded in Gemini's real-world knowledge. It enables conversational video editing across multiple turns - maintaining character consistency, physics, and scene continuity, and supports Avatars for personalized video creation. Rolled out to Google AI Plus, Pro, and Ultra subscribers globally through the Gemini app and Google Flow.
Architecture specifications are undisclosed for proprietary models.
Attention
Attention Structure
Multi-Head Attention
Attention Heads
Undisclosed
Key-Value Heads
Undisclosed
Attention Head Dimension
Undisclosed
Position Embedding
Absolute Position Embedding
RoPE Theta
Undisclosed
Sliding Window Attention
Undisclosed
Sliding Window Size
Undisclosed
Sliding Window Ratio
Undisclosed
Linear Attention
Undisclosed
Linear Attention Ratio
Undisclosed
Normalization
Undisclosed
Activation Function
Undisclosed
Dimensions
Hidden Dimension Size
Undisclosed
Number of Layers
Undisclosed
FFN Intermediate Size (Dense)
Undisclosed
Multi-Token Prediction Heads
Undisclosed
Tokenizer
Vocabulary Size
Undisclosed
The Gemini Omni family is Google's first generation of native video-generation models, combining Gemini's multimodal reasoning with the ability to create from any input. Announced at Google I/O 2026, Omni models accept combinations of text, images, audio, and video, allowing users to generate and conversationally edit high-quality videos grounded in Gemini's real-world knowledge.
APX AI
Online