ApX 标志ApX 标志

趋近智

Inkling-Small

活跃参数

276B

上下文长度

1.05M

模态

Multimodal

架构

Mixture of Experts (MoE)

许可证

Apache 2.0

发布日期

30 Jul 2026

训练数据截止日期

-

系统要求

不同量化方法和上下文大小的显存要求

1024 个令牌

581.28 GB VRAM

消费级

31x RTX 4090

24GB VRAM

数据中心

9x NVIDIA A100

80GB VRAM

Apple Silicon

7x Apple M3 Max

128GB VRAM

1048576 个令牌

770.51 GB VRAM

消费级

43x RTX 4090

24GB VRAM

数据中心

12x NVIDIA A100

80GB VRAM

Apple Silicon

9x Apple M3 Max

128GB VRAM

架构图

Input TokensToken EmbeddingPosition: RelativeHidden: 4.1k · Context: 1.05M · Vocab: 201kx 42 layersRMSNormPre-AttentionMulti-Head Attention32Q / 8KV heads · SW: 512Head dim: 128+RMSNormPre-FFNSparse MoE FFN (6/128 experts)ActivationIntermediate: 2k+Final RMSNormOutput Logits

评估基准

没有可用的 Inkling-Small 评估基准。

排名

排名

-

编程排名

-

关于 Inkling-Small

Inkling-Small 是由 Thinking Machine Labs 开发的开源 276B 混合专家(MoE)多模态基础模型,每个 Token 仅激活 120 亿(12B)参数。该模型基于 45 万亿多模态 Token 进行预训练,原生支持文本、图像与音频输入,配备高达 100 万(1M)Token 的上下文窗口、可控思考深度以及滑动窗口注意力机制,在大幅降低推理延迟与显存开销的同时,性能逼近甚至在部分基准上超越 975B 的 Inkling 旗舰模型。

技术规格

注意力

注意力结构

Multi-Head Attention

注意力头

32

键值头

8

注意力头维度

128

位置嵌入

Relative Position Embedding

RoPE Theta

-

滑动窗口注意力

Yes

滑动窗口大小

512

滑动窗口比例

83.3%

线性注意力

No

线性注意力比例

-

归一化

RMS Normalization

激活函数

-

维度

隐藏维度大小

4,096

层数

42

FFN 中间层大小(稠密层)

-

多 Token 预测头数

-

分词器

词汇量大小

201,024

混合专家

专家参数总数

12.0B

专家数量

128

活跃专家

6

共享专家数

2

FFN 中间层大小(每专家)

2,048

MoE 前的稠密层数

-

关于 Inkling

Inkling is a family of open-weights multimodal Mixture-of-Experts (MoE) models developed by Thinking Machine Labs.


其他 Inkling 模型