Architecture Deep-Dive · 基于 config.json + 建模源码

Kimi K3 架构全景

2.8T 参数的开放权重原生多模态模型。核心设计:Kimi Delta Attention(KDA)扛起 74% 注意力层, Gated MLA 每 4 层一枚锚定质量,Stable LatentMoE 以 1.8% 极端稀疏度扩展至 896 专家,原生支持 100 万 token 上下文与视觉输入。

总参数
2.8T
激活 / Token
104B
层数
93
专家数
896
每 Token 激活专家
16
上下文
1M
词表
160K
Hidden
7168
KimiK3ForConditionalGenerationMXFP4 量化 · 1.56TB96 shardsMoonViT-V2 · 401Mimage-text-to-text

0193 层注意力编排:KDA 主导,MLA 锚定

全部 93 层 · 悬停查看层号(左 → 右 = 第 1 层 → 第 93 层)
KDA 线性注意力 × 69(74%)Gated MLA 全注意力 × 24(26%)

节律单元放大(L1–L8 ··· L89–L93)

每 4 层 = 3 × KDA + 1 × MLA;末尾 L92、L93 连续两层全注意力收尾。第 0 层为唯一稠密层(first_k_dense_replace=1,非 MoE)。 KDA 层以 O(n) 复杂度消化长序列,MLA 层提供全局精确检索。

02两种注意力机制对照

KDA · Kimi Delta Attention

  • 线性复杂度 O(n) —— 1M 长上下文的主力
  • 实现:fla-core · chunk_kda / fused_recurrent_kda
  • 头数 96 × head_dim 128
  • 局部感知:ShortConv kernel = 4
  • 门控:full-rank gate,lower_bound = −5.0
  • 推理:维护 recurrent state,无 KV cache 膨胀

Gated MLA · 多头潜在注意力

  • 全局复杂度 O(n²) —— 质量锚点,每 4 层一次
  • KV 压缩:7168 → 512(kv_lora_rank)
  • Q 压缩:7168 → 1536(q_lora_rank)
  • 头维度:nope 128 ⊕ rope 64,v 128
  • 位置编码:RoPE + NoPE 混合(mla_use_nope)
  • 输出门控启用(mla_use_output_gate)

03Stable LatentMoE 路由结构

输入 Token(hidden 7168)
Router · sigmoid · noaux_tc(无辅助损失 top-k · grouped)
Top-16      ▼常开
894 路由专家
激活 16 个 · 每专家 hidden 3072
2 共享专家
始终参与
加权求和 · moe_renormalize · latent norm
专家激活比例(16 / 896 ≈ 1.8%,红色为激活部分)
激活 16休眠 880
LatentMoE 维度 3584路由激活 sigmoidtopk_method noaux_tclatent_moe_use_norm true(Stable 关键)较 K2 扩展效率 ↑ ~2.5×

04其余关键技术

SiTU-GLU 激活

β·tanh(g/β)·σ(g)·u
β = 4.0
u → 25·tanh(u/25)

SwiGLU 变体,tanh 引入有界性控制,抑制极端激活值。

Attention Residuals

attn_res_block_size = 12

以 12 层为块的跨注意力块残差传播,稳定 93 层深网梯度流。

MXFP4 量化

4-bit · group 32 · 对称
compressed-tensors

保留高精度:self_attn / shared_experts / lm_head / vision_tower / projector。

MoonViT-V2 视觉塔

401M · 27 层 · hidden 1024
patch 14 · heads 12

时序位置编码(time=4)支持视频;PatchMergerV2 → 7168 接入文本塔。

05血缘演进

DeepSeek-V3
MLA + MoE 模块改编(modeling_kimi_linear.py 头部含 Apache-2.0 声明)
Kimi K2 · 1T · MLA 主导
74% 注意力层换为 KDA · Stable LatentMoE · SiTU-GLU · AttnRes
Kimi K3 · 2.8T / 激活 104B / 1M ctx

06config.json 关键参数总表

类别参数
文本塔hidden_size / intermediate_size7168 / 33792
num_hidden_layers(稠密层)93(1)
注意力构成69 KDA + 24 Gated MLA
num_attention_heads / kv_heads96 / 96(无 GQA)
max_position_embeddings1,048,576
vocab_size / 分词器163,840 / TikToken
MoEnum_experts(shared)896(2)
num_experts_per_token16
moe_intermediate_size / latent 维度3072 / 3584
router / topksigmoid / noaux_tc · grouped
MLAkv_lora_rank / q_lora_rank512 / 1536
qk_nope / qk_rope / v head_dim128 / 64 / 128
full_attn_layers4,8,12,…,88,92,93
KDAshort_conv_kernel / gate4 / full-rank, lower −5.0
算子chunk_kda / fused_recurrent_kda
视觉MoonViT-V227 层 · 1024 · patch 14 · merge 2×2
量化MXFP4num_bits 4 · group 32 · 96 shards ≈ 1.56TB