2.8T 参数的开放权重原生多模态模型。核心设计:Kimi Delta Attention(KDA)扛起 74% 注意力层, Gated MLA 每 4 层一枚锚定质量,Stable LatentMoE 以 1.8% 极端稀疏度扩展至 896 专家,原生支持 100 万 token 上下文与视觉输入。
每 4 层 = 3 × KDA + 1 × MLA;末尾 L92、L93 连续两层全注意力收尾。第 0 层为唯一稠密层(first_k_dense_replace=1,非 MoE)。 KDA 层以 O(n) 复杂度消化长序列,MLA 层提供全局精确检索。
SwiGLU 变体,tanh 引入有界性控制,抑制极端激活值。
以 12 层为块的跨注意力块残差传播,稳定 93 层深网梯度流。
保留高精度:self_attn / shared_experts / lm_head / vision_tower / projector。
时序位置编码(time=4)支持视频;PatchMergerV2 → 7168 接入文本塔。
| 类别 | 参数 | 值 |
|---|---|---|
| 文本塔 | hidden_size / intermediate_size | 7168 / 33792 |
| num_hidden_layers(稠密层) | 93(1) | |
| 注意力构成 | 69 KDA + 24 Gated MLA | |
| num_attention_heads / kv_heads | 96 / 96(无 GQA) | |
| max_position_embeddings | 1,048,576 | |
| vocab_size / 分词器 | 163,840 / TikToken | |
| MoE | num_experts(shared) | 896(2) |
| num_experts_per_token | 16 | |
| moe_intermediate_size / latent 维度 | 3072 / 3584 | |
| router / topk | sigmoid / noaux_tc · grouped | |
| MLA | kv_lora_rank / q_lora_rank | 512 / 1536 |
| qk_nope / qk_rope / v head_dim | 128 / 64 / 128 | |
| full_attn_layers | 4,8,12,…,88,92,93 | |
| KDA | short_conv_kernel / gate | 4 / full-rank, lower −5.0 |
| 算子 | chunk_kda / fused_recurrent_kda | |
| 视觉 | MoonViT-V2 | 27 层 · 1024 · patch 14 · merge 2×2 |
| 量化 | MXFP4 | num_bits 4 · group 32 · 96 shards ≈ 1.56TB |