DC娱乐网

Kimi K3技术报告:KDA、MoE与AgentRL全拆解

昨天 Kimi K3 发布了技术报告,其中很亮眼的是这三个数字:2.8T 总参数、104B 激活参数、100 万 token 上下文。

这些数字说明 K3 同时拉大了模型容量、单次激活规模和上下文长度。报告接下来要回答的是:规模扩大以后,训练和运行怎样保持稳定。

需要关注的技术点:
1️⃣Kimi K3 的总框架:K3 用三类模块扩展三种信息流:Hybrid KDA–MLA 处理序列长度,Block AttnRes 处理网络深度,Stable LatentMoE 处理通道宽度,MoonViT-V2 把视觉输入并入统一 next-token 目标。
2️⃣机制:每个 block 是 3 层 KDA + 1 层 Gated MLA;KDA 用固定尺寸递归状态压缩历史,MLA 周期性恢复全局交互。AttnRes 用 learned pseudo-query 选择性读取历史 block。MoE 在 3584 维 latent space 中从 896 个专家激活 16 个。
3️⃣稳定性:KDA 用 lower-bounded decay 控制 BF16 数值范围;MoE 用 RMSNorm、SiTU-GLU 和 Quantile Balancing 处理激活与负载;MoonViT-V2 从零接受 next-token prediction,梯度比 SigLIP 初始化基线更稳定。
4️⃣系统边界:1M Agent RL 依赖 partial rollout、外部 KV-cache、动态调度和可恢复 microVM sandbox。窗口、模型、Harness、Verifier 与基础设施要一起看。