DC娱乐网

Kimi 的 Linear Attention(KLA)架构与数学原理大致是:线

Kimi 的 Linear Attention(KLA)架构与数学原理大致是:线性 Transformer 相比常规 Transformer,计算量能少几百甚至几千倍;再加上线性 Transformer 本身也在不断被优化,能力虽仍略逊一筹,但已经逼近常规 Transformer。所以 Kimi 采用了混合注意力机制。

• 线性 Transformer:关注的 token 范围偏局部,但计算量只有常规版的几百分之一到几千分之一。

• 常规 Transformer:计算量大,但能做真正的全局建模。

因此 Kimi 的做法是:

75% 线性 Attention(KLA) —— 负责模型压缩、加速,以及对 token 的局部观察

25% 常规 Attention —— 负责 token 的全局观察

在"算力开销"和"建模能力"之间把收益拉到最大。

——————————一个台湾人写的,还补充了一句:文中筆誤常規transformer 是除以根號d_k,誤寫成k