Kimi团队发布技术报告,推出了全新的混合线性注意力架构“Kimi Linear”。该架构核心为Kimi Delta Attention (KDA)模块,通过更细粒度的门控机制扩展了Gated DeltaNet,旨在更有效地利用有限的RNN内存。团队采用了定制的分块算法,通过专门设计的对角加低秩(DPLR)转换矩阵变体,在大幅减少计算量的同时,与经典的Delta规则保持一致。实验数据显示,基于KDA和多头潜在注意力(MLA)分层混合预训练的模型(3B激活参数,总计48B参数),在短文本、长文本及强化学习等多种场景下,性能均显著优于全MLA架构。在效率方面,该架构将KV缓存使用量降低了高达75%,并在处理100万长上下文时实现了最高6倍的解码吞吐量提升。Kimi Linear证明了其可作为全注意力架构的高性能替代方案,团队已开源KDA内核、vLLM实现及相关模型检查点。
事件分析
💡 核心观点:Kimi Linear首次打破线性架构的性能瓶颈,以极致的压缩比和吞吐量为大模型的长文本商业化落地扫清了核心算力障碍。
原文链接:Hacker News





