云聚 AI Token Plan 满 199 减 35 元
port:80 AI Junkie
AI 重度玩家的工程笔记本

Kimi发布Linear新架构:首次全方位超越全注意力机制,长文本吞吐提升6倍

云聚 AI Token Plan 满 199 减 35 元

Kimi团队发布技术报告,推出了全新的混合线性注意力架构“Kimi Linear”。该架构核心为Kimi Delta Attention (KDA)模块,通过更细粒度的门控机制扩展了Gated DeltaNet,旨在更有效地利用有限的RNN内存。团队采用了定制的分块算法,通过专门设计的对角加低秩(DPLR)转换矩阵变体,在大幅减少计算量的同时,与经典的Delta规则保持一致。实验数据显示,基于KDA和多头潜在注意力(MLA)分层混合预训练的模型(3B激活参数,总计48B参数),在短文本、长文本及强化学习等多种场景下,性能均显著优于全MLA架构。在效率方面,该架构将KV缓存使用量降低了高达75%,并在处理100万长上下文时实现了最高6倍的解码吞吐量提升。Kimi Linear证明了其可作为全注意力架构的高性能替代方案,团队已开源KDA内核、vLLM实现及相关模型检查点。

事件分析

本论文标志着“线性RNN挑战Transformer”争论的一个关键转折点。此前线性注意力方案往往在性能上难以匹敌传统架构,或仅在特定超长场景占优。Kimi Linear声称在所有评估任务中均战胜全注意力,意味着线性架构在表达能力上已具备成为下一代模型基础架构的潜力。对于产业界而言,75%的KV缓存节省直接对应推理显存成本的断崖式下降,这对于长文本应用的落地至关重要。此外,Kimi通过定制化的DPLR算法实现了硬件效率的优化,表明线性架构的落地不仅依赖理论创新,更需要针对底层硬件(如NPU/GPU)的深度工程优化。开源策略将加速业界从标准Softmax注意力向高效线性混合架构的迁移。

💡 核心观点:Kimi Linear首次打破线性架构的性能瓶颈,以极致的压缩比和吞吐量为大模型的长文本商业化落地扫清了核心算力障碍。

阿里云 OPC 一人公司创业装备库

原文链接:Hacker News

阿里云函数计算 一键部署 AI 大模型
赞(0)
未经允许不得转载:80aj » Kimi发布Linear新架构:首次全方位超越全注意力机制,长文本吞吐提升6倍
赞助推荐 FreeModel.dev Claude Code 中转
阿里云函数计算 一键部署 AI 大模型