显存需求暴降!Kimi-Linear-48B优化后最低仅需4.2G显存
开发者ymcki通过引入MLA KV cache技术,成功对Kimi-Linear-48B-A3B大模型进行了极致优化。实测数据显示,在百万级上下文场景下,其F16 KV cache显存占用从140G骤降至15G。若配合KV量化技术,模型在...
标签索引
这个标签下有 1 篇文章。按时间回看相关判断与实践记录。
标签精选
开发者ymcki通过引入MLA KV cache技术,成功对Kimi-Linear-48B-A3B大模型进行了极致优化。实测数据显示,在百万级上下文场景下,其F16 KV cache显存占用从140G骤降至15G。若配合KV量化技术,模型在...