开发者ymcki通过引入MLA KV cache技术,成功对Kimi-Linear-48B-A3B大模型进行了极致优化。实测数据显示,在百万级上下文场景下,其F16 KV cache显存占用从140G骤降至15G。若配合KV量化技术,模型在保证性能的同时,显存门槛最低可降至4.2GB。这一突破使得普通消费级显卡甚至轻薄本也能流畅运行480亿参数的大模型,极大降低了本地部署AI的硬件成本。
显存需求暴降!Kimi-Linear-48B优化后最低仅需4.2G显存
未经允许不得转载:80aj » 显存需求暴降!Kimi-Linear-48B优化后最低仅需4.2G显存







