显存需求暴降!Kimi-Linear-48B优化后最低仅需4.2G显存

开发者ymcki通过引入MLA KV cache技术,成功对Kimi-Linear-48B-A3B大模型进行了极致优化。实测数据显示,在百万级上下文场景下,其F16 KV cache显存占用从140G骤降至15G。若配合KV量化技术,模型在保证性能的同时,显存门槛最低可降至4.2GB。这一突破使得普通消费级显卡甚至轻薄本也能流畅运行480亿参数的大模型,极大降低了本地部署AI的硬件成本。

原文链接:Linux.do

抢沙发

评论前必须登录!

立即登录   注册