显存需求暴降!Kimi-Linear-48B优化后最低仅需4.2G显存

开发者ymcki通过引入MLA KV cache技术,成功对Kimi-Linear-48B-A3B大模型进行了极致优化。实测数据显示,在百万级上下文场景下,其F16 KV cache显存占用从140G骤降至15G。若配合KV量化技术,模型在保证性能的同时,显存门槛最低可降至4.2GB。这一突破使得普通消费级显卡甚至轻薄本也能流畅运行480亿参数的大模型,极大降低了本地部署AI的硬件成本。

原文链接:Linux.do

C code80.ai · AI 编码 API 聚合 Claude / GPT 多模型统一接入,稳定不限速,按量计费,几行配置接入 Claude Code。 了解一下 ›

抢沙发

评论前必须登录!

立即登录   注册