三星开源LittleBit:将大模型压缩至不足1比特的极限技术

三星研究院(Samsung Labs)在GitHub上开源了LittleBit的官方实现,这是一项面向大语言模型的亚1比特压缩技术,论文已被机器学习顶级会议NeurIPS 2025接收,其后续改进工作LittleBit-2也已被ICML 2026接收,表明该技术路线获得学术界持续认可。传统量化方法在压缩至2比特附近后,模型精度通常急剧下降,继续压缩一直被视为难点。LittleBit通过潜因子分解(Latent Factorization)技术突破这一瓶颈,在每权重不足1比特的极端压缩率下仍能保持可用推理能力。其核心思路是将权重矩阵的主要信息迁移至低秩潜空间表示,仅以极低比特宽度存储残余信息,并用少量高精度参数补偿量化损失,从而在压缩率与精度之间取得平衡。对于动辄数百亿参数的大模型而言,此类极限压缩可大幅降低显存与存储占用,为大模型在手机、PC、边缘设备等资源受限场景的本地部署提供可行路径。近年来端侧AI竞争加剧,模型压缩、蒸馏与小型化已成为产业刚需方向。目前项目代码与实现细节已在GitHub公开,研究社区可直接复现、评测并在此基础上改进。

事件分析

技术层面,大模型量化研究此前多集中于2比特和1.58比特方案,LittleBit引入低秩潜因子分解,把权重主体信息压缩至低维空间,为亚1比特极限压缩提供了可复现的新范式。产业层面,显存瓶颈是大模型推理成本高企的核心原因,若该路线持续成熟,数十B参数级模型有望压缩至数GB体量,将显著改变端侧AI的部署成本结构,与手机厂商和芯片厂商推动的本地大模型战略形成呼应。后续走向方面,LittleBit-2进入ICML 2026说明该方法仍在快速迭代,极限压缩与稀疏化、蒸馏的组合方案,以及能否获得硬件指令层面的原生支持,将是决定其产业落地速度的关键变量。

核心观点:当量化逼近比特数物理极限,低秩分解成为解锁大模型端侧部署的新钥匙,显存瓶颈正被算法侧重新定义。

原文链接:Hacker News

C code80.ai · AI 编码 API 聚合 Claude / GPT 多模型统一接入,稳定不限速,按量计费,几行配置接入 Claude Code。 了解一下 ›

抢沙发

评论前必须登录!

立即登录   注册