三星研究院(Samsung Labs)在GitHub上开源了LittleBit的官方实现,这是一项面向大语言模型的亚1比特压缩技术,论文已被机器学习顶级会议NeurIPS 2025接收,其后续改进工作LittleBit-2也已被ICML 2026接收,表明该技术路线获得学术界持续认可。传统量化方法在压缩至2比特附近后,模型精度通常急剧下降,继续压缩一直被视为难点。LittleBit通过潜因子分解(Latent Factorization)技术突破这一瓶颈,在每权重不足1比特的极端压缩率下仍能保持可用推理能力。其核心思路是将权重矩阵的主要信息迁移至低秩潜空间表示,仅以极低比特宽度存储残余信息,并用少量高精度参数补偿量化损失,从而在压缩率与精度之间取得平衡。对于动辄数百亿参数的大模型而言,此类极限压缩可大幅降低显存与存储占用,为大模型在手机、PC、边缘设备等资源受限场景的本地部署提供可行路径。近年来端侧AI竞争加剧,模型压缩、蒸馏与小型化已成为产业刚需方向。目前项目代码与实现细节已在GitHub公开,研究社区可直接复现、评测并在此基础上改进。
事件分析
核心观点:当量化逼近比特数物理极限,低秩分解成为解锁大模型端侧部署的新钥匙,显存瓶颈正被算法侧重新定义。
原文链接:Hacker News

评论前必须登录!
立即登录 注册