一位开发者开源了名为ESP32s3-LLM-Cluster的项目,在7块ESP32-S3微控制器上以分布式流水线方式运行0.5B参数的1.58-bit(BitNet)大语言模型。该项目采用主从架构:主节点负责BPE分词器、INT4词嵌入(约14MB存于Flash)以及最终的RMSNorm、LM Head与贪心采样;其余6个节点作为计算单元,每个节点承载4个Transformer块,涵盖RMSNorm、带RoPE旋转位置编码的1.58-bit注意力机制(KV缓存置于PSRAM)以及1.58-bit MLP。主节点与计算节点通过高速SPI菊花链通信,隐藏状态向量以FP32格式在节点间传递。计算节点固件中的1.58-bit三值线性层采用汇编优化的MAC乘加运算加速,模型基于Qwen架构,并使用自定义分区表管理token、模型权重与归一化参数的存储。项目同时提供完整的PC端量化与预处理工具链,包括词表裁剪至32K、嵌入矩阵切片、BitNet量化感知训练(QAT)微调、INT4权重打包、分词器序列化及多线程快速烧录脚本。项目采用MIT许可证开源,附有详细的烧录、模型准备与硬件接线指南。
事件分析
核心观点:当极端量化把大模型压至1.58-bit,几美元的微控制器也能化身推理节点,硬件算力门槛正被算法压缩技术重新定义。
原文链接:Hacker News

评论前必须登录!
立即登录 注册