长期以来,个人电脑无法流畅运行大参数模型,主要受限于GPU显存(VRAM)容量不足,而利用CPU内存作为补充又常受限于PCIe传输带宽瓶颈。近日,一篇发布于Arxiv的论文《FreeToken: Efficient Edge-Native MoE Serving with Bandwidth-Adaptive Execution》展示了一种全新的系统优化方案,成功解决了这一难题。该方案的核心在于“带宽自适应执行”机制,它不单纯依赖GPU或CPU,而是将整个计算机视为一个统一算力与存储池。针对混合专家(MoE)架构的大模型,该系统能够灵活地将不常用的Expert(专家模块)卸载到CPU内存中,而将当前计算所需的常用Expert保留在GPU显存中,甚至在特定情况下直接调用CPU进行计算,从而最大化利用硬件资源。实测数据显示,在一台配备RTX 4060显卡和32GB内存的普通笔记本电脑上,该系统成功运行了拥有35B参数的Qwen3.6-A3B模型,推理速度达到了30+ tok/s;而在配备5090显卡(192GB内存)的高端设备上,甚至能跑起更大的DSv4f(284B a13B)模型,速度保持在20 tok/s。测试表明,在算力并非核心瓶颈的情况下,通过这种精细化的数据传输与存储管理,即便是中低端设备也能获得巨大的模型吞吐量。这一技术突破意味着,开发者无需昂贵的专用服务器,即可在端侧设备上部署和测试超大参数的MoE模型,极大地降低了大模型的使用门槛。
事件分析
核心观点:FreeToken通过统一内存与带宽自适应调度,有效解决了MoE大模型在端侧的显存瓶颈,推动高性能AI算力从数据中心向个人PC加速下沉。
原文链接:Linux.do

评论前必须登录!
立即登录 注册