技术狂想成真:开发者成功在 M1 Mac 上运行 2.8T 参数 Kimi K3 模型

一项名为 Deltafin 的开源实验项目展示了如何在 Apple Silicon Mac(特别是 M1 Max 64GB 版本)上运行 Moonshot AI 的 Kimi K3 模型。该模型拥有 2.8 万亿参数,采用了混合专家(MoE)架构,其总权重约为 1.56 TB,远超消费级硬件的内存和存储容量。Deltafin 通过利用 MoE 架构的特性——即每生成一个 Token 仅调用极小一部分专家——从而突破硬件限制。项目提供两种运行模式:一种是占用约 1.7 TB 空间的“完全模式”,将所有专家数据存储在本地;另一种是占用约 215 GB 的“流式模式”,按需从 Hugging Face CDN 加载专家数据并进行本地缓存。虽然受限于硬件带宽,生成速度较慢(在 M1 Max 上约为 16 秒/Token),但该项目通过 Fused MXFP4 内核、Metal 优化和 N-gram 推测解码等技术,实现了精确且可复现的推理结果。此外,Deltafin 还内置了兼容 OpenAI API 的服务器,允许现有的聊天界面和编码代理通过简单的配置更改直接调用本地运行的 K3 模型,这为在受限硬件环境下研究超大模型行为提供了新的可能性。

事件分析

该事件标志着在本地运行超大参数模型方面的工程突破,重点在于利用模型架构特性(MoE)而非单纯依赖硬件堆叠。Deltafin 项目提出的“流式推理”方案,巧妙地解决了本地显存不足以承载完整模型的问题,证明了通过高效的 I/O 策略和缓存机制,消费级设备也能参与万亿参数级别模型的运算。尽管目前的生成速度尚不具备实用交互价值,但其对 MoE 层级加载、NEON 优化及 Metal 计算的探索,为未来“边缘计算”运行高端 AI 模型提供了极具价值的参考范式。这一技术路径若能进一步优化,有望降低大模型研发与调试的硬件门槛。

💡 核心观点:通过流式加载与 MoE 架构的深度结合,该项目打破了算力垄断,证明了消费级设备运行万亿参数模型在工程上的可行性。

原文链接:Hacker News

C code80.ai · AI 编码 API 聚合 Claude / GPT 多模型统一接入,稳定不限速,按量计费,几行配置接入 Claude Code。 了解一下 ›

抢沙发

评论前必须登录!

立即登录   注册