GitHub 上名为 slotstream 的开源项目展示了一种突破性的技术,允许在仅配备 48GB 内存的 Mac 上运行体积达 104GB 的 Qwen3.8-Flash-Next 大模型。该工具通过创新的数据流管理,利用高速 SSD 作为权重缓存,将模型按需从磁盘流式传输到内存中,从而极大地降低了对物理内存的依赖。实测显示,在 48GB 内存配置的 Mac 上,该工具的 Warm 解码速度约为 12 tok/s,冷启动至首个 token 的时间约为 3 秒,且能将峰值内存使用量自动控制在 33GB 左右,避免系统卡顿。Slotstream 由单个 Swift 二进制文件组成,完全兼容 Ollama 和 OpenAI 的 API 接口,支持常见的采样参数和流式输出。该项目主要针对 Apple Silicon 芯片及 macOS 14+ 系统,虽需约 110GB 的磁盘空间下载模型权重,但为在资源受限的硬件上运行超大参数 MoE 架构模型提供了切实可行的解决方案。
事件分析
核心观点:slotstream通过软件调度突破物理内存墙,释放了消费级Mac运行超大参数模型的潜力,推动了本地高性能大模型的平民化落地。
原文链接:Hacker News

评论前必须登录!
立即登录 注册