YC孵化Magnitude发布:自优化推理引擎让本地AI Agent最高提速92%

YC S25批次初创公司推出开源推理引擎Magnitude,专为在本地硬件上运行AI智能体设计。该项目由两位软件工程师创立,此前曾开发获得4000余GitHub星标、10万次下载的开源浏览器智能体。团队指出,现有推理引擎均存在性能取舍:vLLM、SGLang面向数据中心批量推理而牺牲单会话性能;llama.cpp、Ollama追求广泛兼容而未针对特定硬件优化;专用引擎则缺乏完整性。Magnitude的核心技术包括:设备端编译与调优,内核参数在用户实际设备上运行前自动调优,兼顾硬件兼容性与性能上限;动态内存分配,仅预载模型权重所需内存,随智能体会话增长动态扩展并在会话结束后释放;混合分页注意力机制,借鉴SGLang思路让并发会话共享前缀缓存,同时优化内存邻接布局以保证单会话性能。项目采用Rust编写,含自研GPU内核运行时和自动调优器,以Apache 2.0协议开源。基准测试显示,在Mac M4 Pro上运行Qwen 3.6 35B A3B模型(4bit、64k上下文)时,解码速度较llama.cpp提升92%(30 tok/s至57 tok/s),每智能体内存占用降低28%;在DGX Spark上解码提升19%、预填充提升23%。产品以桌面应用形式发布,可对接Pi、OpenCode、Codex等主流智能体工具,按需自动加载和关闭模型。后续规划包括专家流式加载、内核编译器及多设备利用率优化。

事件分析

本地推理赛道长期由llama.cpp生态主导,其通用性策略存在性能天花板。Magnitude选择设备端自动调优路线,本质是用编译期开销换取运行时性能,接近TVM等内核编译思路的工程化落地,为硬件碎片化环境下的小团队提供了新范式。其基准测试集中在Apple Silicon与DGX Spark两端,恰好覆盖消费级设备与开发工作站,精准指向本地运行智能体这一快速增长的需求场景。若内核编译器与专家流式加载落地,MoE大模型在消费级硬件上的可用门槛将进一步降低。不过赛道竞争激烈,SGLang与llama.cpp社区迭代迅速,独立引擎能否建立生态粘性仍有变数,与各Agent框架的深度集成及持续的性能领先将是其差异化关键。

核心观点:推理引擎竞争正从数据中心下沉到本地设备,谁能率先破解硬件碎片化与Agent长会话难题,谁就握住端侧AI入口。

原文链接:Hacker News

C code80.ai · AI 编码 API 聚合 Claude / GPT 多模型统一接入,稳定不限速,按量计费,几行配置接入 Claude Code。 了解一下 ›

抢沙发

评论前必须登录!

立即登录   注册