开源音乐模型YuE2发布加速方案YuE2-Turbo:消费级显卡10秒生成一首歌

开源音乐生成模型YuE2近日登上GitHub Trending榜首,Star数突破一万,其SongBench均分已进入Suno v5/v6、Mureka 9等商业模型所在区间。针对原版流水线一次只能处理一首歌、模型在任务间反复加载卸载的瓶颈,NoizAI团队开源了首个推理加速方案YuE2-Turbo。该方案未更换模型、未改动采样规格,权重仍为YuE2-3B,精度保持BF16,保留原32步flow-matching,主要做了三项优化:自回归阶段引入vLLM调度,使多首歌的AR生成可并行推进;MoT与VAE模块全程常驻显存,避免任务间来回迁移;非自回归的声学合成阶段支持跨请求批处理,并实现流水线并行,即上一批歌曲进行NAR/VAE解码时,下一批的AR阶段可提前启动。在RTX 5090(32GB)上实测,单首歌RTF从0.290降至0.173,加速1.68倍;4路并发场景下RTF从0.317降至0.096,加速3.31倍,一首一分多钟的歌曲约10秒即可生成。YuE2作为白盒音乐模型,生成歌曲前会先输出ABC乐谱,用户可自由编辑和弦、旋律、节拍、歌词后重新渲染;翻唱功能借助SheetSage2将旋律转为乐谱,在SHS100K数据集948首作品上达到71.3%的Hit@1。项目代码已在GitHub开源,接受社区贡献。

事件分析

YuE2-Turbo的技术路径值得关注:在不改动模型权重与采样规格的前提下,通过vLLM调度、显存常驻与跨请求批处理实现加速,这类推理优化思路与LLM服务化的工程实践一脉相承,正在向音频生成领域迁移。音乐生成赛道的开源阵营此前明显落后于Suno等闭源产品,YuE2以白盒乐谱为差异化卖点,切中了专业音乐人对可控性的需求,这是闭源产品难以完全开放的环节。推理成本被消费级显卡摊薄后,本地化音乐生成有望催生插件化创作工具生态。后续值得观察的包括:加速方案在更低端显卡上的适配、高并发下的输出稳定性,以及社区能否围绕乐谱编辑形成成熟的创作工作流。

核心观点:AI音乐生成的竞争正从模型能力转向推理工程,开源阵营用消费级硬件跑通落地,是打破Suno闭源垄断的关键一步。

原文链接:Linux.do

C code80.ai · AI 编码 API 聚合 Claude / GPT 多模型统一接入,稳定不限速,按量计费,几行配置接入 Claude Code。 了解一下 ›

抢沙发

评论前必须登录!

立即登录   注册