MiniMax正式发布了其第三代视频模型H3,并宣布开源所有权重。作为业界首个支持2K分辨率输出和原生立体声音频的开放权重视频模型,H3在发布当天即被ComfyUI平台全面支持。该模型具备强大的多模态上下文理解能力,能够同时接收文本、图像、视频和音频作为输入,生成带有同步立体声的15秒高清视频片段,彻底改变了以往视频生成中声音需要后期合成的局限。在技术实现上,ComfyUI团队针对该模型进行了深度工程优化,通过剪枝替换、int8卷积旋转量化及自定义内核等技术,成功将模型的内存占用降低了66%,从原本的123.6GB缩减至42.5GB。这一突破性优化结合动态显存卸载技术,使得拥有RTX 3060显卡的普通用户也能在本地流畅运行这一顶尖的2K视频生成模型。H3支持文生视频、图生视频、首尾帧控制以及基于参考视频的运动迁移等多种工作流,为创作者提供了极大的灵活性和创意空间。
事件分析
💡 核心观点:将2K视频生成门槛降至消费级显卡,标志着开源视频模型已具备在本地端挑战闭源SaaS服务的实战能力。
原文链接:Hacker News

评论前必须登录!
立即登录 注册