Google DeepMind 正式宣布推出 Gemini Omni 1.1 Flash,这是一款专为开发者打造的生成式视频模型更新,现已通过 Google AI Studio 和 Gemini Enterprise Agent Platform 向企业用户开放。该模型旨在解决生成式视频在实际工作流中的可控性与成本问题。核心功能方面,新模型支持将现有视频片段无缝扩展,最长可生成 40 秒的连续内容,并能分析长达 10 秒的前文语境以确保视觉与叙事的连贯性。同时,开发者可以指定视频的首帧和尾帧,由模型自动生成中间过渡画面,从而实现专业的电影级运镜效果。为了降低开发门槛,该模型引入了 360p 分辨率的快速预览模式,生成速度比标准 720p 提升 60%,成本降低约三分之二,最终成品支持升级至 4K 分辨率。此外,新版本还支持上传最长 3 秒的视频参考素材以维持角色一致性。目前,Adobe Firefly、Figma Weave 和 Runway 等创意平台已宣布集成该技术。
事件分析
核心观点:视频生成正从“玩具”变为“工具”,首尾帧控制与分层渲染是通向专业化生产的关键一步。
原文链接:Hacker News

评论前必须登录!
立即登录 注册