谷歌发布 Gemini Omni 1.1 Flash:支持场景扩展与4K生成

Google DeepMind 正式宣布推出 Gemini Omni 1.1 Flash,这是一款专为开发者打造的生成式视频模型更新,现已通过 Google AI Studio 和 Gemini Enterprise Agent Platform 向企业用户开放。该模型旨在解决生成式视频在实际工作流中的可控性与成本问题。核心功能方面,新模型支持将现有视频片段无缝扩展,最长可生成 40 秒的连续内容,并能分析长达 10 秒的前文语境以确保视觉与叙事的连贯性。同时,开发者可以指定视频的首帧和尾帧,由模型自动生成中间过渡画面,从而实现专业的电影级运镜效果。为了降低开发门槛,该模型引入了 360p 分辨率的快速预览模式,生成速度比标准 720p 提升 60%,成本降低约三分之二,最终成品支持升级至 4K 分辨率。此外,新版本还支持上传最长 3 秒的视频参考素材以维持角色一致性。目前,Adobe Firefly、Figma Weave 和 Runway 等创意平台已宣布集成该技术。

事件分析

本次更新的核心价值在于将生成式视频从“单一提示词生成”推向了具备工程精度的“可控生成”阶段。首尾帧插值技术填补了动态运镜的技术空白,使得 AI 视频能够适应专业的影视制作管线。引入低分辨率快速迭代机制(360p 预览)是对开发者工作流的深刻理解,显著降低了试错成本与算力消耗。通过与 Adobe Firefly 和 Runway 等行业标杆工具的深度集成,谷歌正试图将 Omni 模型确立为创意软件的基础设施,推动 AI 视频从实验室演示走向工业化生产环境。

核心观点:视频生成正从“玩具”变为“工具”,首尾帧控制与分层渲染是通向专业化生产的关键一步。

原文链接:Hacker News

C code80.ai · AI 编码 API 聚合 Claude / GPT 多模型统一接入,稳定不限速,按量计费,几行配置接入 Claude Code。 了解一下 ›

抢沙发

评论前必须登录!

立即登录   注册