谷歌今日宣布推出其生成式视频模型的最新迭代版本Gemini Omni 1.1 Flash,主要面向开发者群体,旨在提供更精细、更可控的视频创作工具。此举被视为谷歌在AI视频生成赛道上的又一次关键落子,直接回应了开发者对于视频内容精确编辑与延展的迫切需求。
与上一代产品相比,Gemini Omni 1.1 Flash的核心升级集中在视频生成的“控制力”上。新模型引入了增强的场景扩展功能,能够分析至多10秒的先前视频上下文,并以此为基准,支持以10秒为增量单位对视频进行持续延长,最大可累计生成至40秒的连贯内容。这一机制为构建更长、叙事更完整的视频序列提供了技术基础。
此外,该模型还支持开发者指定视频的首帧与尾帧,并通过算法自动生成两者之间的平滑过渡画面。这一功能显著降低了视频剪辑与动态设计中的技术门槛,使得从一张静态图片或一个特定画面出发,生成一段自然流畅的动态影像成为可能。在输出质量方面,Gemini Omni 1.1 Flash将分辨率上限提升至4K,满足了专业级应用对画质的严苛要求。
从行业影响来看,谷歌此举进一步加剧了AI视频生成领域的竞争。通过将强大的上下文理解能力与高分辨率输出相结合,Gemini Omni 1.1 Flash为广告、影视预可视化、游戏开发等依赖高质量动态内容的行业提供了新的生产力工具。对于AI开发者而言,更精确的控制参数意味着更高的创作自由度,这或将催生出一批新的应用场景与商业模式。
目前,该模型已向开发者开放,具体调用方式与计费细节可在谷歌官方AI开发平台查阅。随着模型能力的持续演进,生成式视频技术正从“能生成”加速迈向“生成得好、控制得住”的新阶段,而谷歌此次的更新,正是这一趋势下的显著标志。