
Gemini Omni 1.1 Flash 是 Google DeepMind 推出的生产级视频生成模型,它通过 10 秒上下文场景延展、首尾帧插值、360p 草稿预览和 4K 升级等能力,让开发者能够对 AI 生成视频的叙事长度、镜头运动和制作成本进行更精细的控制。
在生成式 AI 视频领域,从“能生成”到“能控制”是衡量技术成熟度的关键分水岭。过去,创作者面对 AI 生成的视频,往往只能接受“一次成型”的结果,难以对镜头语言、叙事节奏进行微调。Google DeepMind 近期推出的 Gemini Omni 1.1 Flash 模型,正是针对这一痛点,为开发者提供了一套更接近专业影视制作流程的控制工具。
Gemini Omni 模型最初引入的核心价值在于将“现实世界推理”能力融入生成过程。而 1.1 Flash 版本则在此基础上,将重点转向了“生产就绪”(production-ready)。这意味着,它不再仅仅是实验室里的炫技,而是可供开发者通过 Gemini API 在 Google AI Studio 或 Gemini Enterprise Agent Platform 中直接调用的专业工具。
对于构建生成式视频工作流、创意工具或媒体编辑软件的开发者而言,这次更新的核心价值体现在三个维度:更长的叙事连续性、更精准的镜头控制以及更高效的迭代成本。
长镜头叙事一直是 AI 视频生成的难点。此前的模型往往只能参考视频的最后一秒来预测后续内容,导致生成的长视频容易出现角色形象漂移、场景逻辑断裂等问题。
Gemini Omni 1.1 Flash 在这方面取得了显著突破。它现在能够分析长达 10 秒的先前上下文(Prior Context),这远超以往模型仅能参考最后一秒的能力。这意味着模型能够更好地理解角色的动作惯性、场景的光影变化以及叙事的情绪走向,从而保证延展出的画面在视觉一致性和叙事遵循度上大幅提升。
开发者现在可以以 10 秒为增量对视频进行延展,最长可将单个片段累积延长至 40 秒。这一特性为构建更长、更复杂的故事线或分支剧情提供了坚实的技术基础。
如果说场景延展解决的是“时间长度”问题,那么首尾帧控制解决的则是“空间运动”问题。在影视制作中,复杂的镜头运动(如环绕、推拉、变焦)往往需要精密的轨道和稳定器设备。
Omni 1.1 允许开发者指定一个镜头的起始帧和结束帧,模型会自动生成两帧之间的连续视频内容。这为创建复杂的镜头环绕(Camera Orbit)、变焦过渡(Zoom Transition)或无缝循环片段(Seamless Looping Clips)提供了极大的便利。开发者可以通过设定关键帧,实现专业级的“一镜到底”效果,而无需担心跳帧或画面撕裂。
在创意开发的早期阶段,快速验证想法往往比追求极致画质更重要。Gemini Omni 1.1 Flash 提供了 360p 分辨率的预览生成模式。开发者可以在低分辨率下快速生成草稿,进行镜头语言和叙事节奏的测试。
这种模式不仅大幅缩短了迭代反馈周期,让团队能够在短时间内尝试多种创意方案,同时也显著降低了 API 调用的成本。当创意方向确定后,开发者再通过 API 将最终项目一键升级(Upscale)至 4K 分辨率,以获得适合商业交付的精致画质。
Google DeepMind 强调了新功能在 API 层面的易用性。例如,场景延展功能通过 previous_interaction_id 参数即可轻松实现,模型会自动继承前序视频的上下文信息。这种设计降低了开发者的集成门槛,使得复杂的视频编辑逻辑可以通过简洁的代码实现。
Google DeepMind 在视频生成控制力上的探索,也反映了全球 AI 视频赛道的一个共同趋势:从追求“画质惊艳”转向追求“可控可用”。在国内,这一趋势同样明显。
与 Gemini Omni 1.1 Flash 强调的“专业影视工作流”不同,国内产品在面向 C 端用户的创意表达和社交分享上做得更加轻量化。但不可否认的是,在视频生成的可控性、长镜头一致性以及 API 服务的稳定性方面,国内厂商与 Google DeepMind 之间仍存在一定差距,尤其是在处理超长上下文(10 秒以上)和复杂镜头插值(Interpolation)的算法深度上。
Gemini Omni 1.1 Flash 的发布,是 AI 视频生成走向“工业化”的一个重要信号。它不再满足于让 AI 生成“一段好看的视频”,而是致力于让 AI 生成“符合导演意图的镜头”。
随着上下文窗口的进一步扩大和生成质量的持续提升,我们有理由相信,未来的 AI 视频工具将更像是一个“数字摄制组”,能够理解复杂的指令,执行精准的镜头运动,并输出符合专业标准的成片。对于开发者而言,现在正是基于这些 API 构建下一代创意工具的最佳时机。
主要区别在于“控制力”和“生产就绪”程度。1.1 Flash 版本引入了 10 秒上下文分析能力,支持场景延展、首尾帧插值以及 360p 草稿预览,并支持将作品升级至 4K 分辨率,更贴合专业开发者的工作流程。
开发者可以通过 Google AI Studio 或 Gemini Enterprise Agent Platform 访问该模型。通过 Gemini API 即可调用场景延展、首尾帧控制等新功能。
模型支持以 10 秒为增量进行延展,单个视频片段的总长度上限为 40 秒。
360p 模式主要用于快速原型验证。它能够加快迭代速度,降低创意测试阶段的 API 调用成本,在最终渲染时再选择 4K 分辨率输出。
Bingdada 是一个专注 SEO、GEO(生成式引擎优化)与 AEO(答案引擎优化)的内容平台,由资深内容编辑、SEO 技术工程师与 AI 研究专家组成的团队持续运营。我们追踪搜索引擎与生成式 AI 的最新动态,为读者提供准确、实用、可落地的方法论与行业洞察。
编辑团队:内容策划 · 技术编辑 · AI 研究组
网站:bingdada.com
© 2026 Bingdada. 保留所有权利。
Поместите бренд в ленту читателя
Рекламные места внутри статей — моменты высокого внимания, идеальны для запуска продуктов и набора на мероприятия.
SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

Google DeepMind 在欧洲启动为期三个月的机器人加速器,支持 15 家具身智能初创企业,覆盖工业、医疗、建筑与海洋等场景,释放出物理 AI 从研究走向工程化落地的明确信号。

Google DeepMind 为 Gemini 系列引入智能体视频理解,模型可自主决定看哪些片段、以何种帧率与模态检索,token 消耗最多降 88%、成本最多降 66%,准确率最高提升 7%。

Google DeepMind 六周内第三次更新 Flash 系列,推出 Gemini 3.8 Flash 与 3.8 Flash Cyber,分别瞄准长周期智能体编程与网络安全防御,性能逼近高成本前沿模型而价格不变。
Получайте свежие материалы по SEO и GEO.
Мы уважаем вашу конфиденциальность. Отписаться можно в любой момент.
Войдите, чтобы присоединиться к обсуждению