The Keyword (blog.google)

Gemini Omni 1.1 Flash lets you build with more control

8.5内容质量
Gemini Omni 1.1 Flash lets you build with more control

TL;DR · AI 摘要

Google推出Gemini Omni 1.1 Flash,提供更精细的生成式视频控制,支持场景扩展、4K输出和高效预览。

核心要点

  • 场景扩展支持40秒叙事,上下文分析时长从1秒提升至10秒
  • 360p预览功能可降低60%制作成本并加速迭代
  • 4K分辨率输出通过Google AI Studio直接生成

结构提纲

按章节快速跳转。

  1. Google宣布推出Gemini Omni 1.1 Flash开发者版本

  2. 支持场景扩展、帧控制和4K输出三大核心升级

  3. 模型上下文分析能力提升至10秒,实现更连贯的视频生成

  4. 适用于视频工作流、创意工具和媒体编辑软件开发

  5. 360p预览功能可减少70%的计算资源消耗

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • Gemini Omni 1.1 Flash
    • 核心功能
      • 场景扩展(40秒)
      • 帧控制(起始/结束帧)
      • 4K输出
    • 技术优势
      • 10秒上下文分析
      • 360p预览优化
    • 应用场景
      • 视频工作流开发
      • 媒体编辑软件

金句 / Highlights

值得收藏与分享的关键句。

#Gemini Omni 1.1 Flash#生成式视频#Google AI#视频编辑工具
打开原文

使用 Gemini Omni 1.1 Flash 进行开发

Gemini Omni 1.1 Flash 让您拥有更精细的控制能力

2026年8月27日

|

分享 下拉菜单

  • x.com
  • Facebook
  • LinkedIn
  • 邮件
  • 复制链接

Omni 现在可提供工作室级视频制作功能,包括场景扩展、首尾帧插值、清晰的 4K 超分辨率、更快的原型设计等。

Anish Nangia

Google DeepMind 产品经理

Alisa Fortin

分享

Safari 浏览器的变通方案:当通过 <use> 引用外部 SVG 精灵中定义的线性渐变时,Safari 无法解析。在此处内联它们可使它们在页面的 DOM 中可用。

您的浏览器不支持音频元素。

收听文章

[[duration]] 分钟

此内容由 Google AI 生成。生成式 AI 处于实验阶段

语音

速度

0.75X

1X

1.5X

2X

阅读 AI 生成的摘要

我们推出 Gemini Omni 1.1 Flash,这是为开发者提供的生产就绪版本,提供对生成式视频的更精细控制。现在您可以扩展场景、指定起始和结束帧以实现流畅的过渡,并生成高分辨率的 4K 输出。立即通过 Google AI Studio 或 Gemini 企业代理平台访问模型,开始构建。

摘要由 Google AI 生成。生成式 AI 处于实验阶段。

  • "Gemini Omni 1.1 Flash" 为开发者提供更精细的生成式视频项目控制能力。
  • 通过改进的视觉一致性和叙事流畅性,可将场景扩展至 40 秒。
  • 设置起始和结束帧以创建平滑的专业级摄像机运动和过渡效果。
  • 使用 360p 预览功能加快迭代速度,在创作过程中节省成本。
  • 将最终项目超分辨率至 4K 分辨率,呈现专业级的精致效果。

Google 刚刚发布了 Gemini Omni 1.1 Flash,为开发者提供了更强大的工具,用于使用 AI 创建和编辑视频。它允许您扩展视频片段、控制摄像机运动并生成高质量的 4K 视频。开发者还可以创建快速的低分辨率草稿,以更快、更低成本地测试创意。这对于任何构建创意视频软件的人来说都是一个重大进展。

#### 探索其他风格:

  • 一般摘要
  • 项目符号
  • 基础说明

文章正文

今天,我们推出 Gemini Omni 1.1 Flash,这是一套新的创意控制功能和生成式视频能力,旨在支持开发者。Gemini Omni 将现实世界的推理能力带入生成式创作,而今天的更新使 Omni 1.1 通过 Google AI Studio 中的 Gemini API 实现了专业级的生产就绪状态。无论您是在构建生成式视频工作流程、创意工具还是媒体编辑软件,这些更新都使生成式视频更易于控制、迭代速度更快,并且适合现实世界的部署。以下是新增功能的详细介绍:

扩展场景以实现更长的故事叙述

场景扩展功能允许您从现有视频继续无缝生成后续画面。

借助 Omni 1.1,模型现在可以分析长达 10 秒的先前上下文——相比之前仅参考最后一秒的模型,这是一个重大飞跃。其结果是提升了视觉一致性与叙事连贯性,使您能够构建更长的故事或探索新的创作方向。您可以以 10 秒为单位扩展视频,总累计时长最多可达 40 秒。

提示 1:摄像机略微平移,我们看到她正在与一位卷发男子交谈,我们看到男子的背影,他说“我也看到了”,背景响起戏剧性的音乐配乐

Prompt 2:镜头缓慢拉出,被遗忘的布满灰尘的地下墓穴,戏剧性的配乐。Prompt 3:镜头缓慢拉出,一座巨大的图书馆,书架和书籍在布满灰尘的虚空中漂浮,戏剧性的配乐。

Prompt 1:继续播放视频。执行电影级光学推拉镜头拍摄。镜头向前推进的同时进行拉远拍摄,保持人物凝固的震惊表情始终维持相同尺寸。背景中由石柱组成的长廊因强烈的光学透视扭曲而戏剧性地拉伸和加深。整洁的建筑风格,连续不间断的镜头。

Prompt 2:继续播放视频。镜头执行快速机械式对焦拉近,直接切入人物睁大的眼睛。风格化的电影镜头控制。

Prompt 3:继续播放视频。时间完全凝固成静态瞬间:人物及其被风吹起的外套。镜头围绕冻结的人物进行平滑高速的360度轨道旋转,展现门廊区域戏剧性的三维深度和视差效果。完美的连续性。

Prompt 1:穿蓝色毛衣的男人回答:"你父亲也出海了吗?"

Prompt 2:他继续讲述时镜头连续后拉:"他常说这个港口有灵魂,而船只就是我们的一部分。"音乐逐渐增强。

Prompt 1:他直视镜头,讲述最终章节的结局!

Prompt 2:他起身绕过桌子走向镜头,问:"你会如何选择?"

以下是使用Gemini API扩展场景的方法:

code
from google import genai

client = genai.Client()

interaction = client.interactions.create(
    model="gemini-omni-1.1-flash",
    previous_interaction_id=previous_video_interaction.id,
    input=[
        {"type": "text", "text": "Continue the scene."}
    ],
    response_format={
        "resolution": "360p",
    },
)

指定首帧和末帧

通过指定镜头的起始帧和结束帧,实现平滑的转场和镜头运动。Omni 1.1会在两个关键帧之间生成连续视频,非常适合复杂的镜头轨道旋转、变焦转场或无缝循环片段。

Prompt 1:一个低角度特写镜头,时尚的鼓手穿着米色西装在宏伟大厅中演奏红色鼓组,镜头突然横移至侧面,露出正在与芭蕾舞者(穿着白色服装在柔和的紫色舞台灯光下旋转)一同演奏的年长萨克斯手。一个连续镜头,无跳切。

Prompt 2:镜头推近电视屏幕,我们看到同样的女人和场景的开始。无缝视频。一个连续镜头,无跳切。

在360p分辨率下更高效地制作视频

以360p分辨率生成轻量级预览,速度比Omni 1.1的标准720p分辨率快60%*,成本仅为三分之一。这对快速原型设计、分镜稿迭代和开发者平台的快速渲染非常有帮助。

*基于360p与720p分辨率系统吞吐量的对比,生成速度最快可提升60%

Prompt: 一微观视角展现虹彩海洋硅藻,呈现精致如玻璃般的二氧化硅外壳,展现令人惊叹的自然对称性。颜色从深火山琥珀色和温暖的铜色到鲜艳的 turquoise 和 violet,模仿大地与海洋丰富的色彩调色板。微小而精致的结构在干净的黑色背景场中柔和发光。高保真科学成像,锐利细节,有机纹理,显微摄影。在整个视频中保持显微镜镜头效果。

提升至4K分辨率

使用Omni 1.1生成经过润色的高分辨率1080p或4K输出,可直接用于专业制作。

Prompt 1: 游鱼游泳,跟拍镜头

Prompt 2: 一只小花栗鼠从屏幕左侧的树林中窜出,好奇地嗅探空气,随后从右侧窜出画面

Prompt 3: 电影级微距特写镜头拍摄鲜艳的金橙色日本枫叶,叶片轻柔地在柔和而有节奏的秋风中摇曳。阳光穿透半透明的叶冠,形成温暖的发光效果。浅景深,梦幻的背景虚化,超精细纹理,超写实,4K。

在多模态输入中添加视频参考

在构建场景时可引用最多三秒的视频片段,使您能够基于视频参考保持视觉上下文和角色一致性。

Prompt: 使用上传的三个舞蹈视频,将其替换为提供的角色。让他们在提供的图像中展现的宽敞开放空间内,各自表演参考视频中的舞蹈动作。狗角色 dog.png 应表演 dance3.mp4 中的古典舞,章鱼 octo.png 应表演 dance1.mp4 中的嘻哈舞,熊 bear.png 应表演 dance2.mp4 中的街舞。最终结果应为一个连续镜头,无场景切换。

激发灵感的构建概念

以下是一些示例,展示开发者如何将这些新功能应用于自定义工具和创意工作流程。

在此应用中,您可以拖入首帧和末帧,通过预设或提示框生成它们之间的过渡,因为Omni的完整上下文推理能力可让您获得看起来真实的摄像机运动。

此应用让摄像机穿越房间。它做弧形运动,推进,拉回。它以理想的时间展示房屋的 aspirational 状态,不会添加任何不存在的家具或细节。

创作者在确定最终版本前通常会生成多个视频。Draft Room使这种探索变得廉价且结构化:以360p生成3-4个草稿变体,每次只改变一个元素并并排比较。

了解客户如何将Omni Flash投入生产

我们的客户已通过Agent Platform API通过Gemini Omni Flash驱动真实生产。探索他们创建的视频,了解他们如何在下方使用该模型。

Adobe已将Gemini Omni Flash集成到Adobe Firefly中。观看这段展示其视频编辑功能的视频。

“Gemini Omni Flash 是 Figma Weave 中最强大的视频模型之一,其画布功能帮助创意团队在每次生成的基础上进行扩展——附加参考素材、创建不同版本分支,并塑造独特的内容。借助扩展功能、更丰富的参考素材和 4K 分辨率,Gemini Omni Flash 让团队能够超越视频生成,真正实现对视频的精准把控。” —— Itay Schiff,Figma Weave 创意总监。

“在 GMI Cloud,我们为创作者提供集中访问全球最强大模型的途径。Gemini Omni Flash 最突出的优势在于其准确性:细节经得起推敲。对于需要制作教育和说明类内容的客户来说,正确性至关重要,这种可靠性比任何单一功能都更重要。Omni 让 AI 视频对之前无法依赖它的用户群体变得切实可行。” —— Louisa Guo,GMI Cloud 市场副总裁。

“Omni Flash 与 Runway 用户现有的使用方式自然契合:从提示语、图片或视频开始,然后进行生成或编辑。这是用户快速在创意之间切换的又一种方式。” —— Jamie Umpherson,Runway 首席创意官。

今天即刻使用 Gemini Omni 1.1 Flash

Gemini Omni 1.1 Flash 的定价表。

Omni 1.1 正在 Google 开发者生态系统中全面上线:

  • 通过 Google AI Studio 开始构建:直接在 Google AI Studio 中体验 Omni 1.1。
  • 在 Gemini 企业代理平台构建:企业用户可通过 Agent Platform API 直接使用 Omni 1.1 构建应用。
  • 查阅开发者文档:通过 官方文档实践指南 和提示指南,学习如何将场景扩展、视频参考和超分辨率功能集成到你的应用中。

Omni 1.1 现已向全球所有 Google AI Plus、Pro 和 Ultra 订阅用户开放,可通过 Google Flow 使用。场景扩展功能也已向全球所有 Google AI Plus、Pro 和 Ultra 订阅用户开放,可通过 Gemini 应用使用。

在邮箱中获取最新 Google 资讯

订阅我们的电子报,获取产品更新、活动信息、特别优惠等资讯。

订阅完成。只需再完成一步。

请查看邮箱确认订阅。

你也可以使用其他邮箱地址进行订阅。

你的信息将按照 Google 隐私政策使用。你可随时选择退订。

发布于: /