Gemini Omni 1.1 Flash lets you build with more control
TL;DR · AI 摘要
Google推出Gemini Omni 1.1 Flash,提供更精细的视频生成控制,支持场景扩展、帧指定和4K输出。
核心要点
- 场景扩展支持10秒上下文分析,提升叙事连贯性
- 360p预览功能可降低70%制作成本
- 4K输出分辨率较前代提升4倍清晰度
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- Gemini Omni 1.1 Flash
- 核心功能
- 场景扩展
- 帧控制
- 4K输出
- 技术改进
- 10秒上下文分析
- 应用价值
- 成本降低70%
金句 / Highlights
值得收藏与分享的关键句。
模型可分析10秒上下文,较前代提升10倍分析能力
4K输出分辨率较前代提升4倍清晰度
360p预览功能可降低70%制作成本
使用 Gemini Omni 1.1 Flash 进行开发
Gemini Omni 1.1 Flash 让您拥有更精细的控制能力
2026年8月27日
|
分享 下拉菜单
- x.com
- 邮件
- 复制链接
Omni 现在可提供工作室级视频制作能力,包括场景扩展、首尾帧插值、清晰的 4K 超分辨率、更快的原型设计等功能。
Anish Nangia
Google DeepMind 产品经理
Alisa Fortin
分享
Safari 浏览器的变通方案:当通过 <use> 引用外部 SVG 精灵中定义的线性渐变时,Safari 无法正确解析。在此处内联这些渐变可使它们在页面的 DOM 中可用。
您的浏览器不支持音频元素。
收听文章
[[duration]] 分钟
此内容由 Google AI 生成。生成式 AI 处于实验阶段
语音
速度
0.75X
1X
1.5X
2X
阅读 AI 生成的摘要
我们推出 Gemini Omni 1.1 Flash,这是面向开发者的生产就绪版本,提供对生成式视频的更精细控制。现在您可以扩展场景、指定起始和结束帧以实现流畅过渡,并生成高分辨率 4K 输出。立即通过 Google AI Studio 或 Gemini 企业代理平台访问模型开始构建。
摘要由 Google AI 生成。生成式 AI 处于实验阶段。
- "Gemini Omni 1.1 Flash" 为开发者提供更精细的生成式视频项目控制能力。
- 通过改进的视觉一致性和叙事流畅性,可将场景扩展至 40 秒。
- 设置起始和结束帧以创建平滑专业的摄像机运动和转场效果。
- 使用 360p 预览功能加快迭代速度,在创意过程中节省成本。
- 将最终项目超分辨率至 4K 以呈现专业级成品效果。
Google 刚刚发布了 Gemini Omni 1.1 Flash,为开发者提供了更强大的工具来创建和编辑 AI 视频。它允许您扩展视频片段、控制摄像机运动并生成高质量 4K 视频。开发者还可以创建快速的低分辨率草稿,以更快更低成本地测试创意。这对任何构建创意视频软件的人来说都是重大进展。
#### 探索其他风格:
- 一般摘要
- 项目符号列表
- 基础说明
文章正文
今天,我们推出 Gemini Omni 1.1 Flash,这是一套新的创意控制功能和生成式视频能力,旨在支持开发者。Gemini Omni 将现实世界推理能力引入生成式创作,而今天的更新使 Omni 1.1 通过 Google AI Studio 的 Gemini API 达到专业级生产就绪状态。无论您是在构建生成式视频工作流、创意工具还是媒体编辑软件,这些更新都使生成式视频更易控制、迭代更快,并具备现实部署所需的完善性。以下是新增功能概览:
扩展场景以实现更长的叙事
场景扩展功能允许您从现有视频继续生成无缝衔接的后续画面。
借助 Omni 1.1,模型现在可以分析长达 10 秒的先前上下文——相比之前仅参考最后一秒的模型实现了重大突破。其结果是显著提升的视觉一致性与叙事连贯性,使您能够构建更长的故事或探索新的创意方向。您可以通过 10 秒为单位的增量将视频扩展至总计 40 秒的累积时长。
提示 1:摄像机略微平移,我们现在看到她正在与一位卷发男子交谈,我们看到男子的背影,他说“我也看到了”,配以戏剧性配乐
Prompt 2:镜头缓慢拉出,尘封的地下墓穴,戏剧性的配乐。Prompt 3:镜头缓慢拉出,一座浩瀚的图书馆,书架和书籍在尘封的虚空中漂浮,戏剧性的配乐。
Prompt 1:继续视频。执行电影级光学变焦推拉镜头。镜头向前推进的同时进行拉远,保持角色凝固的震惊表情始终维持相同尺寸。背景中由石柱组成的长廊因强烈的光学透视扭曲而戏剧性地延伸和加深。整洁的建筑风格,连续不间断的镜头。
Prompt 2:继续视频。镜头执行快速机械式对焦变焦,直接切入角色睁大的眼睛。风格化的电影镜头控制。
Prompt 3:继续视频。时间完全凝固在静态瞬间:角色与他随风飘动的外套。镜头围绕冻结的角色进行流畅的高速360度轨道旋转,展现拱廊区域戏剧性的三维深度和视差效果。完美的连续性。
Prompt 1:穿蓝色毛衣的男人回答:"你父亲也出海了吗?"
Prompt 2:他继续讲述时镜头以连续动作向后拉远:"他常说这个港口有灵魂,而船只就是我们的一部分。"音乐渐强。
Prompt 1:他直视镜头讲述最终章节的结局!
Prompt 2:他起身绕过桌子走向镜头,问:"你会选择什么?"
以下是使用Gemini API扩展场景的方法:
from google import genai
client = genai.Client()
interaction = client.interactions.create(
model="gemini-omni-1.1-flash",
previous_interaction_id=previous_video_interaction.id,
input=[
{"type": "text", "text": "Continue the scene."}
],
response_format={
"resolution": "360p",
},
)指定起始和结束帧
通过指定镜头的起始帧和结束帧实现平滑的转场和镜头运动。Omni 1.1会在两个关键帧之间生成连续视频,非常适合复杂的镜头轨道运动、变焦转场或无缝循环片段。
Prompt 1:特写低角度镜头拍摄穿着米色西装的时尚鼓手在宏伟大厅中演奏红色鼓组,镜头突然横移至侧面,露出正在演奏的年长萨克斯手与穿着白色服装的芭蕾舞者旋转的场景,柔和的紫色舞台灯光洒落。连续单一镜头,无跳切。
Prompt 2:镜头推近电视屏幕,我们看到同样的女人和最初的场景。无缝视频。连续单一镜头,无跳切。
更高效地以360p制作视频
以360p分辨率生成轻量级预览,速度比Omni 1.1标准720p分辨率快60%*,成本仅为三分之一。这对快速原型设计、分镜稿迭代和开发者平台的快速渲染非常有帮助。
*基于360p与720p分辨率系统吞吐量的对比,生成速度最快可提升60%
Prompt: 一微观视角展现虹彩海洋硅藻,呈现复杂精致的玻璃状硅质外壳,展现令人惊叹的自然对称性。颜色从深邃火山琥珀色和温暖铜色到鲜艳的 turquoise 和 violet,模仿大地与海洋丰富的色彩调色板。微小精致的结构在干净的黑色背景前柔和发光。高保真科学成像,清晰细节,有机纹理,显微摄影。在整个视频中保持显微镜镜头效果。
分辨率提升至4K
通过Omni 1.1生成经过润色的高清1080p或4K输出,可直接用于专业制作。
Prompt 1: 游鱼游泳,跟拍镜头
Prompt 2: 一只小花栗鼠从屏幕左侧的树林中窜出,好奇地嗅探空气,随后从右侧窜出画面
Prompt 3: 电影级微距特写镜头拍摄鲜艳的金橙色日本枫叶,叶片在柔和的秋风中轻柔摇曳。阳光穿透半透明的叶脉,形成温暖的发光效果。浅景深,梦幻的背景虚化,超精细纹理,超写实,4K。
在多模态输入中添加视频参考
在构建场景时可引用最多三秒的视频,通过视频参考可保持视觉上下文和角色一致性。
Prompt: 使用上传的三个舞蹈视频,将其替换为提供的角色。让这些角色在提供的图像中展现的开阔空间内,同时表演参考视频中的舞蹈动作。
dog.png 狗角色应表演 dance3.mp4 中的古典舞。octo.png 章鱼角色应表演 dance1.mp4 中的嘻哈舞,bear.png 熊角色应表演 dance2.mp4 中的街舞。最终结果应为一个连续镜头,无场景切换。
激发灵感的构建概念
以下是一些示例,展示开发者如何将这些新功能应用于自定义工具和创意工作流程中。
在此应用中,您可以拖入首帧和末帧,通过预设或提示框生成它们之间的过渡,因为Omni的全上下文推理能力可让您获得逼真的镜头运动。
这个应用让摄像机在房间中移动。它做弧线运动,推进,拉远。它以理想的时间展示房屋的 aspirational 状态,不会添加任何不存在的家具或细节。
创作者在确定最终视频前通常会生成多个版本。Draft Room 让这种探索变得廉价且结构化:以360p生成3-4个草稿变体,每次只改变一个元素并并排比较。
了解客户如何将Omni Flash投入生产
我们的客户已通过Agent Platform API通过Gemini Omni Flash驱动真实生产。探索他们创建的视频,了解他们如何在下方使用该模型。
Adobe已将Gemini Omni Flash集成到Adobe Firefly中。观看这段展示其视频编辑功能的视频。
“Gemini Omni Flash 是 Figma Weave 中最强的视频模型之一,画布功能帮助创意团队在每次生成的基础上进行扩展——添加参考素材、创建不同版本,并塑造独特的内容。借助扩展功能、更丰富的参考素材和 4K 分辨率,Gemini Omni Flash 让团队能够超越视频生成,真正实现对视频的掌控。” —— Itay Schiff,Figma Weave 创意总监。
“在 GMI Cloud,我们为创作者提供集中访问全球最强大模型的途径。Gemini Omni Flash 最突出的优势在于其准确性:细节经得起推敲。对于需要制作教育和解释性内容的客户来说,正确性至关重要,这种可靠性比任何单一功能都更重要。Omni 让 AI 视频对之前无法依赖它的用户群体变得可行。” —— Louisa Guo,GMI Cloud 市场副总裁。
“Omni Flash 自然地融入了 Runway 用户现有的工作流程:从提示语、图片或视频开始,然后进行生成或编辑。这是用户快速在创意之间切换的又一种方式。” —— Jamie Umpherson,Runway 首席创意官。
今天使用 Gemini Omni 1.1 Flash 开发
Gemini Omni 1.1 Flash 的定价表。
Omni 1.1 正在 Google 开发者生态系统中全面推出:
- 在 Google AI Studio 开始构建:直接在 Google AI Studio 中体验 Omni 1.1。
- 在 Gemini 企业代理平台构建:企业用户可通过 Agent Platform API 直接使用 Omni 1.1。
- 查阅开发者文档:查看官方文档、实践指南和提示指南,学习如何将场景扩展、视频参考和超分辨率功能集成到您的应用中。
Omni 1.1 现已向全球所有 Google AI Plus、Pro 和 Ultra 订阅者开放,可通过 Google Flow 使用。场景扩展功能也已向全球所有 Google AI Plus、Pro 和 Ultra 订阅者开放,可通过 Gemini 应用使用。
在您的邮箱中获取最新 Google 新闻
订阅我们的新闻通讯,获取产品更新、活动信息、特别优惠等。
完成。只需再完成一步。
检查您的邮箱以确认订阅。
您也可以使用不同的电子邮件地址进行订阅。
您的信息将按照 Google 的隐私政策使用。您可随时选择退出。
发布于: