Introducing agentic video understanding with Gemini
TL;DR · AI 摘要
Google DeepMind推出Gemini模型的agentic视频理解功能,可减少88%的token消耗,降低成本66%,并提升7%准确性。
核心要点
- agentic视频理解减少88%token消耗,降低成本66%
- Gemini 3.7 Flash在质量与成本效率上表现最佳
- 动态扫描视频段提升准确性7%
结构提纲
按章节快速跳转。
- §引言
Google DeepMind推出Gemini模型的agentic视频理解功能,显著提升视频分析效率。
- ·核心机制
通过动态扫描视频片段,结合音频、字幕和视觉帧进行分析。
- ›基准测试
减少66%成本和88%token消耗,准确性提升7%。
- ·应用场景
适用于长视频分析,如教程、讲座和多小时录音。
- ›技术细节
与静态处理相比,动态扫描避免关键细节丢失。
- ·未来展望
计划扩展至更多模型和平台,优化视频处理能力。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- Agentic Video Understanding in Gemini
- 核心机制
- 动态扫描视频段
- 结合音频/字幕分析
- 性能优势
- 88% token节省
- 66%成本降低
- 7%准确率提升
- 应用场景
- 长视频分析
- YouTube视频处理
金句 / Highlights
值得收藏与分享的关键句。
agentic视频理解减少88%token消耗,降低成本66%,提升7%准确性
动态扫描视频段可精准检索子秒级片段,提升异常检测精度
Gemini 3.7 Flash在质量与成本效率上优于其他版本
介绍 Gemini 的智能视频理解
介绍 Gemini 的智能视频理解功能
2026年9月1日
|
分享下拉菜单
- x.com
- 邮件
- 复制链接
我们新的智能视频分析功能可将令牌消耗量减少高达 88%,成本降低高达 66%,并提升质量高达 7%。
Rohan Doshi
Google DeepMind 高级产品经理
Mario Lučić
Google DeepMind 研究总监
分享
Safari 浏览器的变通方法:当通过 <use> 引用外部 SVG 精灵中定义的线性渐变时,Safari 无法解析。在此处内联它们可使它们在页面的 DOM 中可用。
您的浏览器不支持音频元素。
聆听文章
[[时长]] 分钟
此内容由 Google AI 生成。生成式 AI 是实验性功能
语音
速度
0.75X
1X
1.5X
2X
阅读 AI 生成的摘要
Google 今天为 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 推出了智能视频理解功能。此功能使模型能够动态扫描视频片段,在提升准确性的同时将令牌使用量减少高达 88%,成本降低高达 66%。您今天可以通过在 Google AI Studio 或 Gemini 企业代理平台中将 API 配置设置为 "agentic" 开始使用此功能。
摘要由 Google AI 生成。生成式 AI 是实验性功能。
文章正文
今天,我们向最新模型推出了智能视频理解功能:Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite。这项新功能在显著降低视频分析的令牌使用量和成本的同时,提高了准确性。类似于将代码执行与 Gemini 模型的原生图像理解相结合的智能视觉功能,智能视频理解功能利用 Gemini 的原生视频工具来提升性能,并解锁视频处理的新功能,如亚秒级时刻检索、更精确的异常检测、精准计数等。
该功能今天可通过 Google AI Studio 和 Gemini 企业代理平台中的 Gemini API 用于视频上传和 YouTube 视频。
基准测试
与当前的“静态”处理方式不同,静态处理中模型以固定的每秒帧率(默认 1 FPS,可通过 API 调整)摄入视频,智能视频理解功能将模型的核心推理与原生视频工具相结合,动态搜索、扫描和检查目标视频片段的视觉帧、音频和字幕。在标准视频分析基准测试中,配备智能视频理解功能的 Gemini 模型可将分析成本降低高达 66%,令牌消耗量减少高达 88%,同时将准确性提高高达 7%。
这些效率提升在长视频(从 10 分钟的教程到 90 分钟的讲座和多小时的录音)中尤为明显,静态处理迫使开发人员在高额令牌成本和会遗漏关键细节的技术之间做出选择。
启用智能视频理解功能可将令牌消耗量减少高达 88%,并提升准确性高达 7%(使用 Gemini 3.7 Flash)。
尽管这些提升适用于所有三个支持的模型,但配备智能理解功能的 Gemini 3.7 Flash 在整体质量上表现最佳,并在质量和成本效率之间实现了最佳平衡,使其在视频理解测试模型中处于准确性与成本的帕累托前沿。
使用智能视频理解功能使 Gemini 3.7 Flash 在视频分析的准确性与成本之间达到帕累托前沿。
实现方式
与静态处理方式(模型以固定帧率摄入媒体流)不同,智能视频理解使Gemini能够以主动、目标导向的方式决定观看内容、速度及媒介(帧、音频或字幕),仅获取必要的片段和信号。尽管开发者此前可以手动实现此功能,但借助智能视频理解,Gemini可通过智能循环自动完成,调用内部工具加载视频文件的相关部分,显著降低开发成本。
功能与应用场景
智能视频理解改变了开发者处理长视频内容的方式,适用于多种严苛的应用场景。
- 亚秒级瞬间检索:精准定位1 FPS下容易被忽略的瞬时状态变化和紧密切换边界,实现精确的自动化视频编辑。
- 长视频大海捞针搜索:无需消耗数百万token,即可跨多小时视频回答复杂查询。
- 异常检测:对有趣的时间窗口以更高FPS重新采样,检查快速运动和细微视觉异常。
- 动作与物体计数:准确追踪随时间重复的物理动作和不同物体。
高效长视频分析(token优化)
在LongVideoBench(长视频理解基准测试)中,观察Gemini 3.7 Flash在启用/禁用智能视频理解时的表现差异。注意token消耗显著减少且准确率提升。
动态FPS实现快速动作分析
借助智能视频理解,3.7 Flash可通过按需以不同帧率扫描和重看视频,准确统计快速动作。
高效长视频大海捞针搜索
通过智能视频理解,Gemini 3.7可在消耗远少于静态分析token数量的情况下,准确回答基于视频内容的复杂问题。
实际应用效果
许多早期接入合作伙伴在测试智能视频理解时表现出色。以下是他们的反馈:
入门指南
智能视频理解现已通过Gemini API在Google AI Studio和Gemini Enterprise Agent Platform上线,覆盖Gemini 3.7 Flash、3.6 Flash和3.5 Flash-Lite。采用标准Gemini API token计费方式,无额外功能费用。
只需在API配置中将处理模式设置为"agentic"即可启用。阅读我们的开发者指南,了解该功能的更多细节及使用方法。
from google import genai
client = genai.Client()
interaction = client.interactions.create(
model="gemini-3.7-flash",
input=[
{
"type": "video",
"uri": "https://youtu.be/7Z5Vy9JBANs",
"processing": "agentic"
},
{
"type": "text",
"text": "What are the 3 most important announcements in this keynote?",
},
],
)
print(interaction.output_text)我们也将代理视频理解的效率和质量提升带给全球数十亿谷歌用户。该功能将很快在Gemini应用的Flash和Flash-Lite模型中向所有用户推出。未来几个月内,代理视频理解技术还将用于YouTube视频播放页面的"Ask YouTube"功能,利用Gemini提供基于视觉内容的高质量答案。
感谢以下人员对本工作的贡献:Sergi Caelles、Filip Pavetić、Ahmet Iscen、Suhas Yogin以及代理视觉团队。
订阅获取最新谷歌资讯
订阅我们的电子报,获取产品更新、活动信息、特别优惠等内容。
订阅完成。只需再完成一步。
检查邮箱确认订阅。
您也可以使用其他邮箱地址订阅。
您的信息将按照谷歌隐私政策使用。您可随时取消订阅。
发布于: