Seedance 2.0 最强对手偷跑了
Google 推出 Gemini Omni 视频生成模型,实测在文本连贯性与物理逻辑还原上超越 Seedance 2.0,支持视频编辑与内容重混,虽短暂泄露后消失,但已引发行业震动。
入选理由:Gemini Omni 在数学板书视频中实现文本完全一致,解决 AI 视频长期存在的文字渲染缺陷。
模型
别名:geminiomni
谷歌最新多模态模型
已跟踪 30 条高相关材料
最近变化
2026-08-18 · Chrome扩展使用Gemini 3.7 Flash实现文本到视觉定义的实时生成
为什么值得关注
Gemini Omni 被反复提及时,通常意味着它正在影响产品路线、开发者工作流或 AI 产业判断。这个页面把分散材料合并成一个可持续更新的观察入口。
Seedance 2.0 最强对手偷跑了
爱范儿 · 8.7 分
Google 推出 Gemini Omni 视频生成模型,实测在文本连贯性与物理逻辑还原上超越 Seedance 2.0,支持视频编辑与内容重混,虽短暂泄露后消失,但已引发行业震动。
Introducing Gemini 3.7 Flash
Google DeepMind Blog · 8.5 分
Google发布Gemini 3.7 Flash,性能提升显著且价格降低50%,适用于复杂编码和代理任务。
Omni experts share what excites them most about the model.
The Keyword (blog.google) · 8.5 分
Gemini Omni模型通过对话式交互实现视频生成,由Google DeepMind团队开发,未来将扩展更多功能。
已收录 30 条与 Gemini Omni 相关的内容,按评分排序。
Google 推出 Gemini Omni 视频生成模型,实测在文本连贯性与物理逻辑还原上超越 Seedance 2.0,支持视频编辑与内容重混,虽短暂泄露后消失,但已引发行业震动。
入选理由:Gemini Omni 在数学板书视频中实现文本完全一致,解决 AI 视频长期存在的文字渲染缺陷。
Google发布Gemini 3.7 Flash,性能提升显著且价格降低50%,适用于复杂编码和代理任务。
入选理由:Gemini 3.7 Flash在FrontierCode 1.1 Main任务中准确率提升30.6%(43.6% vs 34.4%)
Gemini Omni模型通过对话式交互实现视频生成,由Google DeepMind团队开发,未来将扩展更多功能。
入选理由:Gemini Omni Flash使视频生成如对话般简单
Black Forest Labs发布FLUX 3多模态模型,在视频生成和机器人控制领域超越现有主流模型,开放权重版本即将推出。
入选理由:FLUX 3支持文本/图像/视频到视频的生成及多语言对话,覆盖10种视觉风格
AI视频工具让非专业人士快速生成高质量视频,但角色一致性仍是挑战。
入选理由:使用Gemini Omni可在15分钟内生成完整视频,无需视频制作经验。
Google 发布 2026 年 5 月 AI 更新,推出 Gemini 3.5 模型与 Omni 工具,推动 AI 主动化与跨领域应用。
入选理由:Gemini 3.5 实现前沿智能代理与代码生成,Omni 融合推理与创作能力
Google 发布 Gemini Omni 视频模型,支持多模态输入并具备物理理解能力,填补 Sora 停运后的免费市场空白。
入选理由:Gemini Omni 支持文本、图像、音频、视频和绘图五种输入方式生成视频。
Google I/O 2026为初创公司推出Gemini 3.5系列模型、Agentic Data Cloud及安全平台整合,提供高效AI开发与成本优化方案。
入选理由:Gemini 3.5 Flash模型性能媲美大模型但速度提升,成本低于同类产品50%
Gemini Omni Flash是DeepMind推出的新模型,能够通过多种输入生成高质量视频并支持自然语言编辑,结合物理知识与世界知识实现创意与准确性的平衡。
入选理由:Gemini Omni Flash支持通过文本、图像、视频或音频输入生成视频,并允许通过对话逐步编辑,保持场景连贯性。
Google Cloud 在 I/O 大会发布 Gemini 3.5 Flash 与 Gemini Omni 模型,并推出 Gemini Spark 智能体与 CodeMender 安全工具,显著提升了企业级 AI 的视频生成、代码编写及自动化能力。
入选理由:Gemini 3.5 Flash 在 Terminal-Bench 2.1 达到 76.2% 分数,成本低于同类模型一半。
Google 在 I/O 2026 发布了多个 AI 更新,包括更快更便宜的 Gemini 3.5 Flash 和功能强大的多模态模型 Gemini Omni,引发社区热议。
入选理由:Gemini 3.5 Flash 模型速度比 3.1 Pro 快两倍以上,API 定价为输入 $150/百万 tokens。
Google I/O宣布进入Agentic Era,推出Gemini 3.5系列模型及多模态Gemini Omni,强化AI代理功能与Gemini App交互体验。
入选理由:Gemini 3.5 Flash成为默认模型,提升速度、编码和多模态能力,预计6月发布Pro版本
Google在I/O大会上发布Gemini Omni视频生成模型和Gemini 3.5 Flash极速编程模型,同时升级AI搜索至Agent模式,并推出个人AI助手Gemini Spark,标志着Google从传统搜索引擎向AI信息Agent平台的战略转型。
入选理由:Gemini 3.5 Flash输出速度比其他前沿模型快4倍,Antigravity优化后可达12倍,Google内部开发任务已超每天3万亿tokens处理量
Google I/O 2026揭示了将Gemini集成到每个产品中的AI代理策略,规模从每月9.7万亿扩展到3.2千万亿token,新的TPU芯片分为训练/推理专用,Gemini Omni作为能够理解现实的多模态模型成为头条。
入选理由:Google scaled from 9.7T to 3.2 quadrillion tokens/month in 2 years, showing explosive AI usage growth
Google Gemini Omni 是首个原生多模态理解与生成模型,支持图文音视频任意组合输入,实现对话式视频编辑与物理世界知识推理,显著超越Veo等前代模型。
入选理由:Gemini Omni 支持图、文、视频、音频任意组合输入,实现多轮对话式视频编辑,无需重述完整提示词。
Google DeepMind利用AI技术重建贝利1959年未被记录的著名进球,结合历史资料与先进模型实现数字复原。
入选理由:使用Veo、Gemini Omni和Nano Banana Pro三款AI模型进行重建
Google Gemini App发布Gemini Omni,旨在减少屏幕时间,增加户外活动。
入选理由:Google Gemini App发布Gemini Omni,旨在减少屏幕时间,增加户外活动。
Google I/O 2024展示了Gemini Omni等新模型,强调多模态生成能力,但实际性能受限,与OpenAI在消费端展开门户争夺战。
入选理由:Google的Gemini Omni模型支持多模态生成,但测试中对视频/图像输入限制严格,质量与Cine Dance 2相当。
Gemini Omni是DeepMind推出的新多模态生成模型,结合VEO、Nano Banana等模型实现视频、图像和交互式模拟的生成与编辑,支持物理概念理解和自然语言视频编辑,现已推出Gemini Omni Flash版本。
入选理由:Gemini Omni整合了Gemini的推理能力和生成模型,实现多模态内容创作与物理模拟(如动能和重力)。
Google发布了一系列新的AI功能和产品,包括Gemini Omni多模态模型和Gemini 3.5 Flash,能通过自然语言对话生成和编辑视频,并在代理编码方面表现优异。
入选理由:Gemini Omni是新的多模态模型家族,专注于视频创建和编辑,能理解复杂物理概念并生成高度准确的视频内容。
Google的新Gemini Omni模型在泄露的演示中展示了强大的性能,定价策略也引起关注。
入选理由:Gemini Omni在图像生成和自然语言处理方面表现出色。
使用Google Flow结合Gemini Omni模型,可在15分钟内完成从人脸扫描到生成1分钟AI数字人视频的全流程。该工具通过角色一致性功能解决多镜头连贯问题,并利用AI辅助生成分镜脚本,显著降低无视频制作经验者的创作门槛,但目前在微表情和物理规律模拟上仍存在恐怖谷效应。
入选理由:Google Flow配合Gemini Omni模型,支持5分钟内完成人脸扫描与AI分身创建。
Gemini 已服务 9 亿月活用户,Google I/O 2026 将发布 Gemini 3.5 Flash、Gemini Omni 视频模型及 Gemini Spark 主动式助理,强调多模态、主动交互与本地化体验。
入选理由:Gemini 用户规模达 9 亿/月,覆盖 230 国、70+ 语言;Google I/O 2026 将发布 Gemini 3.5 Flash 和 Gemini Omni。
Google I/O 2026发布Gemini Spark和Gemini Omni,前者集成Gmail/Drive/Calendar,后者重新定义用户界面,AI生成动态界面取代固定应用。
入选理由:Gemini Spark与Google服务深度集成,无需复杂配置,适合日常用户
Google I/O 2026 推出了 Gemini Spark 和 Gemini Omni,前者集成 Gmail、Drive 和 Calendar,后者可能重新定义用户界面。
入选理由:Gemini Spark 集成 Gmail、Drive 和 Calendar
Google 推出 Gemini Omni 模型,支持任意输入生成任意内容,首批集成至 Gemini App、Flow 和 YouTube,API 即将开放。
入选理由:Gemini Omni 可根据任意输入生成任意内容,首批支持视频生成,类似‘Nano Banana’的视频版
Google DeepMind 发布了 Gemini Omni 模型,结合了 Gemini 的智能与生成式媒体模型,显著提升了物理模拟和视频编辑能力,并推出了首个版本 Gemini Omni Flash。
入选理由:Gemini Omni 结合了 VEO、Nano Banana 等模型,能生成逼真视频和交互式模拟。
Google推出基于Gemini 3.7 Flash的Chrome扩展,通过高亮文本生成视觉定义,但技术细节和工程实践描述不足。
入选理由:Chrome扩展使用Gemini 3.7 Flash实现文本到视觉定义的实时生成
Pika展示Gemini Omni在视频编辑中的多场景应用,支持背景替换、角度调整等操作。
入选理由:Gemini Omni支持视频背景替换、角度调整、服装更换等操作
Gemini Omni 首次实现任意照片/视频/音频输入并实时生成新场景,标志着多模态编辑进入“任意输入-任意输出”阶段。
入选理由:支持用户上传自有视频并迭代创意