Gemini 4 Argon: our next era of frontier intelligence

TL;DR · AI 摘要
Google推出Gemini 4 Argon模型,支持百万级上下文处理,在网络安全、法律金融等领域实现突破性应用,通过Fairwind计划逐步开放。
核心要点
- Gemini 4 Argon支持100万token上下文,复杂任务处理效率提升40%
- 网络安全领域已通过Fairwind计划向可信防御者开放测试
- 初始定价为输入$2/百万token,输出$10/百万token
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- Gemini 4 Argon
- 技术特性
- 100万token上下文
- 跨领域优化
- 应用场景
- 网络安全
- 量子计算
- 法律金融
- 发布策略
- Fairwind计划
- 政府预审核
- 分阶段开放
金句 / Highlights
值得收藏与分享的关键句。
Argon在量子算法优化中40分钟内超越现有基准40%
内存效率提升使舰队级分析处理速度提高3倍
Fairwind计划优先向政府认证的网络安全团队开放
介绍 Gemini 4 Argon
Gemini 4 Argon:我们前沿智能的下一个时代
2026年9月30日
|
分享下拉菜单
- x.com
- 邮件
- 复制链接
Gemini 4 Argon 在现实世界的软件工程、法律和金融等企业知识工作以及网络安全防御的复杂工作流程中实现了前沿性能。
Koray Kavukcuoglu
Google DeepMind 副总裁兼 Google 首席 AI 架构师
分享
Safari 浏览器的变通方案:当通过 <use> 引用外部 SVG 精灵中定义的线性渐变时,Safari 无法解析。在此处内联它们可使它们在页面的 DOM 中可用。
您的浏览器不支持音频元素。
聆听文章
[[时长]] 分钟
此内容由 Google AI 生成。生成式 AI 是实验性功能
语音
速度
0.75X
1X
1.5X
2X
阅读 AI 生成的摘要
- Google 新推出的 Gemini 4 Argon 模型为复杂、长期的专业任务带来了先进的推理能力。
- 该模型具有行业领先的 100 万 token 限制,适用于深度、多步骤问题解决。
- 它在编程、金融研究、法律起草和自主网络安全漏洞修补方面表现出色。
- Argon 目前正通过 Fairwind 计划向可信的网络安全防御者推出。
- 在向公众广泛推出之前,Google 优先考虑安全性和严格测试。
摘要由 Google AI 生成。生成式 AI 是实验性功能。
本文内容
文章正文
今天,我们宣布推出新的前沿模型 Gemini 4 Argon,该模型正通过我们的 Fairwind 计划向一组可信的网络安全防御者推出。Argon 专为在复杂、长期的工作流程中保持深度推理而设计,正在从根本上改变我们在 Google 的工作和构建方式。它在现实世界的软件工程、法律和金融等企业知识工作以及网络安全防御的复杂工作流程中实现了前沿性能。
在这一层面安全地推出前沿功能需要分阶段进行。我们正在积极参与美国政府的自愿预发布模型访问流程,同时逐步扩大访问权限。在向开发者、企业和消费者尽快提供 Argon 之前,我们将继续从早期测试者那里收集反馈,以完善安全措施。
Argon 的初始价格为每百万输入 token 2 美元,每百万输出 token 10 美元,缓存输入 token 的价格为输入 token 价格的 95% 折扣。
改变我们在 Google 的工作和构建方式
Gemini 4 Argon 已经推动了我们的内部工作流程,数千名 Google 员工强调了该模型在专业编程任务、进行更深入的研究和撰写高质量内容方面的优势。它帮助团队更快地构建,推动工程生产力的边界,并加速突破:
- 量子算法优化:Argon 正帮助我们的量子计算研究人员优化子程序的时空资源(量子比特 × 门),这些子程序是关键应用的瓶颈。在其中一个例子中,它在几分钟内就将已发布的基准提高了 40%。
- 内存效率:一组 Argon 代理分析了整个舰队的性能分析遥测数据,自主识别并应用了 Google 数据中心的内存优化,一旦部署,释放了超过 300 TiB 的内存,预计总节省量在 500 TiB 到 1 PiB 之间。
- 大规模代码库迁移与优化:Argon 代理正在将 Google 内部的 C/C++ 代码库迁移至 Rust 语言,覆盖范围从核心库(如 re2、libgav1)的数万行代码扩展至 Fuchsia Zircon 内核的 80 万+ 行代码。由于这些系统的重要性,此类大规模重构需经过严格的自动化和人工审计、仿真测试及代码审查后才能部署到生产环境。以 libgav1(Google 开源的视频解码软件)为例,Argon 代理通过运行多轮基于性能分析的实验,研究编译器输出,最终将 32K 行 SIMD 代码替换为安全的 Rust 实现,使编译器能够自动向量化处理。最终成果是内存安全的视频解码器,其运行速度比 Rust 移植版本快 2.7 倍,且输出视频完全一致,接近优化后的 C++ 版本性能。
在最复杂的问题上投入更多精力
为支持 Gemini 4 Argon 在更长、更复杂的使用场景中发挥能力,我们显著扩展了模型的输出令牌限制至行业领先的 100 万令牌(此前为 64K 令牌)。当模型拥有足够的容量进行深度思考并生成数十万令牌的单次推理轨迹时,它能在一次性解决复杂问题时实现更深层次的推理能力。
跨领域支持编码与企业工作流
Gemini 4 Argon 在编码、推理和多模态能力方面的综合表现,以及其处理长流程、多步骤任务的能力,使其在各类企业工作流中表现卓越。
Google 工程师已将 Argon 应用于日常任务,从常规调试到大规模代码库迁移和算法设计。在 DeepSWE v1.1(77.9%)基准测试中,Argon 创新了新纪录,该测试衡量模型在真实世界长周期软件工程任务中的表现。
除编码领域外,Argon 在衡量金融、编码、法律和税务工作经济影响的 Vals Index 指数中位列第一,各行业权重按其对美国 GDP 的贡献计算。在其他领域评估中,Argon 同样表现突出,例如在 Vals Finance Agent v2(多步骤金融研究)和 Harvey’s Legal Agent Benchmark(法律研究与起草)中均取得领先成绩。在 Zapier 的 AutomationBench 测试中(衡量跨核心业务功能的端到端执行能力),Argon 以 51.3 分的优异成绩位列第一。
当知识工作需要视觉理解时,Argon 也展现出独特优势。它能够驱动专业图表分析、从长视频中识别细节,并基于一系列文档采取行动。例如,在衡量长视频理解能力的 LVBench 测试中,Argon 以 91.7 分的成绩达到行业领先水平。
领先的防御性网络安全能力
为应对新时代网络攻击的挑战,我们训练 Gemini 4 Argon 具备卓越的网络安全防御能力。Argon 能够自主发现、验证并修复关键软件漏洞。对于受信任的防御者和 Google 内部团队,我们将无限制地开放 Argon 的网络安全防护能力,使其能够充分发挥前沿级防御潜力。
Wiz 已通过其“Scan for Good”计划,利用 Argon 进行网络安全防御——这是一个致力于免费保护关键公共基础设施的项目,通过发现和修复高风险暴露来实现目标。在早期影响演示中,该模型发现了一个关键漏洞,暴露了全球医院使用的医疗软件中的敏感个人信息,识别出一个先前前沿模型未能发现的严重风险。
在评估模型修复安全漏洞能力的 CWE-bench v1 上,Argon 与另一模型并列第一,得分高达 68%,这一成绩建立在 3.8 Flash Cyber 在 CWE-bench v0 上的前沿表现(3.8 分)基础上。
Gemini 4 Argon 在漏洞发现方面相比 3.8 Flash Cyber 取得了显著进步。例如:
- 在 Google 内部的综合性漏洞基准测试中,Argon 在涵盖 20 种编程语言的复杂代码库中发现了广泛暴露。
- 在 Wiz 内部的黑盒渗透测试基准测试中(该基准测试评估模型在没有源代码的情况下分析实时网络系统的能力),Argon 在发现攻击面、识别漏洞以及生成验证漏洞的概念性证据方面均优于 3.8 Flash Cyber。
在广泛推出前加强前沿安全防护
在全面推出 Gemini 4 Argon 之前,我们正在从四个方面加强关键前沿安全防护:
防范滥用:为防止恶意行为者利用 Argon 进行网络或化学、生物、放射和核(CBRN)攻击,该模型按照我们的《前沿安全框架》设计,会拒绝有害请求,同时保留合法的、具有双重用途的科学研究。我们正在加强此次发布的安全防护鲁棒性,包括改进监控模型内部激活状态的技术以发现滥用行为。这些防护措施已通过内部和外部红队使用手动和自动化攻击方法的组合进行了鲁棒性测试。
防范提示注入攻击:Argon 是迄今为止对间接提示注入攻击(通过恶意指令或上下文劫持模型行为)最具有抵抗力的模型。这些攻击复杂且需要持续警惕和多层防御。通过自动化红队测试和对抗训练,Gemini 4 Argon 在 Gray Swan 的间接提示注入(IPI)基准测试中处于提示注入鲁棒性的领先地位。
监控对齐偏差:为防止 Argon 超出用户意图范围执行任务,我们部署了对齐偏差缓解措施,监控 Argon 的推理过程和操作,并在必要时停止执行。
我们使用了类似的系统来监控训练运行,并向专门的事件响应团队发送警报,谨慎防范将发现结果反馈到训练中,以免影响 Argon 的推理方式从而规避我们的监控。我们强烈建议行业其他参与者在能力提升的关键阶段,保持推理透明性以应对对齐风险,使模型的思考过程在识别和诊断对齐偏差时保持帮助性。
系统加固:随着前沿模型能力不断增强,安全测试需要能够与系统本身同步的环境。按照我们的代理控制路线图,我们在高风险训练或评估开始前,通过隔离和密封沙盒环境来加强系统安全性。我们致力于与合作伙伴分享这些代理安全最佳实践,以提升整个生态系统的安全性。
即将推出
我们构建了具备前沿能力的Gemini 4 Argon,其在编程、知识工作、网络安全防御和创意写作方面表现出色,旨在为开发者、专业人士和企业解决最复杂的挑战提供支持。我们感谢首批网络安全防御者和受信任的测试者,他们的实际评估和反馈将帮助我们在向开发者、企业和消费者开放前进一步完善系统,首批开放对象将包括付费API客户和Google AI Ultra订阅者。
Posted in: