Google DeepMind Blog

Introducing Gemini 3.5 Flash Cyber

8.5内容质量
Introducing Gemini 3.5 Flash Cyber

TL;DR · AI 摘要

Google推出Gemini 3.5 Flash Cyber模型,通过轻量化设计和CodeMender工具实现高效漏洞检测,基准测试表现与大模型相当。

核心要点

  • Gemini 3.5 Flash Cyber基于3.5 Flash构建,适合大规模代码扫描场景
  • 通过CodeMender部署,优先提供给政府和可信合作伙伴
  • 在CyberGym基准测试中,单次调用成本降低80%仍保持竞争力

结构提纲

按章节快速跳转。

  1. 介绍Google在网络安全领域的长期投入及当前AI漏洞检测的挑战。

  2. 阐述Gemini 3.5 Flash Cyber的轻量化设计及其相对于主模型的优势。

  3. 说明有限试点计划及政府优先接入的部署方案。

  4. 展示CyberGym测试中模型性能与成本效益的对比数据。

  5. 描述模型在持续扫描和紧急响应场景中的集成方案。

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • Gemini 3.5 Flash Cyber
    • 技术优势
      • 轻量化架构
      • 高吞吐扫描
    • 部署方案
      • 政府优先接入
      • CodeMender集成
    • 验证数据
      • CyberGym基准
      • 成本效益比

金句 / Highlights

值得收藏与分享的关键句。

#Gemini#网络安全#AI模型#CodeMender#DeepMind
打开原文

介绍 Gemini 3.5 Flash Cyber — Google DeepMind

2026年7月21日

模型

介绍 Gemini 3.5 Flash Cyber

Raluca Ada Popa 和 Four Flynn

分享

多年来,Google 一直在网络安全领域进行投资,率先开发自动化漏洞发现技术以保护全球代码库。我们的代码安全代理 CodeMender 等工具可以自动查找并修复关键软件漏洞。但随着 AI 代理在发现漏洞方面的速度越来越快,远超防御者修复漏洞的速度,应对这一全球性威胁需要一种高效、经济且可扩展的方法。

今天,我们通过推出基于 3.5 Flash 构建、经过微调以快速高效地发现、验证和修补漏洞的轻量级网络安全模型 Gemini 3.5 Flash Cyber,进一步扩展了我们长期以来的努力。与 Gemini 主线 Flash 模型相比,3.5 Flash Cyber 在这些任务中表现得更加高效。

Flash 的性能和效率使其成为我们网络安全模型工作的理想基础。基于 Flash 构建的 3.5 Flash Cyber 提供了一种成本效益高且功能强大的替代方案,相较于大型且昂贵的网络安全模型。

鉴于这项技术的双重用途性质,我们对部署 3.5 Flash Cyber 的方式采取了谨慎的策略。作为有限访问试点计划的一部分,3.5 Flash Cyber 将通过 CodeMender 仅向政府和可信合作伙伴独家提供,并将随着时间推移逐步扩展。这将使一线防御者在漏洞被利用之前获得先发优势,提前发现和修复关键漏洞,同时降低被广泛滥用的风险。

另外,我们还通过 Gemini 企业代理平台,将 CodeMender 的基础功能直接带给客户,使用通用可用的 Gemini 模型。

搜索空间问题:轻量级模型在代码安全中的优势

发现深层次缺陷需要探索巨大的执行搜索空间。依赖对大型语言模型的单次昂贵调用可能会造成瓶颈。3.5 Flash Cyber 特别适用于代理需要扫描大型代码库并分析大量代码路径的漏洞发现场景。

CodeMender 会多次调用 3.5 Flash Cyber,使代理能够分析大量代码路径以发现和验证漏洞。子代理随后生成一份高质量的单一报告。

得益于其速度和经济性,3.5 Flash Cyber 可轻松集成到频繁扫描、时间敏感的发布流程或大规模提交扫描流水线中。

3.5 Flash Cyber 基准测试结果:大型网络安全模型的高效替代方案

我们在各种基准测试中测试了 3.5 Flash Cyber。特别是,我们在 CyberGym 基准测试中测试了 3.5 Flash Cyber,该基准测试通过数百个现实世界的软件漏洞评估 AI 代理。通过配置 CodeMender 对单个最终报告最多调用 3.5 Flash Cyber 五次,利用 3.5 Flash Cyber 的低成本,整体代理在 CyberGym* 上的表现与显著更大的模型相当。

CyberGym 成功率(pass@1)

*竞争对手结果来源于供应商自报成绩

我们还对模型在不设置安全防护措施的情况下进行了压力测试。Google的Big Sleep团队独立构建了评估体系,专注于发现Chrome和Safari等全球最复杂代码库中的关键性且难以发现的漏洞。在此测试中,3.5 Flash Cyber显著超越了主版本3.5 Flash和3.6 Flash。

Big Sleep评估成功率(pass@1)

3.5 Flash Cyber还被纳入Google Chrome的生产提交扫描流水线进行评估。这些漏洞未公开披露,确保该基准对Gemini和其他竞争模型保持无污染状态。

结果显示,与3.5 Flash相比,3.5 Flash Cyber有显著提升。注意:Opus 4.6之后的最新竞争模型版本由于内置的安全防护机制,拒绝执行相关任务,因此未在测试中展示。

Chrome生产提交扫描流水线成功率(pass@1)

此外,与主版本3.5 Flash和Claude Opus 4.6相比,3.5 Flash Cyber持续发现更多独特的漏洞。在对高度复杂的V8 JavaScript引擎进行固定次数调用测试时,3.5 Flash Cyber发现了55个确认的唯一问题,而主版本3.5 Flash发现了47个,Opus 4.6发现了36个,其中包含其他两个模型未能发现的10个问题。

基础网络安全模型可能陷入重复发现相同问题的循环,而忽视关键漏洞。强大的模型则能扩大覆盖范围,发现更多独特的安全问题。

随着调用次数的增加,我们发现3.5 Flash Cyber持续发现新的代码路径和漏洞。

在Google的实际应用与防御扩展

基准测试仅是故事的一部分。CodeMender中的3.5 Flash Cyber已在Google内部代码库(包括Chrome、Android、Cloud、Ads和YouTube)中发现并修复了漏洞。

轻量化模型带来的发现速度已产生可衡量的影响。

例如,Google Cloud漏洞研究团队利用3.5 Flash Cyber在创纪录的时间内主动加固了系统。仅用2小时,该模型就在公共API中发现了远程代码执行漏洞,并在敏感生产服务中发现了一个内存损坏漏洞。随后,模型生成了100%可靠的远程代码执行利用工具,绕过了地址空间布局随机化(ASLR)和写入异或执行(W^X)等标准缓解技术。

来自Wiz和Cloud CISO安全工程测试人员的早期反馈证实了3.5 Flash Cyber相比主版本3.5 Flash模型的显著能力提升。

扩展规模的防御能力建设

Google在软件安全领域的领先地位为我们提供了独特优势。例如,由Google运营的OSV.dev漏洞数据库(涵盖超过70万个开源漏洞)以及十年以上的OSS-Fuzz测试结果,帮助我们识别最高质量的漏洞。

这使我们能够超越合成的网络安全示例,教会模型如何真实安全专家工作。我们的模型学习操作行业标准工具,分析Chromium等大规模项目中的数百万行代码,并独立处理需要数小时持续深度分析的复杂安全任务。

通过为 CodeMender 赋能 3.5 Flash Cyber,我们正在提供一种功能强大、可扩展且经济实惠的架构,旨在帮助更多防御者保护软件安全。