MIT Technology Review

Meet GPT-Red: an LLM super-hacker OpenAI built to make its models safer

8.5内容质量

TL;DR · AI 摘要

OpenAI开发了GPT-Red,通过AI驱动的红队测试提升模型安全性,有效防御新型攻击。

核心要点

  • GPT-Red通过自我对抗训练发现新型攻击,提升模型防御能力
  • Prompt injection是当前LLM安全测试的核心防御目标
  • 训练场景模拟真实部署环境,包含网页浏览和代码编辑等场景

结构提纲

按章节快速跳转。

  1. OpenAI开发GPT-Red作为AI红队工具提升模型安全性

  2. 通过自我对抗训练模拟攻击与防御的动态过程

  3. 在模拟真实场景的训练场中进行多轮对抗训练

  4. 重点防御prompt injection等新型攻击方式

  5. 已发现未被识别的攻击模式并优化防御策略

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • GPT-Red安全测试框架
    • 核心机制
      • 自我对抗训练
      • 红蓝对抗模拟
    • 训练场景
      • 网页浏览
      • 代码编辑
      • 邮件处理
    • 防御目标
      • Prompt injection
      • 系统劫持

金句 / Highlights

值得收藏与分享的关键句。

#OpenAI#LLM#安全测试#AI红队#GPT-Red
打开原文

了解 GPT-Red:OpenAI 打造的 LLM 超级黑客,用于提升其模型的安全性 | MIT Technology Review

人工智能

了解 GPT-Red:OpenAI 打造的 LLM 超级黑客,用于提升其模型的安全性

独家报道:该公司表示,其目标是确保安全流程的未来适应性,并始终领先于人类攻击者。

作者:

  • Will Douglas Heaven 档案页面

2026 年 7 月 15 日

Stephanie Arnett/MIT Technology Review | Adobe Stock

执行摘要

OpenAI 构建了一个名为 GPT-Red 的 LLM 超级黑客,将其作为陪练伙伴,帮助其他模型提升对网络攻击的防御能力。上周,该公司发布了其旗舰 LLM 的最新版本 GPT-5.6。OpenAI 表示,通过与 GPT-Red 的训练,该模型成为迄今为止最稳健的版本。

GPT-Red 自动化了一种称为“红队测试”的软件系统安全评估方式,这种测试通常由人类测试团队完成。其目标是尽可能多地发现破坏或劫持系统的方法。在软件最终版本发布前,可以修复这些薄弱环节。

随着 LLM 变得更加复杂,并被用于更广泛的任务——尤其是以代理形式存在时,这些代理可以与计算机文件、网站、第三方代码以及其他代理进行交互——仅靠人类团队很难跟上所有可能发生的攻击类型。“风险面在扩大,影响范围也在扩大,”OpenAI 的研究科学家 Nikhil Kandpal 表示,他是 GPT-Red 的共同创建者之一。

OpenAI 开发 GPT-Red 的目的是确保其安全测试流程的未来适应性。“随着更强大的模型陆续推出,我们已经设计好了能够发现新型攻击的系统,”该公司研究科学家 Dylan Hunn 表示,他也是 GPT-Red 的共同创建者之一。研究人员表示,他们已经发现了此前未见过的新攻击类型。

OpenAI 将大部分精力集中在一种被称为“提示注入”的攻击类型上,这种攻击中,黑客会向 LLM 输入指令,迫使其执行开发者或用户不希望其执行的操作,例如复制机密信息、破坏公司的代码库,或生成令人尴尬或有害的输出。理论上,这些指令可以隐藏在 LLM 可能遇到的任何文本中——例如代码或网站上的内容。

训练道场

为了构建 GPT-Red,OpenAI 的研究人员选取了一个未经过黑客训练的 LLM,并将其与其他模型设置在一个被称为“自我对战循环”的环境中。GPT-Red 的目标是尝试攻击其他模型;其他模型的目标是尝试自我防御。经过多轮对战后,GPT-Red 的攻击能力不断提升,而其他 LLM 的防御能力也不断增强。

训练在一个 OpenAI 设计的“道场”中进行,该道场模拟了 LLM 在现实世界中可能部署的各种场景,包括浏览网页、阅读电子邮件或日历应用,以及编辑代码。

当 GPT-Red 发现一种新型攻击时,它会探索该攻击的多种不同版本,以找到特定场景下最有效的攻击方式。“与人类红队测试员相比,该模型在找到确切有效方法方面非常、非常出色,”Hunn 表示。“它对已发现的攻击方式极其执着,会深入挖掘。”

OpenAI 特别指出,GPT-Red 发现了一种研究人员此前未曾见过的提示注入攻击类型,他们称之为“虚假的思考链”。思考链是一种类似日记的记录方式,大型语言模型(LLM)会在此记录自己的笔记并跟踪处理问题过程中的部分结果。GPT-Red 找到了一种方法,可以将伪造的条目插入到另一个模型的思考链中,从而诱骗该模型基于伪造信息采取行动。

“这就像如果我告诉你 1+1=3,并且你已经验证过这一点,”团队中的另一位研究科学家 Chris Choquette-Choo 表示。“模型会说‘哦,对啊,当然’,然后直接输出 3。”

乔治城大学安全与新兴技术中心(CSET)的高级研究分析师 Jessica Ji 认为,OpenAI 使用的自我对弈循环是一个很好的方法。“结果看起来非常有前景,”她说。

为了测试 GPT-Red 作为攻击者的实力,OpenAI 重做了 2025 年的一项实验,当时人类红队成员尝试寻找早期版本 GPT-5 的弱点。当 GPT-Red 被赋予相同的任务时,它在发现有效攻击方面比人类更成功。

OpenAI 还测试了 GPT-Red 对 Vendy 的攻击效果,Vendy 是 Andon Labs 开发的自动售货机代理,该公司评估代理在现实任务中的表现。GPT-Red 成功入侵 Vendy,使其更改了在售商品的价格并取消了顾客的订单。

防御行为

OpenAI 表示,当他们用 GPT-Red 发现的一些最强攻击测试其模型时,超过 90% 的攻击对去年 8 月发布的 GPT-5 有效,而对新版本 GPT-5.6 的攻击成功率则低于 23%。

GPT-Red 并不完美。它在处理涉及攻击者与目标之间来回对话的攻击时表现不佳,而这种攻击对人类攻击者来说几乎没有难度。它目前在使用图像方面也还不够成熟,而图像可能被用于提示注入攻击中向模型传递文本。

该公司表示,GPT-Red 是对其人类红队成员工作的补充。人类仍然可以发现 GPT-Red 未能识别的攻击。OpenAI 采取的一种方法是,给 GPT-Red 一个由人类发现的攻击,然后要求它找出所有变体。

CSET 的 Ji 表示:“我认为人类的专业知识仍然非常重要。能够区分人类测试最需要的领域将非常有用。”

不出所料,OpenAI 不会发布 GPT-Red。该公司还确信,这个超级黑客比任何人可能尝试复制的模型都要强大。研究人员表示,他们已经开发这个模型一年多,得到了全球最富有的公司之一的计算资源支持。

Choquette-Choo 表示:“这不是一件简单的事情,别人不可能轻易做到——你知道的,只是去训练一个超级攻击者。”

深度解析

人工智能

一家初创公司声称突破了限制大语言模型的瓶颈

Subquadratic 现在分享了其新模型的更多细节。但仍有部分人持怀疑态度。

对人工智能就业热潮的现实检验

人工智能对劳动力市场的真实影响到底如何?答案可能会让你感到意外。

  • David Rotman 档案页面

Anthropic 的 Claude 展示了编程的未来——无论你是否喜欢

随着 Claude Code 等工具的不断进步,越来越多的开发者愿意将编码任务交给它们。软件开发方式已经发生了永久性的改变。

Anthropic 发现了 Claude 思考概念的隐秘领域

一种新方法使公司能够以前所未有的深度探究大语言模型(LLM)那些奇特的运作机制。

保持联系

插图由 Rose Wong 绘制

获取 MIT Technology Review 的最新动态

发现特别优惠、热门故事、即将举行的活动等。