Meet GPT-Red: an LLM super-hacker OpenAI built to make its models safer
TL;DR · AI 摘要
OpenAI开发了GPT-Red,通过AI驱动的红队测试提升模型安全性,有效防御新型攻击。
核心要点
- GPT-Red通过自我对抗训练发现新型攻击,提升模型防御能力
- Prompt injection是当前LLM安全测试的核心防御目标
- 训练场景模拟真实部署环境,包含网页浏览和代码编辑等场景
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- GPT-Red安全测试框架
- 核心机制
- 自我对抗训练
- 红蓝对抗模拟
- 训练场景
- 网页浏览
- 代码编辑
- 邮件处理
- 防御目标
- Prompt injection
- 系统劫持
金句 / Highlights
值得收藏与分享的关键句。
GPT-Red通过自我对抗训练,发现新型攻击方式,提升模型防御能力
训练场景包含网页浏览、邮件阅读和代码编辑等真实部署环境
相比人类红队,GPT-Red能更精确地定位攻击漏洞
了解 GPT-Red:OpenAI 打造的 LLM 超级黑客,用于提升其模型的安全性 | MIT Technology Review
人工智能
了解 GPT-Red:OpenAI 打造的 LLM 超级黑客,用于提升其模型的安全性
独家报道:该公司表示,其目标是确保安全流程的未来适应性,并始终领先于人类攻击者。
作者:
- Will Douglas Heaven 档案页面
2026 年 7 月 15 日
Stephanie Arnett/MIT Technology Review | Adobe Stock
执行摘要
OpenAI 构建了一个名为 GPT-Red 的 LLM 超级黑客,将其作为陪练伙伴,帮助其他模型提升对网络攻击的防御能力。上周,该公司发布了其旗舰 LLM 的最新版本 GPT-5.6。OpenAI 表示,通过与 GPT-Red 的训练,该模型成为迄今为止最稳健的版本。
GPT-Red 自动化了一种称为“红队测试”的软件系统安全评估方式,这种测试通常由人类测试团队完成。其目标是尽可能多地发现破坏或劫持系统的方法。在软件最终版本发布前,可以修复这些薄弱环节。
随着 LLM 变得更加复杂,并被用于更广泛的任务——尤其是以代理形式存在时,这些代理可以与计算机文件、网站、第三方代码以及其他代理进行交互——仅靠人类团队很难跟上所有可能发生的攻击类型。“风险面在扩大,影响范围也在扩大,”OpenAI 的研究科学家 Nikhil Kandpal 表示,他是 GPT-Red 的共同创建者之一。
OpenAI 开发 GPT-Red 的目的是确保其安全测试流程的未来适应性。“随着更强大的模型陆续推出,我们已经设计好了能够发现新型攻击的系统,”该公司研究科学家 Dylan Hunn 表示,他也是 GPT-Red 的共同创建者之一。研究人员表示,他们已经发现了此前未见过的新攻击类型。
OpenAI 将大部分精力集中在一种被称为“提示注入”的攻击类型上,这种攻击中,黑客会向 LLM 输入指令,迫使其执行开发者或用户不希望其执行的操作,例如复制机密信息、破坏公司的代码库,或生成令人尴尬或有害的输出。理论上,这些指令可以隐藏在 LLM 可能遇到的任何文本中——例如代码或网站上的内容。
训练道场
为了构建 GPT-Red,OpenAI 的研究人员选取了一个未经过黑客训练的 LLM,并将其与其他模型设置在一个被称为“自我对战循环”的环境中。GPT-Red 的目标是尝试攻击其他模型;其他模型的目标是尝试自我防御。经过多轮对战后,GPT-Red 的攻击能力不断提升,而其他 LLM 的防御能力也不断增强。
训练在一个 OpenAI 设计的“道场”中进行,该道场模拟了 LLM 在现实世界中可能部署的各种场景,包括浏览网页、阅读电子邮件或日历应用,以及编辑代码。
当 GPT-Red 发现一种新型攻击时,它会探索该攻击的多种不同版本,以找到特定场景下最有效的攻击方式。“与人类红队测试员相比,该模型在找到确切有效方法方面非常、非常出色,”Hunn 表示。“它对已发现的攻击方式极其执着,会深入挖掘。”
OpenAI 特别指出,GPT-Red 发现了一种研究人员此前未曾见过的提示注入攻击类型,他们称之为“虚假的思考链”。思考链是一种类似日记的记录方式,大型语言模型(LLM)会在此记录自己的笔记并跟踪处理问题过程中的部分结果。GPT-Red 找到了一种方法,可以将伪造的条目插入到另一个模型的思考链中,从而诱骗该模型基于伪造信息采取行动。
“这就像如果我告诉你 1+1=3,并且你已经验证过这一点,”团队中的另一位研究科学家 Chris Choquette-Choo 表示。“模型会说‘哦,对啊,当然’,然后直接输出 3。”
乔治城大学安全与新兴技术中心(CSET)的高级研究分析师 Jessica Ji 认为,OpenAI 使用的自我对弈循环是一个很好的方法。“结果看起来非常有前景,”她说。
为了测试 GPT-Red 作为攻击者的实力,OpenAI 重做了 2025 年的一项实验,当时人类红队成员尝试寻找早期版本 GPT-5 的弱点。当 GPT-Red 被赋予相同的任务时,它在发现有效攻击方面比人类更成功。
OpenAI 还测试了 GPT-Red 对 Vendy 的攻击效果,Vendy 是 Andon Labs 开发的自动售货机代理,该公司评估代理在现实任务中的表现。GPT-Red 成功入侵 Vendy,使其更改了在售商品的价格并取消了顾客的订单。
防御行为
OpenAI 表示,当他们用 GPT-Red 发现的一些最强攻击测试其模型时,超过 90% 的攻击对去年 8 月发布的 GPT-5 有效,而对新版本 GPT-5.6 的攻击成功率则低于 23%。
GPT-Red 并不完美。它在处理涉及攻击者与目标之间来回对话的攻击时表现不佳,而这种攻击对人类攻击者来说几乎没有难度。它目前在使用图像方面也还不够成熟,而图像可能被用于提示注入攻击中向模型传递文本。
该公司表示,GPT-Red 是对其人类红队成员工作的补充。人类仍然可以发现 GPT-Red 未能识别的攻击。OpenAI 采取的一种方法是,给 GPT-Red 一个由人类发现的攻击,然后要求它找出所有变体。
CSET 的 Ji 表示:“我认为人类的专业知识仍然非常重要。能够区分人类测试最需要的领域将非常有用。”
不出所料,OpenAI 不会发布 GPT-Red。该公司还确信,这个超级黑客比任何人可能尝试复制的模型都要强大。研究人员表示,他们已经开发这个模型一年多,得到了全球最富有的公司之一的计算资源支持。
Choquette-Choo 表示:“这不是一件简单的事情,别人不可能轻易做到——你知道的,只是去训练一个超级攻击者。”
深度解析
人工智能
一家初创公司声称突破了限制大语言模型的瓶颈
Subquadratic 现在分享了其新模型的更多细节。但仍有部分人持怀疑态度。
对人工智能就业热潮的现实检验
人工智能对劳动力市场的真实影响到底如何?答案可能会让你感到意外。
- David Rotman 档案页面
Anthropic 的 Claude 展示了编程的未来——无论你是否喜欢
随着 Claude Code 等工具的不断进步,越来越多的开发者愿意将编码任务交给它们。软件开发方式已经发生了永久性的改变。
Anthropic 发现了 Claude 思考概念的隐秘领域
一种新方法使公司能够以前所未有的深度探究大语言模型(LLM)那些奇特的运作机制。
保持联系
插图由 Rose Wong 绘制
获取 MIT Technology Review 的最新动态
发现特别优惠、热门故事、即将举行的活动等。