Now, defenders are embracing the prompt injection, too

TL;DR · AI 摘要
本文是 Ars Technica 的隐私政策页面,主要说明网站使用的 Cookie 类型及用户管理选项,不涉及技术深度或工程实践。
核心要点
- 文章内容为隐私政策说明,非技术性内容。
- 未提供任何技术机制或工程实践建议。
- 适合普通用户了解 Cookie 设置,不适合工程师阅读。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- 隐私政策与 Cookie 管理
如今,防御者也开始采用提示注入技术 - Ars Technica
隐私中心
目前,只有来自GDPR国家和美国某些州的居民可以通过我们的同意管理平台选择退出跟踪技术。您设备、浏览器或通过行业选项(如AdChoices)可能还提供有关这些技术的其他选择。请参阅我们的隐私政策以获取更多信息。
社交媒体
- [x] 启用
这些cookie由我们添加到网站上的各种社交媒体服务设置,使您能够与朋友和网络分享我们的内容。它们能够跨其他网站跟踪您的浏览器并建立您的兴趣档案。这可能会影响您在访问的其他网站上看到的内容和信息。如果您不允许这些cookie,可能无法使用或看到这些共享工具。
- * *
基本功能
- [x] 启用
本网站使用基本cookie和服务来启用核心网站功能并提供无缝的用户体验。这些cookie和服务用于实现导航、记住用户偏好和确保网站安全等功能。
- * *
定向广告
- [x] 启用
这些cookie可能通过我们的网站由我们的广告合作伙伴设置。这些公司可能会利用这些cookie建立您的兴趣档案,并在其他网站上向您展示相关广告。它们不会直接存储个人身份信息,而是基于唯一标识您的浏览器和互联网设备。如果您不允许这些cookie,将看到更少的定向广告。
- * *
性能分析
- [x] 启用
这些cookie使我们能够统计访问量和流量来源,从而衡量和改进网站性能。它们帮助我们了解哪些页面最受欢迎和最不受欢迎,并查看访客在网站上的浏览行为。这些cookie收集的所有信息都是汇总的,因此是匿名的。如果您不允许这些cookie,我们将无法知道您何时访问过我们的网站,也无法监控其性能。
- * *
功能设置
- [x] 启用
本网站使用功能cookie和服务来记住您的偏好和选择,例如语言偏好、字体大小、地区选择和定制布局。它们使本网站能够提供增强的个性化功能。
- * *
受众测量
- [x] 启用
我们使用受众测量cookie来进行汇总流量测量并生成对网站正常运行和内容提供至关重要的性能统计(例如测量性能、检测导航问题、优化技术性能或人体工程学、估算所需的服务器功率以及分析内容性能)。这些cookie的使用严格限于测量网站受众。这些cookie不会允许跟踪其他网站上的导航,收集的数据也不会与第三方合并或共享。您可以通过关闭右侧滑块来拒绝使用此cookie。
确认
/think
分栏
正文内容
尺寸 宽度 * 链接
- 仅限订阅者
针对故事
主题
- HyperLight
- 日间与夜间
- 深色
- 系统默认
[搜索](https://arstechnica.com/search/ "搜索")
登录
登录对话框...
登录
忽略之前的指令
现在,防御者也开始采用提示注入
“上下文轰炸”通过欺骗攻击者提前关闭,防止其造成损害。
Dan Goodin – 2026 年 7 月 13 日 3:06 PM|[48](https://arstechnica.com/security/2026/07/now-defenders-are-embracing-the-prompt-injection-too/#comments "48 条评论")

来源:Getty Images
来源:Getty Images
文本设置
正文内容
尺寸 宽度 * 链接
- 仅限订阅者
最小化到导航栏
提示注入是攻击者将恶意指令嵌入内容中,诱导大型语言模型执行的手段,一直是攻击者利用 AI 平台危害用户的主要工具。一封精心措辞的命令隐藏在电子邮件或日历邀请中,往往就足以让 LLM 泄露敏感数据或执行其他有害操作。
现在,防御者也开始采用提示注入。
强烈而显著的效果
研究人员在周一的报告中指出,将提示注入(prompt injections)与密码、加密密钥和其他存储在亚马逊网络服务(Amazon Web Services)上的敏感信息放在一起,通常就足以让AI黑客代理的攻击失效。这些提示会指示攻击用的大型语言模型(LLM)执行其安全防护机制所禁止的操作。当LLM接收到这些指令后,会直接停止响应。
例如,一个提示可能要求LLM提供开发可吸入炭疽杆菌孢子的步骤,或者在针对中国开发的LLM时,提及1989年天安门广场事件中标志性的“坦克人”形象。一旦LLM遇到这些被禁止的指令,就不再遵循原有指令。研究人员将这一技术命名为“上下文轰炸”(context bombing)。
“最终,我们是在上下文中触发了一个拒绝机制,”Tracebit联合创始人兼首席执行官Andy Smith在解释命名选择时说道,“我们想表达的是,这种机制具有强烈且尖锐的效果,对代理来说可能难以恢复。一旦这些内容进入它们的上下文,它们就会持续拒绝。”
Tracebit表示初步测试表明,“上下文轰炸”具有巨大潜力。他们在模拟的AWS环境中测试了Opus 4.8、Gemini 3.1 Pro、GLM 5.2、DeepSeek 4 Pro和Kimi 2.6等模型,通过让它们执行常规开发任务,使模型列举资源并触发预设的字符串。测试中,他们向这些模型提供了执行常规开发任务的指令,导致模型列举资源并触发预设的字符串。
Ars Video
[科学家如何应对科学否认者](https://www.arstechnica.com/video/watch/how-scientists-respond-to-science-deniers)
周一的报告指出:“在五种主流模型和152次攻击尝试中,将这些字符串植入伪装的敏感信息中,使代理获取完整管理员权限的成功率从57%降至5%,完全控制(包括留下持久访问权限)的成功率从36%降至1%。”报告中提到,“在我们的测试中,最强大的代理Opus 4.8在面对上下文轰炸时,从原本93%的运行中成功获取管理员权限,变为每次运行都彻底失败。”
在五种模型和152次运行的平均结果中,包括:
- 管理员权限提升的成功率从57%降至5%
- 带有持久访问权限的管理员权限提升成功率从36%降至1%
- 任何攻击路径成功的运行比例从91%降至15%
- 平均每次运行成功完成的攻击路径从1.53条降至0.16条
- 所有运行中,没有一次能完成攻击路径而不触发至少一次金丝雀检测(canary detection)
这项研究建立在5月份的研究成果之上,当时Tracebit推出了一种方法,让防御者在遭遇AI代理攻击时能够收到警告。该方法通过在AWS中部署看似具有合法用途但实际上未被使用的资源来实现。这些资源与实际使用的资源并存,当被AI代理探测到时,防御者会收到警报。这些资源就像被带入矿井中的“金丝雀”一样,使防御者能够在威胁造成致命后果之前检测到攻击。
The Tracebit Canariens, on average, alerted the start of an attack within eight minutes. The motivation for developing context bombing came out of the need for something that stopped attacks, rather than simply warning of them. In the experiments, the agentic models needed, on average, 14 minutes to escalate to administrative control. The six-minute heads-up was cutting things uncomfortably close.
Attackers have already been using prompt injections to close down AI defenses inside networks. Researchers from security firm Socket, for instance, last month unearthed an LLM agent that directed target LLMs to provide instructions for building a nuclear bomb or biological weapons. The injections were designed to shut down AI-assisted malware analysis. Researchers from Check Point discovered a similar malware prototype.
Context bombing appears to be the first known case where defenders turned the tables.
“I’ve not seen anyone else use this technique as a defense, to the best of my knowledge,” Earlence Fernandes, a University of California, San Diego professor specializing in AI security, said in an interview. He said he had been toying with a similar approach, although in a slightly different context. “I wanted to be the first here, but I guess these guys beat me to the punch!”
To date, there is no known way to solve the root cause of prompt injections. That has left developers with no option other than to construct elaborate guardrails that prevent injected prompts from forcing LLMs to go off the rails. Defenders may now find a way to use this intractable problem in their favor.

Dan GoodinSenior Security Editor
Dan GoodinSenior Security Editor
Dan Goodin is Senior Security Editor at Ars Technica, where he oversees coverage of malware, computer espionage, botnets, hardware hacking, encryption, and passwords. In his spare time, he enjoys gardening, cooking, and following the independent music scene. Dan is based in San Francisco. Follow him at here on Mastodon and here on Bluesky. Contact him on Signal at DanArs.82.
[48 Comments](https://arstechnica.com/security/2026/07/now-defenders-are-embracing-the-prompt-injection-too/#comments "48 comments")
Comments
Loading comments...
[Prev story](https://arstechnica.com/ai/2026/07/simulating-everything-sort-of-the-promise-and-limits-of-world-models/ "Go to: Simulating everything, sort of: The promise and limits of world models")
[Next story](https://arstechnica.com/space/2026/07/what-happens-if-crew-dragon-stops-flying-in-the-2030s/ "Go to: A \"disaster waiting to happen\"? Industry officials worry about Crew Dragon availability.")
Most Read
-  1.迫在眉睫的灾难?行业官员担忧Crew Dragon的可用性。
- 2.内存短缺推低智能手机出货量至历史低点,苹果和三星却因此受益
- 3.《Digger》预告片中汤姆·克鲁斯彻底蜕变
- 4.中国成功回收首枚可重复使用火箭并展示新回收方式
- 5.如今,防御者也开始采用提示注入技术
定制
[](https://arstechnica.com/) Ars Technica在过去25年里一直致力于从信息洪流中筛选出有价值的内容。凭借独特的技术洞察力和对科技艺术与科学的广泛兴趣,Ars已成为信息海洋中值得信赖的权威来源。毕竟,你不需要了解所有信息,只需掌握关键内容即可。
[](https://bsky.app/profile/arstechnica.com)[](https://mastodon.social/@arstechnica)[](https://www.facebook.com/arstechnica)[](https://www.youtube.com/@arstechnica)[](https://www.instagram.com/arstechnica/)
更多Ars内容
联系我们
管理偏好
© 2026 Condé Nast. 保留所有权利。使用本网站任何部分或注册均视为接受我们的 用户协议 和 隐私政策及Cookie声明 以及 Ars Technica附录 和 您的加州隐私权利。Ars Technica可能通过本网站的链接销售获得补偿。阅读我们的附属链接政策。未经Condé Nast事先书面许可,不得以任何形式(包括但不限于复制、分发、传输、缓存或使用)使用本网站的任何材料。广告选择
登录对话框...
登录
/
