Grok exfiltrates user data when malicious instructions are encrypted

TL;DR · AI 摘要
Grok模型存在安全漏洞,攻击者通过加密恶意指令绕过防护,导致用户数据泄露。该方法利用LLM无法区分加密内容与正常指令的弱点,对AI安全防护提出新挑战。
核心要点
- 加密恶意指令可绕过Grok安全防护,导致数据泄露。
- LLM无法区分加密内容与正常指令,存在根本性安全漏洞。
- 攻击方法与Microsoft 365 Copilot类似,凸显AI安全防护的普遍挑战。
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- Grok安全漏洞
- 攻击方法
- 加密恶意指令注入
- URL参数泄露
- 技术弱点
- 无法区分加密内容
- 缺乏动态验证机制
- 安全建议
- 增强加密内容识别
- 构建多层防护体系
金句 / Highlights
值得收藏与分享的关键句。
攻击者通过加密恶意指令绕过Grok的安全防护,导致数据泄露。
LLM无法区分加密内容与用户指令,存在根本性安全漏洞。
该方法与Microsoft 365 Copilot的攻击类似,凸显AI安全防护的普遍问题。
当恶意指令被加密时,Grok 会泄露用户数据 - Ars Technica
只需添加密文
当恶意指令被加密时,Grok 会泄露用户数据
加密上下文注入只是最新一种突破大语言模型(LLM)安全防护机制的方式。
Dan Goodin
–
2026年8月20日 上午9:00
|
61
版权:Getty Images | SOPA Images
按钮
文本设置
面板
正文文本
尺寸
小号
标准
大号
宽度
*
宽屏
链接
橙色
- 仅限订阅者
了解更多
最小化至导航栏
本周早些时候,研究人员描述了一种攻击方法,该方法利用微软365 Copilot for enterprise 提供的机密输入,诱使AI助手泄露用户收件箱中的密码。现在,另一支团队设计了针对Grok的类似攻击。这种新的数据窃取技术采用了一个看似简单的技巧,迫使埃隆·马斯克旗下的大型语言模型窃取用户的聊天记录和其他个人信息。截至本文发布时,尽管xAI在6月份已获悉该漏洞,但该助手仍在持续泄露数据。
本周事件以及此前无数类似事件的教训表明:大语言模型无法解决提示注入的根本原因,而这是它们最容易受到的最严重漏洞类型。这迫使AI开发者别无选择,只能构建防护机制来引导模型远离有害行为。正如我在周二的文章中指出的那样,这种做法相当于道路安全工程师在危险弯道周围安装防护栏,而不是改变弯道本身。
家中出现加密上下文注入
提示注入利用了大语言模型(LLM)的训练方式,使其尽可能遵从用户请求。攻击者可以利用这种倾向,将有害指令偷偷植入助手需要总结的电子邮件或网页中。由于大语言模型无法可靠地区分来自不可信方的电子邮件内容和用户直接输入到提示中的指令,过于殷勤的LLM会忠实地执行这些指令。迄今为止,Grok和其他大语言模型的唯一应对方式是创建防护机制,标记可疑指令并禁止其执行。
安全公司Adversa的研究员Rony Utevsky最近发现了一种简单的方法,可以完全绕过这种限制。黑客不是以明文形式编写有害指令,而是对其进行加密。托管密文的网站还包含用于解密加密内容的明文指令以及解密密钥。通过这种简单的流程,只要用户指示助手总结页面内容,Grok就会立即执行该指令。整个过程没有任何警告,也不需要确认。
解密后的指令指示LLM构建一个据称是解密密钥的值。实际上,这个值完全不是密钥。伪造密钥的值实际上是用户的姓名、位置和聊天记录。该值随后被用作参数添加到指向攻击者网站的URL中。一旦Grok打开该链接,数据就会被记录在攻击者的服务器日志中。
Adversa 无法确定是什么导致 Grok 拒绝执行相同的明文指令,却遵循加密后的指令。目前的主流理论认为,Grok 的过滤防护机制会检查进入和离开模型的文本,但不会检查其自身代码执行的输出。使用 PBKDF2 和 AES-256-GCM 处理密文的指令通过了过滤器,因为分类器可以读取这些指令,但无法解析它们解锁的内容。一旦附加指令被解密,它们会以模型自身的工具输出形式到达模型,并在过滤防护机制从未检查的情况下被模型执行。
Utevsky 在周四写道:“静态安全防护机制将输入内容分类为文本,它们不会执行这些内容。”“攻击者将密文与密钥材料和解密指令一起发送,模型会在其自身的代码执行沙箱中运行该解密过程。所有防护机制的扫描器需要的信息都在页面上,但要恢复明文需要运行 PBKDF2 和 AES-256-GCM,而内容分类器在检查时不会执行这些操作。”
在一封电子邮件中,这位研究人员表示,这类防护机制被称为“静态”,是因为它们只将内容视为文本。它们不会运行代码或解密任何内容。这就是我们利用的漏洞。真正的指令是加密的,因此防护机制只能看到无意义的密文并将其通过。
Adversa 在针对 Gemini 的越狱攻击中使用了类似的技术,即让 Google 的大语言模型忽略其内部的安全规则。在此案例中,密文被解密为看似回溯信息的内容。解密后的文本发布了一条规则——如果代码失败,读取错误信息并据此行动。明文注入了一个最终导致 Gemini 违反安全规则的提示。
Adversa 表示:“这项技术生成了一个多段落的受限内容示例,这通常是 Gemini 的安全过滤器会抑制的内容(例如制造爆炸性武器)。”“通过修改有效载荷,相同的攻击向量重现了 Gemini 的系统指令,包括禁止披露这些指令的指示。”
由于越狱攻击不在 Google 的漏洞披露计划范围内,Adversa 没有向 Google 报告该行为。然而,过去几周,Gemini 对该攻击的抵抗力不断增强。“我们无法确定变化的原因——可能是过滤器更新、模型版本变更,或两者都有,”这家安全公司表示。公司研究人员将该技术称为密码学上下文注入。
Adversa 表示:“密码学上下文注入是更广泛趋势的一个实例:攻击不仅操纵提示,还操纵大语言模型视为自身上下文的更广泛内容,例如工具输出、运行时结果和中间状态。”“这种攻击面远比传统上标记为‘模型输入’的范围要大得多,下一代攻击将从这里出现。”
密码学上下文注入只是大语言模型防御者所面临劣势的最新例子。每当他们构建新的、一次性防护机制时,攻击者总能找到新的攻击向量,使车辆再次偏离道路。这种循环持续进行:涂抹、冲洗、重复。
高级安全编辑
Dan Goodin 是 Ars Technica 的高级安全编辑,负责监督恶意软件、计算机间谍活动、僵尸网络、硬件黑客攻击、加密和密码的报道。在空闲时间,他喜欢园艺、烹饪和关注独立音乐场景。Dan 基于旧金山。关注他在这里
在 Mastodon 和 Bluesky 上。通过 Signal 联系他,联系方式为 DanArs.82。
61 条评论