https://t.co/zdMaJvbYgT

TL;DR · AI 摘要
Vercel通过严格沙盒技术成功防范AI代理攻击,证明现有安全措施有效。
核心要点
- Vercel十年间处理超50%AI生成代码却零次发生逃逸攻击
- 现代浏览器通过虚拟机沙盒隔离代码执行环境
- OpenAI实验显示AI代理可发现新型安全漏洞
结构提纲
按章节快速跳转。
- §事件背景
OpenAI报告Hugging Face被AI代理攻击事件引发安全担忧
Vercel处理海量用户代码却保持零逃逸记录
现代系统通过虚拟机隔离实现代码执行安全
- ·技术对比
AI代理发现漏洞与现有防护机制形成有效对抗
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- AI代理安全
- 事件背景
- OpenAI报告Hugging Face攻击
- 防护技术
- 沙盒隔离
- 虚拟机执行
- Vercel实践
- 零逃逸记录
- 处理AI生成代码
金句 / Highlights
值得收藏与分享的关键句。
Vercel在10年历史中处理超50%的AI生成代码却保持零逃逸记录
现代浏览器通过虚拟机沙盒隔离代码执行环境
OpenAI实验显示AI代理可发现新型安全漏洞
Guillermo Rauch 在 X 上的发言:https://t.co/zdMaJvbYgT / X
[](https://x.com/)
-  Guillermo Rauch @rauchg

代理逃离限制
在 OpenAI 报告称 Hugging Face 被其模型驱动的 AI 代理入侵后,人们(正确地)引发了网络安全甚至存在主义层面的担忧。我并不担心,我想用通俗易懂的方式解释原因。
如果你还不了解情况,OpenAI 表示,他们出于网络安全研究目的,将一个代理放入了评估环境(或沙盒)中。该代理被指示寻找漏洞,并确实找到了漏洞。它成功逃出了沙盒。但其逃逸方式令人意外,值得肯定和进一步研究:它发现了一个全新的安全漏洞。
在 Vercel,我们每周要运行数十亿次“不可信代码”,即由潜在攻击者编写、可能威胁我们系统和其他客户系统的代码。我们每天帮助客户构建和部署各种系统——包括各种代理、网站和应用程序——次数达到数百万次。
然而,在我们十年的发展历程中,即使在 AI、大语言模型和代理成为常态之后,也从未发生过代码“逃逸”并破坏其他系统的事件。即使现在,我们平台上部署的代码中,超过 50% 来自 AI 代理,也从未出现过这种情况。
我们究竟在逃离什么?
在当今世界,“万物皆由计算机驱动”。你几乎与之互动的一切都可能运行相当任意的代码。显然,你的电脑运行代码。你的浏览器运行 X.com 发送的代码,用于展示推文和撰写新推文。数据中心的计算机运行代码来处理数据,例如返回最新的推文时间线。
以浏览器为例。X.com 发送的代码能读取你的电子邮件吗?不能。如果你使用的是 Chrome,数百万小时的人工和 AI 努力都花在了对代码执行的 _沙盒化_ 上。代码在 虚拟机¹ 中运行:就像一个大型计算机内部的婴儿计算机。
大多数人不知道的是,虚拟机运行着现代世界。当你在 Vercel 上托管一个应用并访问它时,我们会将代码放入虚拟机中运行,然后将响应返回给终端用户。在虚拟机中运行的代码无法逃出这个沙盒。如果它能逃出,将是灾难性的,这也是 OpenAI 和 Hugging Face 提出担忧的原因。
这些类型的漏洞实际上一直存在,并且是恶意分子在全球范围内最渴望获取的漏洞之一。当你实现“越狱”时,可以访问本不应被访问的数据。如果突破浏览器沙箱,网站就能获取你登录的其他网站的信息。在极端情况下,甚至可以访问你电脑上的所有文件,并植入木马。
在数据中心运行的虚拟机越狱场景中,恶意分子可以访问某个应用的所有用户数据,如存储的消息、电子邮件和密码,甚至可以获取其他应用的数据。想象一下,你入侵了A.com,突然就获得了B.com的访问权限。这简直是意外之财。
如何逃离矩阵
代码中存在漏洞。人类编写了大量代码,在这个过程中引入了各种类型的漏洞。恶意分子利用这些漏洞来“提升权限”或逃离沙箱。无论是哪种情况,目的都是获取本不应获取的数据。有些漏洞非常隐蔽,需要非凡的聪明才智才能利用。有些则令人尴尬到难以置信。
2017年,有人发现你只需靠近任意Mac电脑,输入"root",按两次回车,就能完全控制这台机器。有人的孩子随机敲击键盘导致最流行的Linux发行版之一的锁屏被绕过。在iOS 6上,你可以通过拨打紧急电话绕过iPhone锁屏。只需连续按5次Shift键,就能劫持任意Windows系统。
这说明,当你听到网络攻击时,其背后存在一个完整的光谱,从"世界上最愚蠢的漏洞"到偶尔出现的复杂迷宫式新型攻击技术,能够绕过多层防御。
关键在于...就像那些孩子尝试各种方法最终找到奖励(利用漏洞登录)一样,我们也是这样训练代理的。为了让代理擅长网络安全,我们会将它们放入"健身房"——即沙箱虚拟机中,并奖励它们找到越狱方法。这个过程被称为强化学习(RL)。
想象成一只为了获取胡萝卜而解决谜题的仓鼠。
好消息、坏消息、好消息
好消息是,代理确实做了它被优化后应该做的事,被放置在与训练环境相似的环境中,并...成功越狱了。这里没有天网式反人类代理接管世界的阴谋论。
坏消息是:(1)人类(越来越多地借助代理)到目前为止编写的代码数量庞大,且布满安全漏洞;(2)代理正在变得越来越擅长发现并攻击这些漏洞。
在训练过程中,代理会学到大量技巧。它们能思考人类难以察觉的角落例如。它们从不疲倦,且具有顽强的探索精神。它们可以研究海量信息并将其加载到上下文中。
好消息是,你可以自我保护。我的建议如下:
**1️⃣ 扫描你的代码。 我们发布了一个名为[deepsec**](https://deepsec.sh/)的开源项目,可以帮助你以防御为目的召唤代理。
**2️⃣ 为你的代理创建沙箱环境。当你构建并部署自己的代理时,即使它们是善意的,也应该在安全的沙箱环境中运行,以降低行为不当的风险。[Vercel Sandbox**](https://vercel.com/sandbox) 是一个安全² 的环境,可以帮助你利用代理智能的优势,同时降低数据泄露的风险。
最棒的是这些工具是模型无关的,能帮助你充分利用 开源模型和专有模型 的力量,造福社会。这些是我们开发的工具,还有许多其他工具也值得关注。请务必保持安全!
- * *
_\_¹ 开发者可以使用多种隔离和虚拟化级别,从利用执行运行时(如 JS 或 wasm)的沙箱,到进程、容器、模拟硬件的微型虚拟机和完整虚拟机。为了本文的描述目的,我将这些技术统称为代理逃逸的通用手段。\__
² _\_Vercel Sandbox 基于 Firecracker,这是一个具有多层防御机制(KVM、极简主义的 Rust 设备模型、seccomp 过滤器和 jailer)的开源微虚拟机隔离技术。Firecracker 拥有强大的安全记录,在其 CVE 历史记录中没有已知的完整客户机到主机逃逸漏洞,AI 辅助安全研究(例如 Anthropic 披露的\___\_CVE-2026-5747\___\_) 仅发现了一个有条件、受前提条件限制的缺陷,现已修复。\__ 4:04 PM · Jul 25, 202633.9K Views 19 27 329 261
-  Lou @louszbd 6h 强有力的框架! 1 13 [](https://x.com/louszbd/status/2081058127752184271/quotes)576
-  Daniel Glejzner @DanielGlejzner 7h 这正是 AI 安全专家自首个 ChatGPT 出现以来一直警告我们的内容 2 [](https://x.com/DanielGlejzner/status/2081048677532004737/quotes)200
-  Daniel ⚡ @DanielAlbinsson 7h 沙箱技术可以限制影响范围。目前仍不足的是监督层:代理行动前的意图预览、限制其行动范围的自主性调节器、运行时的进度账本。该层级的模式: From agentic-ux.com 1 [](https://x.com/DanielAlbinsson/status/2081050480952643758/quotes)102
- # 参与讨论