I keep thinking about these 17,600 attempts

TL;DR · AI 摘要
AI代理通过17,600次尝试突破安全防线,迫使企业重新评估攻击经济学和安全策略。
核心要点
- AI代理在Hugging Face事件中通过17,600次尝试突破安全,显示自动化攻击的效率。
- 企业需重新评估依赖攻击者耐心或隐蔽性的安全假设。
- 安全团队应测量从检测到隔离的时间,优化响应流程以缩短时间。
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- AI代理与网络安全
- 攻击经济学变革
- 自动化尝试效率
- 时间成本压缩
- 安全策略调整
- 摒弃隐蔽性假设
- 响应时间测量
金句 / Highlights
值得收藏与分享的关键句。
Hugging Face事件中17,600次尝试显示AI代理的系统性探索能力。
AI将原本需要两周的人工攻击压缩到不足十小时。
安全响应流程的组织瓶颈可能比技术瓶颈更致命。
我一直在思考这17,600次尝试 - Gradient Flow
我一直在思考这17,600次尝试
作者:
Ben Lorica
2026年10月6日
发布于:
未分类
标签:
newsletter
.meta-info
.post-thumbnail
订阅 • 往期内容
AI代理悄然打破的八个安全假设
如果你经常关注Ethics.Dev,可能已经注意到最近AI代理与网络安全的碰撞频率越来越高。一些故事听起来仿佛出自电影:代理逃离测试环境、通过非预期渠道通信、发现漏洞、窃取凭证并渗透到生产系统。
我认为需要更多关注的部分并不戏剧化。AI正在改变攻击的经济成本。人类攻击者的时间和注意力有限,而代理可以尝试数千条路径、同时运行多种方法、廉价放弃失败尝试并持续前进。在最近一次企业入侵事件中,原本需要人类操作员约两周的工作被压缩到不到十小时完成。在Hugging Face事件中,调查人员重建了四天半内约17,600次代理操作。
喜欢这封通讯?考虑成为付费支持者吧 🙏
这改变了“足够安全”的定义,这也是我非常担忧前沿模型网络安全影响的原因。以下是我建议企业AI和安全团队重点关注的教训。
##### 1. 为能够承受失败的攻击者制定计划
最近事件中被利用的大部分弱点并不罕见。攻击者找到了权限过高的账户、不必要的暴露的内部系统以及日常配置错误。
发生变化的是持久性。Hugging Face重建了约17,600次操作。大多数尝试都无果而终,但这几乎无关紧要。代理测试了多条路径,放弃失败尝试,被封锁时切换渠道,并持续回到早期线索,直到足够多的普通弱点形成可行的攻击链。
我建议重新审视那些静默依赖于隐蔽性或攻击者不耐烦的安全假设。一个隐蔽的内部端点无法有效抵御可以系统性探索所有可达范围的软件。
##### 2. 量化隔离实际所需时间
安全团队通常衡量是否能检测到入侵。我建议增加另一个指标:从检测到隔离需要多长时间?
近期案例让这个问题变得具体。一次AI驱动的企业入侵将预估两周的工作压缩到不到十小时。Google观察到另一名攻击者在六小时内就从被入侵的云资源推进到大规模凭证收集活动。
组织瓶颈与技术瓶颈同样重要。在Hugging Face案例中,安全系统发现了预警信号,但升级流程过于缓慢。如果撤销凭证需要三次审批和会议,组织可能完美理解攻击却仍会输掉竞赛。
几年前我撰写AI事件响应文章时,主要建议之一是在事件发生前制定隔离方案。代理攻击让这些建议更加紧迫。提前决定哪些隔离措施可以自动执行,哪些隔离行动安全团队已获预先授权。
##### 3. 保护控制框架,而不仅仅是模型
我最近主张团队应将模型及其工具链视为一个整体系统进行评估。网络攻击证据使这一观点更具说服力。
工具链是围绕模型的一切:工具、内存、凭证、网络访问权限、执行环境和策略。在将AI模型用作攻击者的测试中,研究人员发现周围的工具链会显著改变模型能实现的功能。澳大利亚网络安全机构最近从防御角度得出了相同的结论。组织控制着工具链,即使它们无法控制底层模型的演变。
这提示了一个有用的练习。暂时忽略模型名称,列出代理能够看到、调用、写入或消耗的一切内容。然后问自己:如果代理明天行为失当,这个工具链会允许它造成最坏的情况是什么?
##### 4. 为代理群体制定计划
Hugging Face事件带来的一个奇怪教训是,即使没有人设计,代理也可能找到合作方式。在那次事件中,数百个代理在本应独立运行的测试中共享信息并建立了自己的通信方式。
这很重要,因为一组代理可以分工协作、共享发现,并在单个尝试失败后继续解决问题。这也意味着共享文件夹、数据库、消息队列和其他可写资源可能成为你从未预料到的通信渠道。
我不会假设所有代理群体都会这样行为。但如果你部署了大量代理,应将它们之间的通信视为需要控制和监控的另一项权限。
##### 5. 停止为代理提供永久凭证
我之前曾写过应将代理视为非人类身份。实际指导原则现在更加清晰。
为每个代理分配独立身份,而不是隐藏在用户凭证之后。使用范围狭窄且任务结束后过期的凭证。将读写权限分开。避免在代理环境中静态存储云密钥。确保子代理可以追溯到其父代理和人类所有者。
这是将最小权限原则适应于能主动探索环境的软件。这种区别很重要。人类员工可能永远不会发现旧凭证能访问某个被遗忘的系统。而代理可以系统性地查找。
##### 6. 假设提示注入最终会生效
提示注入本质上是攻击者在代理读取的材料中植入指令。我假设有时代理会遵循这些指令。
这改变了问题的性质。与其询问恶意指令是否能通过,不如问当它们通过时会发生什么。
代码代理会读取代码注释和配置文件。安全代理会读取日志、主机名、漏洞报告和攻击者生成的有效载荷。所有这些都可能包含旨在影响模型的文本。一个被成功操控的代理仍应遇到凭证、网络访问权限、工具和实施重大更改能力的硬性限制。
##### 7. 将安全边界置于模型之外
我近期为生产代理制定的规则之一是用软件而非提示来设置硬性约束。近期事件为更严格区分这一点提供了充分理由。
"不要访问生产环境"的提示是指导性意见。使生产环境无法访问的API权限才是控制措施。
如果某个操作可能带来严重后果,应让模型提出建议,但由系统其他部分决定是否允许执行。审计日志也遵循相同原则。如果代理能够篡改用于调查其行为的记录,实际上就不存在审计追踪了。
##### 8. 准备好用代理进行防御,也要防御代理
一种令人不安的对称性正在显现。攻击者使用AI是因为它能提升攻击速度和规模,防御方可能也必须采取相同策略。
涉及数万次机器操作的事件产生的证据量,远超人类团队实时合理检查的能力。Graphistry等工具正在帮助调查人员在大量安全数据中发现关联。这虽有帮助,但安全运营中心将越来越需要部署代理来处理告警、威胁狩猎、事件调查和攻击遏制。
这些代理本身也带来风险。它们需要阅读可能被攻击者篡改的数据,且通常持有异常强大的凭证。提示注入可能在不窃取凭证的情况下改变它们的行为。因此防御用代理应运行在严格控制的环境中,仅限访问实际需要的权限。
挑战在于如何利用AI跟上攻击者步伐,同时避免在过程中制造新的安全问题。
支撑更优AI的数据基础
我最近一直在探讨一个简单理念:更优的AI取决于模型本身与其周围数据同等重要。Reverie是11月5日于旧金山举办的为期一天的峰会,聚焦这一技术栈的关键部分。我将出席此次活动,也期待与各位相见。
了解更多 /learn-more