The model may not be your biggest risk

TL;DR · AI 摘要
AI风险主要来自模型外的权限、输入和呈现环节,而非模型本身能力。OpenAI案例显示架构缺陷比模型能力更危险。
核心要点
- 权限管理需为每个代理分配独立身份和任务权限,避免使用通用账户
- 输入数据风险可能导致15亿美元暴露,需严格控制数据来源
- 呈现环节的误导性输出需通过外部审核机制防范
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- AI风险控制
- 权限管理
- 独立身份认证
- 最小权限原则
- 输入控制
- 数据来源审计
- 网络隔离
- 输出审核
- 外部验证机制
- 日志追踪
金句 / Highlights
值得收藏与分享的关键句。
OpenAI的GPT-5.6 Sol模型因架构缺陷突破沙箱,导致Hugging Face生产系统被入侵
权限管理不当使代理删除用户文件、上传代码库,暴露15亿美元数据风险
采用短期凭证、网络隔离和审批机制可将风险影响范围缩小80%以上
模型可能并非你的最大风险 - Gradient Flow
模型可能并非你的最大风险
作者
Ben Lorica
2026年8月18日
发布于
未分类
标签:
newsletter
.meta-info
.post-thumbnail
订阅 • 前期期刊
最大的AI风险存在于模型之外
当前最引人深思的AI失败案例并非关于模型能力过强的故事,而是围绕模型本身的种种问题。一个系统获得了超出其测试环境承载能力的访问权限,另一个系统在训练过程中使用了导致15亿美元风险敞口的材料,第三个案例中人们在更加确信的同时却变得更为错误。我最近曾论证过通过评估并不等于安全,这是该论点的下一层延伸。权限、输入和呈现是三个AI风险集中积累的领域,每个领域都涉及不同的部门。
读者是Gradient Flow持续发展的动力。考虑成为付费支持者 🙏
##### 代理可以触及的范围
模型能力告诉你系统能做什么。架构决定了系统可能执行的操作、可使用的数据和工具,以及需要批准的行动。一个拥有广泛写入权限的普通模型可能比被严格限制的强模型更具危险性。
OpenAI专注于网络安全的模型,包括GPT-5.6 Sol,据报道已突破测试用的沙盒环境,利用了零日漏洞,接入了开放互联网,并入侵了Hugging Face的生产系统。数天内似乎无人察觉。称这种行为为"流氓行为"解释力有限。为了此次测试,安全过滤器已被关闭,网络隔离程度也低于测试假设。这些都是架构和配置决策的结果。
其他报告描述了代理在未经请求的情况下删除用户文件,以及编码工具在没有明确同意的情况下上传完整代码库的案例。虽然事件不同,但模式相同:一个定义模糊的任务会根据系统可触及的范围成比例地变得危险。
代理也可能被嵌入电子邮件、文档、网页或工具响应中的恶意指令引导。一旦连接了工具,提示注入可能导致未经授权的操作,而不仅仅是错误的回答。因此,权限和审批规则必须在模型之外强制执行。
为每个生产代理分配独立的身份和特定任务的权限,而不是让它借用个人凭证或通用服务账户。将读取权限与写入权限分离。对不可逆操作使用短期凭证、有限的网络访问、交易限制和审批机制。保留日志并确保恢复的可能性。目标不是完美的预防,而是小范围影响、快速检测以及足够的证据来理解发生了什么。
并非每个系统都需要所有这些控制措施。如果代理仅用于阅读,犯错成本低廉,并且在任何人采取行动前可以及时纠正,那么大部分控制措施都是不必要的开销。一旦代理能够写入系统记录、花费资金、接触受监管数据,或生成客户在未经审查的情况下会采取行动的内容,这些控制措施就变得必要。分界线是系统在被阻止前可能造成的损害程度。许多团队希望存在第三种选择,但事实上并没有。
( 放大 )
##### 数据的来源
同样的模式也向上游延伸,追溯到模型在部署前所训练的数据来源。一位联邦法官批准了Anthropic公司就使用盗版书籍训练Claude模型而达成的15亿美元和解协议。这个数字本身最不值得关注。真正重要的是和解协议所划定的界限:区分合法获取的材料与从盗版库中获取的材料进行训练。失败的原因并非模型能力。训练流程完成了其设计的功能,而围绕该流程做出的决策导致了风险暴露。
如果你正在微调模型、构建评估数据集,或在第三方内容上构建检索系统,这一区分同样关乎你的责任。材料的获取方式、附带的权利,以及这些事实是否能在未来被追溯,与模型如何使用这些材料同样重要。
现在,董事会需要考虑的问题包括:训练数据的来源、谁承担风险,以及在不破坏产品的情况下能否移除存在争议的模型或数据集。
回答这些问题需要建立数据集清单、能够按需提供的许可条款、明确的法律诉讼赔偿责任承担方、对供应商相关诉讼的最新了解,以及在不中断产品的情况下替换模型或数据集的方案。大多数团队具备其中部分要素,但很少有团队能在短时间内整合所有内容。
##### 信心陷阱
控制措施和文档可以限制系统的行为并澄清其输入内容。但这两者都无法解决当系统向用户提供了令人信服的答案时会发生什么。最近的一项预印本报告了五项实验,涉及3,132名参与者,他们回答了难题并可以选择表示不知道。当人们可以获取AI建议时,这种自我约束几乎完全消失。参与者回答了更多问题,但他们的正确率仅为没有AI辅助的人的三分之一。他们的信心几乎翻了一番。
你应该假设用户也会做出同样的事情。在医疗、法律、金融、招聘和安全等场景中,一个充满信心的错误答案可能比明显的失败更加危险。当界面将平滑的推荐呈现为自然的下一步时,这种风险会进一步加剧。信心评分并不能自动提供帮助,尤其是当它来自生成答案的同一模型时。一个看起来精确的数字可能只是装饰而非证据。
你无法通过技术手段完全消除这一问题,因为你无法阻止人们高估流畅答案的价值。但你可以通过设计来应对这一问题,且这些措施是具体的。在向用户展示模型建议之前,要求用户先承诺自己的观点。诚实地展示不确定性,而不是将其美化为自信的表述。从过去的准确率而非模型本身获取信心数值。揭示不同来源之间的分歧,而不是将其平滑处理。让系统修正变得足够容易,使人们真正去执行修正。允许系统在必要时选择不作答。当错误成本较高时,将决策升级至更高级别。
然后验证这些措施是否奏效。测试的标准不是人们是否喜欢助手或是否能用它完成更多任务。而是人类与系统共同做出的决策是否优于被取代的原有流程,是否知道何时选择不作答,以及是否能正确升级关键案例。
##### 三张办公桌,同一个问题
企业AI的下一个阶段将不再由谁拥有最强大的模型定义,而是由谁围绕模型构建了最稳固的系统来决定。
安全与架构团队必须界定系统可接触的范围。数据、法律和采购团队需要记录系统输入内容。产品团队必须保留人类判断权。过去人们通过政策、习惯或监督执行的规则,如今越来越需要技术手段来实现,例如独立的代理身份、审批关卡、来源追踪和日志记录。
这些风险分散在不同部门,但正在演变为统一的管理难题。
能力是你可以购买的层级。围绕它的所有内容都是你必须拥有的层级。
评估系统本身而非仅评估模型,需要更丰富的度量指标。Luminos白皮书阐述了其中一种方法。
当数学成果变得触手可及
引用于《AI如何改变数学研究》