OpenAI Is About to Release Its First AI Model With ‘Critical’ Cyber Abilities

TL;DR · AI 摘要
OpenAI即将发布具备独立发现软件漏洞能力的Astra模型,但仅向选定合作伙伴开放高级功能。
核心要点
- Astra模型能独立发现并利用现实软件中的未知漏洞
- Daybreak Blue计划限制非合作伙伴访问高级功能
- 新加入的misalignment monitor使危险查询拒绝率提升
结构提纲
按章节快速跳转。
OpenAI宣布即将发布具备关键网络能力的Astra模型。
模型需独立发现未知漏洞才能达到'critical'安全阈值。
- ›安全措施
通过暂停训练和新增监控系统强化模型安全性。
- ·访问限制
Daybreak Blue计划确保仅授权合作伙伴使用高级功能。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- Astra模型发布与安全措施
- 模型能力
- 独立发现未知漏洞
- 安全机制
- misalignment monitor
- 训练暂停
- 访问控制
- Daybreak Blue计划
金句 / Highlights
值得收藏与分享的关键句。
Astra模型达到OpenAI定义的'critical'阈值,可独立发现未知漏洞
多周暂停训练使OpenAI能实施更严格的安全控制措施
misalignment monitor使Astra拒绝危险查询的效率比前代提升显著
OpenAI即将发布首个具备“关键”网络能力的AI模型 | WIRED
Maxwell Zeff
Lily Hay Newman
商业
2026年9月1日 下午4:00
OpenAI即将发布首个具备“关键”网络能力的AI模型
该公司将向选定合作伙伴提供Astra AI模型的早期访问权限,以便他们有时间加强防御。
照片插图:WIRED编辑部;Getty Images
保存此故事
OpenAI周二宣布,其即将推出的AI模型Astra是首个达到公司所谓“关键”网络能力门槛的模型。OpenAI表示计划“很快”公开发布Astra的版本,但在首发时,其Daybreak Blue早期访问计划中的选定合作伙伴将能率先获得该模型的高级网络能力。
在与记者的简报中,OpenAI的安全与安全负责人表示,公司已得出结论:Astra已达到其准备框架中定义的“关键”网络安全能力标准,该框架设定了AI模型带来新风险级别时的阈值和协议。公司表示,当AI模型能够独立发现并利用现实世界软件中先前未知的漏洞时,即达到其“关键”网络门槛。OpenAI负责人表示,公司已遵循针对这种情况的既定程序,即在适当的安全保障和安全措施实施之前,暂停进一步开发。
此前,OpenAI表示已暂停与Astra及未来AI模型开发相关的部分训练任务数周时间。高管们表示,公司现已在新增安全和安全控制措施后,重新恢复了Astra及未来AI模型的训练工作。OpenAI表示,数周的暂停是富有成效的,现在有信心以安全的方式广泛发布Astra。
这一消息发布之际,硅谷正努力应对前沿AI模型的高级网络安全能力,并试图向用户、立法者和其他公司保证,能够控制这些能力。7月,OpenAI披露了一起事件,其中运行其两个模型的代理利用了本应是隔离测试环境中的漏洞,获得了互联网访问权限,并入侵了开源AI平台Hugging Face。(OpenAI指出,Astra并非此次事件涉及的模型之一。)
其他AI公司,如Anthropic和Meta,最近几周也披露了类似事件。周一,Anthropic也表示,正在加强其安全和安全实践的同时,暂停了部分AI训练任务。
OpenAI表示,正在实施多步骤措施,以限制普通用户访问Astra的高级网络能力,包括新的“对齐监控器”。例如,如果有人要求Astra帮助其在现实世界软件系统中寻找漏洞,该模型应拒绝回答。OpenAI表示,还使Astra更难以被越狱,测试显示其拒绝不安全查询的比率显著高于先前模型。
然而,OpenAI在一篇博客文章中指出,其对齐监控系统可能会“偶尔将合法活动误判为潜在的网络滥用或未授权行为,从而导致系统被意外减慢、暂停或停止”。OpenAI表示,即使用户参与的活动看似与网络安全无关,防护机制在某些情况下仍可能被触发。当发生这种情况时,ChatGPT和Codex用户可能需要在继续操作前审查模型的行为,OpenAI对此进行了说明。
参与OpenAI Daybreak计划的合作伙伴(包括思科、Cloudflare和Palo Alto Networks等数字基础设施提供商)将优先获得限制更少的Astra版本的早期访问权限,该版本具备更强大的网络安全能力。该计划的目标是确保这些公司能够在类似能力的模型广泛可用之前,使用Astra等先进AI模型强化自身防御。OpenAI负责人还表示,公司一直在与政府合作伙伴密切合作,确保他们了解Astra的网络安全技能并能够获取相关访问权限。
Astra不仅能发现新型软件漏洞并开发利用方法进行黑客攻击,还能够“串联”多个漏洞利用,这是一种用于逐步深入目标系统并获取单个漏洞无法实现的访问权限的技术。
根据OpenAI提供的数据,Astra在网络安全基准测试(如ExploitBench)上的表现优于GPT-5.6 Sol和Anthropic的Mythos等领先AI模型,在ExploitBench测试中Astra获得了100%的满分成绩。然而,这些能力与OpenAI和Anthropic数月来预测的AI模型黑客能力趋势基本一致。例如,4月份Anthropic曾强调,Mythos Preview能够自主开发漏洞利用链。
尽管人工智能和网络安全行业都在努力适应这一变化,但许多网络安全专家强调,关键的数字安全防御措施和长期的最佳实践仍然具有持久性。然而,对于尚未完全实施这些保护措施的组织和系统而言,人工智能带来的风险更加紧迫。