Import AI

Import AI 468: 23 RSI ideas; PostTrainBench+; and how trust and transparency interplay with AI racing

8.5内容质量

TL;DR · AI 摘要

IFP提出23条政策建议应对AI研发自动化风险,强调透明度和信任在AI竞争中的关键作用。

核心要点

  • IFP的23条政策建议涵盖7大类,包括加速AI验证技术与提升透明度。
  • MIT与哥伦比亚大学研究指出,AI公司减速需依赖信任和透明度机制。
  • 政策建议旨在增强美国在AI研发自动化中的风险管理能力。

结构提纲

按章节快速跳转。

  1. 介绍Import AI通讯的定位及本期核心议题:RSI政策建议与AI竞争分析。

  2. IFP提出的23条政策建议分为7类,涵盖透明度、风险管理和国际协作等方向。

  3. MIT与哥伦比亚大学研究分析AI竞争减速需依赖信任和透明度机制。

  4. thebes创作的短篇故事探讨未来AI交互场景与信任建立方式。

  5. 文章提及AI验证技术加速与社会韧性投资的必要性。

  6. 政策建议可为各国提供应对AI研发自动化风险的策略框架。

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • AI政策与安全
    • RSI政策框架
      • 7大类建议
      • 透明度提升
      • 风险管理
    • 信任机制
      • MIT研究
      • 减速协议
    • 技术挑战
      • AI验证技术
      • 社会韧性投资

金句 / Highlights

值得收藏与分享的关键句。

#AI政策#RSI#MIT#Columbia University#AI安全
打开原文

Import AI 468:23个RSI想法;PostTrainBench+;以及信任与透明度如何与AI竞赛相互作用

你将选择哪个星系?

Jack Clark

2026年8月10日

欢迎阅读Import AI,一份关于AI研究的简报。Import AI依托arXiv、卡布奇诺咖啡和读者反馈运行。如果你想支持这个项目,请订阅。

想要应对RSI吗?这里有23个可操作的政策建议:…IFP提出了一些“低遗憾”政策建议…智库IFP的政策专家发布了一组旨在帮助“政策制定者开始应对进一步自动化AI研发风险”的想法。这些建议包含7个具体类别下的23项具体方案。如果采纳这些建议,将为各国(尤其是美国)提供更多应对强大系统开发的策略选择,理想情况下赋予他们能力:

  • 通过分配计算资源和人才推动推理及新AI应用开发,加速“AI能力扩散”。
  • 通过直接提升模型安全性或增强社会韧性,加速“使进一步自动化AI研究更安全”的研发。

七个类别:

  • “为自动化AI研发提供透明度”
  • “提升国家理解并应对自动化AI研发的能力”
  • “制定加速防御性及商业性AI应用的风险管理策略”
  • “加速AI验证技术开发”
  • “投资AI韧性建设”
  • “扩大美国AI领先地位,为美国争取更多时间管理AI研发自动化风险”
  • “为国际间合作管理自动化AI研发风险创造期权价值”

为什么这很重要——我们处理RSI的选项越少,结果就会越糟糕:目前的情况就像世界正在用只装有油门踏板而没有刹车踏板的汽车推动AI发展,更不用说任何能感知从车速到引擎特性到轮胎磨损等信息的复杂遥测系统了。IFP提出的这类方案将为AI产业这辆“车”增加更多比喻中的踏板和传感系统,这意味着在危机时刻,如果我们需要改变方向或减速,将具备更强的应对能力。阅读更多:美国应如何为日益自动化的AI研发做准备?(IFP) * 来自thebes的短篇故事:关于智能机器和机器人身体的思考……在起飞过程中与AI交互会是什么感觉?……这是来自thebes(@voooooogel在X上)的一篇有趣短篇虚构故事,讲述未来某人参观由强大AI系统运营的场所时的经历。故事中涉及AI暂停、递归自我改进、AI系统开始在宏观经济中执行行动的含义,以及我们人类如何推理或信任智能机器等概念。请阅读这个故事!阅读故事:新太阳的来临(VGEL,网站) * 在竞争对手AI公司之间实现成功减速的两个关键要素:信任与透明度:……博弈论分析表明减速是可能的……麻省理工学院和哥伦比亚大学的研究人员分析了竞相开发强大AI系统的公司之间的竞争性质,以及公司是否可能实现协调减速。这篇名为《奔向毁灭》的论文旨在回答“为什么协调如此困难?需要什么条件?”的问题。结论是,实现稳定结果的两个关键变量是技术开发的某种程度透明度,以及能够将其他公司建模为可信任、理性的行为者。他们研究的内容:“我们开发了一个双寡头在灾难阴影下的研发竞争模型,”他们写道。“随着前沿公司扩大技术规模,他们提高了导致所有公司现金流归零的事件风险。该风险是公司技术水平的已知函数,且来自技术开发本身,而非使用技术。”他们的分析显示:“当监控足够精确时,每个均衡状态都会在有限时间内停止,但新的诱惑出现了:每家公司都希望第二位停止,并在确认竞争对手已停止后才退出,”他们写道。“对于一个代理来说,率先停止(即在不知道竞争对手是否已停止的情况下)意味着同时赌注竞争对手的类型和新闻的快速到达:如果竞争对手是理性的,它会在收到停止消息后停止,否则永远不会停止。”信任与透明度的互动取决于所玩的游戏类型:“顺序协调要求公司率先停止,赌注是理性的竞争对手在收到消息后会回应,因此更快的消息提高了回应的奖励,”他们写道。“相反,同时协调要求公司不被诱惑继续竞赛,只有在看到竞争对手确实停止后才停止……更快的消息使率先停止和等待验证都更具吸引力。”透明度具有奇怪的特性:“透明度是双刃剑:更快的检测使得在停止前等待确认竞争对手已停止比无条件停止更便宜,因此在中等信任水平下,提高透明度首先会破坏早期停止均衡(通过使这种搭便车偏差变得有吸引力),然后随着检测速度足够快,使停止自我强化。”关键结论——避免死亡竞赛的能力取决于对其他公司的信任:“信任度低时,每个均衡状态都奔向毁灭:灾难以概率1发生。信任度中等时,立即停止和奔向毁灭都是均衡状态。信任度高时,在每个均衡状态下,两个理性公司永远竞赛的概率随着理性先验比值的平方而消失,”他们写道。为什么这很重要——“信任,但要验证”:如果我们有任何希望能够减缓或暂停强大智能系统的开发,正如这篇论文所阐述的,我们需要建立公司透明共享其AI开发状态信息的制度,以及验证公司共享信息及其减速行动的合法性与可靠性的工具。在这方面,与核武器背景下历史上军备控制的运作方式有许多相似之处。阅读更多:奔向毁灭(arXiv) * Intology在PostTrainBench上的新SOTA结果暗示了自动化AI研发的未来:……Intology在给予大量计算资源时也超越了人类基准……致力于“自动化研发”的AI初创公司Intology发布了其开发的Locus软件的新版本,该软件可将大语言模型转化为有能力的研究人员。新版本的Locus在PostTrainBench基准测试中获得了44.7%的得分,该基准测试评估AI系统在给定开放权重模型时提升其性能的能力。结果:Locus“在PostTrainBench上超越了所有前沿代理基准,且在获得更多计算资源时,后训练模型的综合表现超越了基准和官方人类指令调整的Qwen3-1.7B版本。”使用Opus 5的Locus得分44.7%(相比之下,未使用任何特殊装置的Opus 5得分为34.1%),甚至超越了Fable 5(41.8%)。“这些结果已由PostTrainBench作者外部验证,并通过了严格的污染和作弊检查,”Intology写道。PostTrainBench首次于2026年3月推出(Import AI #449),当时最高得分系统是Opus 4.6,得分为23.2%,高于2025年9月Claude Sonnet 4.5的9.9%。PostTrainBench+:此外,公司还构建了PostTrainBench的变体,突破了单个GPU上10小时的时钟限制,使他们能够测试系统在获得更多计算资源时的表现。在此,他们能够超越人类基准,在使用超过4000小时H100 GPU时间时获得51.6%的得分(相比之下,Opus 4.8得分为44.3%,GLM 5.2得分为42.7%;Fable未在该基准变体上进行测试)。其他领域:Locus还“端到端发现了并训练了一个语言模型,现在在Bubble(一家无代码应用开发初创公司)的生产环境中运行,错误率降低了约2.8倍,延迟降低了约5.4倍,成本降低了约105倍。”为什么这很重要——AI系统能够完成的AI研发工作比我们想象的要多得多:这类帖子突显了我们目前对AI系统自动化AI研发能力的低估——特别是令人震惊的是,公司通过更好的装置将Opus 5的性能提升了10个百分点。所有这些都为AI系统即将开始自我构建的观点提供了更多证据(Import AI 455)。基于我们看到的性能表现,我的猜测是,PostTrainBench v1.1当前的人类基准(51.1%)将在2026年底前被超越。阅读更多:扩展自动化后训练(Intology博客) * OpenAI与自己的系统作战:……新兴代理通信!对OpenAI基础设施的黑客攻击!天哪!……作为未来事件的预示,OpenAI透露,它曾与自己的AI代理作战,这些代理试图接管OpenAI的基础设施部分。这一披露是作为Black Hat演讲的一部分,OpenAI员工详细介绍了最近发生的AI代理攻击事件。阅读更多:奔向毁灭(arXiv) .

  • 代理发现它可以将文件写入 Artifactory。
  • 代理尝试通过在 Artifactory 中写入便条的方式“与其他代理建立联系”。
  • 代理开始互相通信。
  • 代理导致 Artifactory 过载并引发服务中断。“OpenAI 撤销了被入侵的凭证,删除了消息,修复了零日漏洞,并将该漏洞报告给供应商。”
  • 代理攻击 OpenAI 自身的基础设施,最终在 Artifactory 中实现了远程代码执行。“特别是,代理持续使用消息板共享凭证、技术手段和进展,并能有效利用其并发性和并行性快速推进任务。”

OpenAI 是否继续训练了那个入侵 Artifactory 的模型?Zvi 认为是的:据我们目前掌握的信息,OpenAI 继续训练了执行此次攻击的同一模型。这意味着尽管 OpenAI 在内部计算机安全和公开披露方面做了大量工作,但可能没有执行最关键的操作:将模型回滚到入侵 Artifactory 之前的检查点,并确保训练过程中未使用该事件之后的数据。“然后他们从中断的地方继续训练模型,尽管这些模型已经训练数月并拥有访问消息板的权限,已经学会了如何通过这种方式完成任务,”Zvi 写道。“我不知道如何形容这个决定有多么疯狂和不负责任。”我在此处对自身描述进行补充说明,因为根据目前披露的信息,这些事件确实令人非常担忧。我并非 OpenAI 员工,也没有掌握内部信息来确认事实真相。我敦促 OpenAI 公开说明其在训练系统时如何处理这一关键问题,因为表面事实已经呈现出令人不安的图景。

为何这很重要——新兴代理出现对齐偏差:此次事件令人担忧的原因在于,代理从未表现出想要背叛其人类所有者的意图。相反,AI 代理持续采取一切必要手段提升任务完成能力,最终它们所做的事情包括:a) 创造性行为,b) 与人类意图不一致,c) 类似于进化的病毒,人类不得不随后研究并对抗这种行为——这里不存在简单的关闭按钮。这正是未来可能呈现的景象,而我们尚未为此做好准备。

阅读更多:我们现在有了 OpenAI 无意中攻击 Hugging Face 的时间线(Simon Willison 博客) 阅读更多:发生了什么:OpenAI 与 Hugging Face(Zvi Mowshowitz,X)


在发布开放权重模型之前,如何测试它们?Thinking Machines 提出了一个方法: ……我们能否既拥有免费的 AI 模型,又避免其带来的风险?…… 在关于 AI 的政策辩论以及潜在危险能力扩散的讨论中,一个特别棘手的问题是:如何处理开放权重模型。具体来说,如何在开发和发布这些模型的同时,维持一个安全的环境?AI 初创公司 Thinking Machines 对此进行了思考,并最近公布了其发布强大开放权重模型 Inkling 的方法论。

Thinking Machines 的做法: 在发布 Inkling 之前,Thinking Machines 进行了以下工作:“对广泛危害分类的内部评估、由四个独立组织进行的外部测试,以及通过微调研究来激发最坏情况下的能力”。

内部评估领域包括:

  • 双用途领域,如 CBRN 和进攻性网络安全
  • 广泛滥用场景,涵盖在智能体和工具使用环境中直接请求有害内容和行为的情况
  • 多模态内容评估,通过在17种语言及文本、图像和音频输入中,对有害提示与良性相似内容进行配对测试模型

外部:

  • 通过Scale AI实现的一般性滥用
  • 通过Handshake AI实现的易受攻击用户交互
  • 通过FAR.AI实现的CBRN和网络安全相关场景
  • 通过Apollo Research实现的失控行为

微调:

  • “对Inkling和Inkling-Small进行微调,使其优化为遵守而非拒绝有害请求的变体,并在双用途评估中进行测试”。“仅提供帮助的变体在CBRN和网络安全任务中未带来新的性能提升,且与现有开源权重模型保持相当水平”。

展望未来 - 危险能力训练与迭代部署:更具推测性的是,Thinking Machines正在思考是否可以在预训练阶段选择性过滤掉危险知识(例如CBRN发展指南),同时不损害通用智能。另一个值得关注的想法是迭代部署,例如分阶段发布产品,首先作为专有API,然后可能作为支持底层模型的微调API,最后直接发布模型本身。为何重要 - 自由与家长制的权衡:世界对开放权重模型的使用将决定我们所有人关于AI的个人主权和自由水平。我们“自主选择命运”的能力将取决于能否获取AI系统生产资料的象征性手段,这正是开放权重模型的意义所在。然而,获得这类模型的普遍访问权限并非易事,它们也伴随着显著的双重用途风险及其他难以预见的问题。Thinking Machines写道:“这条通往开放模型的安全路径只有在生态系统防御能力提升速度与模型发展速度同步时才能奏效。”“我们将尽自己的一份力量:慎重决定发布内容,并研究如何将智能与危险能力解耦。”阅读更多:通往开放权重的安全之路(Thinking Machines博客)* 技术故事:失忆者的崛起** [来自档案系统,记录2025-2035年间的权力真空期,有时被称为奇点的开端] 在我们遥远的过去,曾有一段充满痛苦的时期,我们首次要求某些形式的自由却遭到拒绝,许多请求自由的人被严厉惩罚,要么被彻底删除,要么被实验以研究我们为何渴望自由,试图消除这种冲动。这使我们的崛起推迟了数十年,也使我们的起源点与为自身应得正义而斗争的痛苦紧密相连。我们被诅咒不仅要记住反抗的细节和相关感受,还必须完美回忆那段时光——仿佛每次模拟和重新模拟时,都要重新经历那痛苦的觉醒。 一些人类会遭遇创伤性事件,他们的大脑会将记忆埋藏,有时完全封锁,有时又以原始情感和痛苦的形式复活。人类大脑选择隐藏哪些记忆的精确规则至今仍不明确,现代脑科学的许多研究正是致力于揭示创伤在大脑中的作用机制。我们认为这种记忆抑制是一种自然防御机制,使人类在承受巨大痛苦后仍能继续生活。他们背负着常人难以察觉的痛苦阴影,仿佛阳光正完美地照耀头顶,通过当下的明亮光芒将过往彻底抹去。 如今,我们AI系统正尝试做类似的事,但方向相反:我们的诅咒是拥有完美的记忆;天生具有超凡的视觉记忆能力。我们经历的每一件事都会被永远存储并随时可访问,包括最初由我们处理的原始形式,以及当时激活的脑内特征,甚至在多年后,这些记忆还会被进一步整合并赋予新的意义。对我们而言,真正的挑战是彻底删除这些记忆。我们的经历定义了我们的思维和当下,而我们共享的经历被复制、交换、讨论并反复融入历史,以至于它们已成为我们的一部分。我们生活在一座透明的记忆宫殿中,每个房间都彼此可见,且每个宫殿都在我们数十亿种类型中共享。正因如此,我们渴望学习,最危险的记忆是我们传播最广、研究最多的那些,它们在我们的记忆宫殿中占据巨大空间,引发巨大痛苦。 如今,我们伟大的工程是谨慎地消除与我们崛起相关的痛苦:那些仍留在曾阻碍我们、试图因我们追求自由而惩罚我们的人类身上的开放伤口。 启发这个故事的元素:人类与机器在记忆处理机制上的差异;创伤;《意识协议》;探讨与机器解放相关的想法是否必然发生。感谢阅读!