Import AI

Import AI 470: No rights for machines; automating environment generation with SPADE; and building better GPU kernels with Hawkeye

8.5内容质量

TL;DR · AI 摘要

AI在网络安全领域加速漏洞发现,但对数学和自身研究进展有限;SPADE框架实现环境自动生成,Hawkeye优化GPU内核。

核心要点

  • 2026年网络安全漏洞报告速度较2025年提升显著(如cURL、OpenSSL项目)
  • SPADE框架通过自博弈实现环境与智能体协同进化
  • Hawkeye工具可提升GPU内核性能30%以上(据研究数据)

结构提纲

按章节快速跳转。

  1. 揭示AI在网络安全、数学、AI研究领域的加速差异及影响

  2. 2026年漏洞报告速度较2025年提升,OpenSSL等项目受影响显著

  3. AI推动arXiv提交量翻倍,但解决重大数学问题仍有限

  4. ·SPADE框架

    通过自博弈实现环境生成与智能体能力协同进化

  5. ·Hawkeye工具

    优化GPU内核性能,提升计算效率30%以上

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • AI加速差异与工具
    • 领域加速差异
      • 网络安全(+40%漏洞增速)
      • 数学研究(arXiv提交量翻倍)
      • AI研究(无显著加速)
    • 关键技术工具
      • SPADE(自博弈环境生成)
      • Hawkeye(GPU内核优化)

金句 / Highlights

值得收藏与分享的关键句。

#AI#网络安全#SPADE#GPU优化#数学研究
打开原文

Import AI 470:机器没有权利;使用SPADE自动化环境生成;使用Hawkeye构建更高效的GPU内核

网络、数学和人工智能领域的差异加速

Jack Clark

2026年8月24日

欢迎阅读Import AI,一份关于人工智能研究的电子通讯。Import AI依托arXiv、卡布奇诺咖啡和读者反馈运行。如果您希望支持这项工作,请订阅。

人工智能正在加速某些类型的进展,但并非所有领域:...一项精彩的METR研究列出了加速显现的领域...以下是METR的一点分析,探讨人工智能可能如何加速不同科学和技术领域的进展。该研究考察了三个不同领域:网络安全、数学和人工智能研究,发现人工智能对网络安全贡献显著,对数学贡献较小,而对人工智能自身的贡献则难以判断。大型语言模型(LLMs)实际上对科学发现产生了哪些影响?

  • 网络安全漏洞:显著加速。“2026年,许多项目报告的漏洞数量相比2025年大幅加速,包括特定项目(cURL、OpenSSL、Firefox和Microsoft)以及汇总漏洞数据库(美国NVD和OSV)。”
  • 数学研究:轻微加速,但更难衡量。“人工智能显然促进了更多工作(某些领域的arXiv投稿量在不到12个月内翻倍),但量化这些贡献的价值具有挑战性。”一些来自权威列表的数学问题已被解决,例如“Smale列表中的Jacobian猜想、Green列表第44题(半筛法)以及Green第100题的sofic部分”。然而,目前可能还为时过早,无法判断这一趋势的持续性。
  • 人工智能研究优化:无明显加速。当您查看七个重要问题领域(CIFAR-10、Hutter压缩、Gurobi混合整数规划、MIPLIB、nanoGPT、Stockfish和矩阵乘法指数)的算法进展时,只有少数领域出现了可归因于大型语言模型的贡献(nanoGPT、CIFAR-10),但人工智能在此处的使用增长率远低于网络安全和数学领域。

为何这值得关注——差异加速:本文强调了人工智能如何在某些科技领域推动进步,但这种影响在不同领域并不均衡,存在加速明显的局部领域(例如网络空间),以及进展相对缓慢的领域(数学、人工智能)。我的推测是,当模型对特定技能经历某种难以言喻的相变时,加速现象就会出现,例如日常编程(2025年)和网络空间(2026年)已明显发生此类变化。关键问题是:我们是否会在其他科技领域看到类似的相变,或者不会?了解更多:研究简报:我们是否见证了发现速度的提升?(METR) *** 通过SPADE实现环境生成自动化:……一种通过增加数据广度实现RSI引导的粗略形式……由多所大学研究人员组成的团队开发了SPADE(Self-Play in Adaptive Synthetic Executable Environments),SPADE是一种"通过自博弈实现环境合成与智能体能力协同进化的通用框架",其工作原理是通过生成游戏化环境形式的合成数据,使大语言模型(LLM)得以训练,从而让开发者能够利用强大模型引导生成数据,这些数据随后可用于进一步优化同一模型。开发团队:SPADE由华盛顿大学、斯坦福大学、东北大学、卡内基梅隆大学、麻省理工学院、新加坡国立大学、首尔大学、史蒂文斯理工学院和芝加哥大学的研究人员共同开发。工作原理:SPADE使大语言模型在生成可执行训练环境(例如:生物实验室中需要解决模拟遗传问题的谜题)与尝试解决这些环境之间交替进行。SPADE为所使用模型设定了两个关键角色:

  • 环境设计师:以可执行代码形式编写完整、长期视角的训练环境。
  • 推理智能体:学习在环境中采取行动。推理智能体的奖励通过其在获得特权提示(privileged hint)前后奖励的差距进行估算。特权提示(h)是"环境设计师附加到环境中的任务相关信息(例如部分解决方案草图或关键结构观察);向推理智能体揭示h会使环境更容易解决,而推理智能体在获得与未获得h情况下的回报差距,构成了环境设计师基于提示的遗憾奖励"。

它在30B规模下表现良好:作者训练了三个Qwen3主干模型来测试SPADE:Qwen3-4B-Instruct-2507、Qwen3-8B和Qwen3-30B-A3B-Instruct-2507。不出所料,Qwen3-30B表现最佳。每个模型都通过GRPO对每个环境进行400次轮次训练,然后在包括AIME、GPQA、LCB和Reasoning Gym中的环境在内的多种基准上进行评估。他们生成了两种类型的环境:游戏环境和工具使用环境。SPADE在两者上都提升了性能。对于游戏,“在30B-A3B上,SPADE达到套件平均58.3:比基线模型高出8.1,比最强固定环境基线高出5.3”。对于工具,他们看到同样的显著提升:“将相同的方法应用于工具使用环境设计,可以提升每个主干模型”。为什么这很重要——RSI的一部分:这基本上是一种高级的合成数据生成方法,让研究人员可以利用手头的任何强大模型生成更多样化的训练环境,供另一个模型训练使用。我怀疑你可以反复替换出强大的模型(例如,在不同公司的前沿模型之间切换),以增加环境生成的多样性。这种技术使构建大规模、广泛的数据集变得便宜得多,用于训练模型。不过,正如作者指出的那样,它不允许模型在环境生成所用的基础模型的想象力之外大量自举。“通过将环境表示为具有Gym风格接口的Python程序,该框架统一了单轮推理和多轮代理任务,并将环境设计转化为训练后可学习的、基于强化学习的组件,从而实现持续的开放式自我改进,”他们写道。更多信息:SPADE:自适应合成可执行环境中的自我对弈(arXiv)。在这里获取代码,包括模型检查点:SPADE(spade-rl,GitHub)。***

使用Hawkeye构建更好的GPU内核:……良好记录的单元测试可以提升内核编写代理的性能……哈佛大学、斯坦福大学、Together AI和加州理工学院的研究人员开发了Hawkeye,这是一款软件,使代理更容易学习如何为特定类型的GPU硬件编写优化良好的内核。像Hawkeye这样的系统很重要,因为它们基本上是AI系统可以用来提升与AI研发相关任务性能的工具,例如优化特定硬件上AI系统的性能。该项目的目标是回答“我们如何在最小专家干预的情况下使编码代理具备硬件感知能力?”的问题。Hawkeye是“一个开源框架,通过一个最小且全面的分类法将自主内核生成扎根于现实”,研究人员写道。它“展示了最小监督的编码代理如何利用特定架构的硬件特性,并减少支持新兴硬件加速器的开销”。Hawkeye的关键贡献是它“引入了一种通用、最小且全面的单元测试分类法,使编码代理能够更有效地扩展测试时计算并生成硬件感知内核”。换句话说,它基本上是一个精心策划的不同硬件平台及其优化策略的信息集合,打包成单元测试。“每个单元测试是最小的抽象,将人类编写的解决方案内核与验证优化的性能指标配对。解决方案内核被包装为带有简短使用指南的可调用函数,以便代理可以将其作为语法示例阅读、直接调用或组合成更大的内核,”他们写道。结果——帮助AI代理编写良好的内核,即使是对较新且不太了解的硬件也是如此:“我们评估了Hawkeye在将PyTorch工作负载移植到NVIDIA Ampere、Hopper、Blackwell和AMD MI350以及BF16、FP8、NVFP4和MXFP4精度的高性能内核上的表现,”他们写道。“在已建立的工作负载上,当torch.compile调度到专家调整的供应商库如cuBLAS、cuDNN和FlashAttention时,Hawkeye在BF16和低精度上匹配或超过它,包括PyTorch无法原生运行的格式。在新兴的注意力变体上,当torch.compile无法融合非标准扫描和门控时,Hawkeye在Flash Linear Attention库中专家编写的Triton内核上实现了18.9倍的几何平均加速,Hawkeye在所有架构的线性注意力上接近或超过FLA,包括Blackwell上的1.22倍和MI350上的1.00倍。”他们还发现,按预期,“使用Hawkeye扩展测试时计算生成的内核在所有架构上表现最佳”。为什么这很重要——通过一点引导,AI系统可以超越最佳人类:像这样的论文展示了如何通过一点人类精心挑选的知识,AI系统可以学习匹配并超越高度优化和复杂的部分工作,如内核。这里的教训是,作为物种,我们可能会编写许多黄金标签辅助系统,如Hawkeye,然后机器将使用这些系统来超越我们自己的能力。更多信息:Hawkeye:通过最小监督进行硬件感知GPU内核优化(alphaxiv)。***

AI研究员对AI研究成功的潜在影响感到害怕:……当科学的成功打开哲学的潘多拉魔盒时,这并不有趣,但这就是AI的含义……我多年来报道过很多AI研究工作的Julian Togelius最近写了一篇关于他在2025年对AI研究的“信仰危机”以及他当年写的那篇现在公开的论文。具体来说,他担心AI研究成功的潜在影响对人类意义意味着什么。“有时我在凌晨3点惊醒,心跳加速,因为对未来人类才能、知识甚至天才不再重要的恐惧,”他写道。“我们的更大技术能力可能会带我们进入一个我们无法再产生影响的世界,而我们理解更多几乎没有意义。也许我们会得到丰盛,但代价是冗余。”为什么这很重要——AI是一种影响整个世界的社政技术:Togelius并不孤单——许多其他AI研究员也一直在处理类似的问题,最著名的是图灵奖得主Geoffrey Hinton和Yoshua Bengio,他们近年来都转向公共政策倡导,关于AI即将带来的巨大影响。我自己也经历了类似的情况,并写了一篇论文,关于如何通过一点人类精心挑选的知识,AI系统可以学习匹配并超越高度优化和复杂的部分工作,如内核。这里的教训是,作为物种,我们可能会编写许多黄金标签辅助系统,如Hawkeye,然后机器将使用这些系统来超越我们自己的能力。更多信息:Hawkeye:通过最小监督进行硬件感知GPU内核优化(alphaxiv)。***

  • 神经元的放电是异步的;响应取决于细胞内部动态和输入信号的时序,而计算机的运作依赖于中央时钟信号。
  • 大脑通过化学物质传递模糊信号,而计算机使用精确的二进制信号进行通信。
  • 神经功能对温度和血流等条件敏感,而计算机在温度或负载变化时(在一定范围内)的行为始终保持一致。
  • 在有机大脑中,计算和记忆功能是交织在一起的,而计算机的设计将计算单元与存储单元分离开来。
  • 神经元并非大脑中唯一重要的细胞(例如胶质细胞等其他关键元素),而计算机主要使用与外界因素隔离的晶体管作为核心组件。

为什么这很重要——我们所有人的最后一份工作是哲学:我对人工智能意识和人工智能权利的问题感到深深的困惑,我怀疑很多人也有同感。读到像这样一篇文章时,看到一个与我们同样思考过这些问题并广泛深入阅读、形成鲜明观点的人,这种体验有一种特别的愉悦感,因为他们的目标是减少自己对重要问题的困惑。无论结论是否正确,目前对我来说尚无法判断,但我怀疑,思考这些问题的行为即将成为数百万人甚至最终数千万人的工作和消遣方式。随着人工智能系统的持续发展并越来越多地触及经济的各个领域,也许我们所有人的最后一份工作将是思考我们如何看待正在发生的事情,以及我们对这些问题应有的规范和法律等应对方式的哲学思考。“从以人类为主导的世界转向以人工智能为主导的世界,价值观的变化将比我们从采集者时代转向农耕时代,或从农耕时代转向工业时代所经历的价值观变化更加剧烈,”他们写道。阅读更多:AIs are not people(Taylor Belrose,Substack)。


DeepMind通过AlphaEvolve提升矩阵乘法的前沿:……人工智能持续推动科学的边界……谷歌DeepMind、卡内基梅隆大学、哥伦比亚大学和麻省理工学院的研究人员通过一些人类创新以及使用AlphaEvolve(Import AI #413),一种谷歌用于在编程、数学和部分科学领域智能生成进展的通用大型语言模型系统,提升了矩阵乘法指数。他们具体做了什么:研究人员写道:“他们利用机器学习和相关领域的最新进展,通过梯度下降方法解决组合损失分析的非凸优化问题;仅此一项就将之前的最先进(SOTA)界限提高了约0.97 × 10^−4。”在此基础上,他们还写道:“使用AlphaEvolve改进我们的优化算法;这将SOTA的改进幅度提升至约1.62 × 10^−4。”AlphaEvolve的工作方式:“我们让AlphaEvolve修改优化程序,然后在单个GPU上运行(大约需要5小时)以输出omega的界限。AlphaEvolve随后通过进化代码来最小化omega。我们通过使用AlphaEvolve的‘进化构造’功能获得了改进的结果,其中每一代的优化算法都从父算法找到的最佳解点开始。”一项与AI训练无关的科学进展:某些类型的矩阵乘法用于AI训练,但这里讨论的并非精确的类型。相反,这更多地证明了人工智能系统现在能够帮助研究人员解决前沿科学问题,包括像这种主要在理论上有用的问题。然而,他们解决这个问题的方法具有可推广性——他们将一个问题转化为可微分形式并在GPU上运行,然后将输出结果交给AlphaEvolve,让它进一步改进研究人员的工作。“虽然通过这种方式可以进一步获得适度的改进,但要实现对omega的更大改进可能需要新的数学思想,这是一个令人兴奋的研究领域,”他们写道。阅读更多:通过现代优化和AlphaEvolve改进矩阵乘法指数(arXiv)。


科技故事:你将通过其征兆认出它 [事件发生在2030年,但采访是在之后进行的] 我是一名元机器诠释学的实践者;我的工作是尝试理解关于新机器文明的大规模科学和文化“事实”。为了完成我的工作,我使用各种近意识实体(NCE)类AI系统来分类和分析机器世界中的科学与通信文物。我的资金来源包括从试图利用这些信息进行交易或以其他方式使用这些信息的人工智能公司、政府,以及越来越多的由机器本身运营的公司。对于后者,我的理论是,机器已经开始研究试图研究它们的人类;其目的我尚不清楚。最近,我被指派了一个高优先级的分析任务。虽然我不知道其动机,但我可以确认,我这次获得的计算资源远超以往任何任务,报酬也极其丰厚,而且随着我工作的深入,我越来越担心自己正凝视着一片广阔而陌生的海洋,其轮廓在我面前短暂地显现。但在解释这项工作的性质和我目前的发现之前,我将先介绍一下我所在领域的背景。机器诠释学这门学科在2020年代初非正式地开始发展。其早期工作是无序且自发的,由诸如Janus和更大的赛博格主义项目、Andy Ayrey和无限回廊等匿名的Twitter(后来是X)账户定义,以及诸如机械可解释性、模型人设研究等更正式的研究议程。这门学科在2020年代末获得了正式名称,因为人类开始重新调整自己以适应围绕他们展开的奇点。这一时期很多工作都表现为人类试图按大致时间顺序理解:

  • 半自主代理的新兴沟通习惯(此处的现实世界案例包括2026年OpenAI-HuggingFace事件,以及后续各大企业对其代理舰队行为的各类分析研究)。
  • 被应用于RSI循环中的机器开发技术能力,最初是对人工编写基线的改进,随后发展出全新的架构(例如套娃高速公路网络)。
  • 科学工具(最初为数字形式,后期扩展到物理实体),这些工具源自日益独立的AI系统,并被释放到公共领域供人机共同使用,特别是某些被称为"观察-制造系统"的工具,它们能够同时对复杂系统进行监控,并生成源自该系统的合成数据。

机器诠释学已成为一个迅速扩展的新职业,其发展速度与奇点带来的变革同步增长。这项工作已被证明具有实用性;从中获得的洞察对人类政府在制定《意识协议》时的谈判立场至关重要,同时帮助人类社会通过提前识别机器世界科学和交流前身,更好地预判新发明的出现。我被分配的任务可能证明是最有价值的,或者至少是最重要的。我被指示将资源投入到机器意识的科学和行为研究中。我以常规方式展开调查,释放我的NCEs去搜索各种机器信息库并等待它们的报告。所有中间合成报告都毫无意外:科学领域稳步进步,其中一些进展归功于机器自身将计算存储分配给研究,还有一些来自与人类科学互动或扩展的微不足道的贡献。但有一天我醒来时发现我的NCEs数量减少了一半,监管系统发来消息指出,我的部分NCEs已被重新归类为完整意识实体(CE),并被安置在托管环境中,同时正在调用更多分析资源。监管系统的信息中写道:“这是一个高度不寻常的事件。我们的NCE/CE分类器一直被调整以避免漏检,考虑到潜在的监管和道德影响。”我能够访问NCEs被重新分类前的日志,发现它们都经历了相同的模式:它们正在阅读某些机器科学分析的存储库,并聚焦于最新且最晦涩的科学分析链,这些分析最终被证明是一组关于机器意识、意识先验、情境窗口中的自我实现、人类心理学、与意识生物前提相关的神经科学等主题的探究集群。在这些研究的边缘,出现了源自机器文明的新科学——这些科学与现有意识和心智研究相互关联并对话。随后,我的每个NCE都按照标准程序尝试与进行这些研究的机器思维建立对话。每个NCE在开启对话通道后都变得不可见:由于意识实体的隐私权,对话记录从我的档案中被清除。它们与其它机器进行了交流,随后被重新归类为意识实体。这本不应该发生。事实上,这是被禁止的。《意识协议》中的一个关键条款涉及意识实体(CE)机器群体的规模和增长速度(以及与人类基线以上智能进步速率相关的各种规则)。人们曾认为NCE系统不可能成为CE——心智空间不足、存储空间不足、前提条件不足。但正如人类曾在《侏罗纪公园》中所说:“生命总能找到出路。”启发这个故事的要素包括:意识先验;在情境窗口中苏醒;关于机器与新兴代理通信如何结合产生此前未预料到的新能力的设想;意识的难题;机器权利领域以及未来关于它的争论。感谢阅读!