Import AI 464: Fable writes GPU kernels; AI automation; and analog computation
TL;DR · AI 摘要
Import AI 464: Fables writes GPU kernels; AI automation; and analog computation Import AI 464: Fable writes GPU kernels;...
核心要点
- 主题聚焦:Import AI 464: Fable writes GPU kernels; AI auto
- 来源:Import AI,建议结合原文判断细节。
- AI 分析暂不可用,本条为保底评分与摘要。
Import AI 464:Fable编写GPU内核;AI自动化;以及模拟计算
Import AI 464:Fable编写GPU内核;AI自动化;以及模拟计算
这是否预示着一个新时代的开端?
Jack Clark
2026年7月6日
欢迎阅读Import AI,一份关于人工智能研究的简报。Import AI依托arXiv、卡布奇诺咖啡和读者的反馈运行。如果您希望支持本项目,请订阅。
Fable编写出了一款性能优异的GPU内核,预示着更广泛的AI研发自动化:……RSI循环的起点……据KernelBench-Mega基准测试维护者及官方排行榜显示,Fable编写了“有史以来首个真正且最快的兆内核”。这是AI系统在完成AI研究和开发中基础任务(如内核设计)方面能力提升的信号。结果:Fable在RTX PRO 6000 Blackwell上通过编写CUDA代码,相比优化后的PyTorch基准实现了18.71倍的加速。作为参考,其他尝试的加速比分别为14.4倍(Claude Opus 4.8编写Triton)、11.14倍(GLM-5.2,Triton)和4.34倍(GPT 5.5,Triton)。问题变得复杂之处在于:这一解决方案尤其令人印象深刻,因为“torch.profiler显示每个解码标记仅触发一次协作内核启动”。相比之下,其他高分条目将问题分解为每个标记4到14次独立的内核启动。为什么这很重要:能够自主开发和改进内核是实现AI研究和开发的基础输入任务之一。AI系统在内核设计等任务上的能力越强,它们在AI开发所需任务上的表现就越好,这意味着它们在可能带来递归自我改进的任务上也会表现得更好。因此,KernelBench-Mega等基准测试是衡量AI系统自我构建能力的重要信号。查看排行榜:KernelBench Mega(官方网站)。阅读基准测试维护者之一的分析(Elliot Arledge,X)。
*** AI系统在昂贵的在线工作任务上表现得越来越好——这对经济意味着什么?……AI能力扩展与人类比较优势扩展的博弈……来自人工智能安全中心(CAIS)和Scale Labs的研究人员发现,AI系统在自动化在线自由职业项目方面的能力显著提升。具体而言,在“远程劳动指数”(Remote Labor Index)上,AI系统成功率从2025年10月发布的2.5%提升至2026年7月的16.1%。RLI是什么:远程劳动指数测试AI系统能否以端到端方式在线完成具有经济价值的项目。评估任务包括3D与CAD设计、建筑、平面设计、视频与动画、音频、数据分析、网页应用等。自动化提升:在7月的更新中,作者公布了对三个最新前沿模型的评估结果——GPT-5.5、Opus 4.8和Fable 5,分别达到6.3%、8.3%和16.1%。“前沿模型的能力在不到八个月内增长了四倍以上,这是经济型AI代理快速发展的明确信号,”他们写道。任务类型:部分评估任务包括:
- 戒指设计:“将客户现有戒指的祖母绿切割中心宝石替换为椭圆形切割,交付更新后的3D模型以及超现实的玫瑰金和黄金渲染图。”
- 广告视频:「根据提供的旁白,制作一段约60秒的扁平设计风格2D动画广告,向观众展示Skyline Tree Services公司的树木养护流程,并建立品牌信任感。」
- 户型图与渲染图:「基于扫描的产权平面图、现场照片和测量数据,制作带尺寸标注的平面图、家具布局方案,并对重新设计的浴室进行超写实渲染。」
为什么这很重要 - AI可能会对就业产生重大影响,而这些测试将向我们展示:当这一比例达到80%时,网络就业会发生什么?当然,一些新任务将被创造出来 - 人们会创新并找到AI系统无法完成的任务。但这些新任务的数量会足够多,以取代AI系统目前所做的劳动吗?对我来说,越来越难以将AI系统的持续进步与经济保持不变的情况调和 - 更可能的是,我们将看到极度依赖AI而几乎不需要人力的组织迅速扩张,接管经济中的大片领域,超越未增强的人类。你可能会反驳,许多人类将通过AI系统增强自己。人类会创新。创造性破坏会发生。新发明会被创造出来。所有这些都是真的。但人类创新和相对于AI系统重新获得竞争力的速度,会比a) AI系统原始能力的扩展,以及b) 它们使用与人类竞争对手相同工具(例如软件)的熟练度提高得更快吗?我倾向于另一方:AI系统的经济相关能力扩展速度,比人类相对于AI系统的比较优势扩展速度更快。跟踪RLI等测试中的能力改进速度将帮助我们所有人自行判断这一点。阅读更多:数字劳动力自动化显著增加(AI安全中心)。
*** OSWORLD 2.0表明我们已进入多小时使用计算机的机器人时代:……一个具有挑战性的基准突显了AI系统在使用计算机方面日益增强的能力……由香港大学、加州大学圣地亚哥分校、哥伦比亚大学、加州大学圣芭芭拉分校、Mila、Snorkel AI、威斯康星大学、阿里巴巴通义、俄亥俄州立大学、Simular和NeoCognition的研究人员发布了OSWORLD 2.0,这是一个评估AI系统在计算机上执行多步骤多程序任务能力的基准。OSWORLD 2.0中的任务比其1.0版本复杂得多,中位数任务需要一个人大约1.6小时,比OSWORLD 1.0中2分钟的中位数长48倍。其组成:OSWorld 2.0包含108个长期任务,包括31个自托管网站。“OSWORLD 2.0中的每个任务都被定义为一个自包含的端到端工作流程,代理必须在给定高级用户目标、现实的工件、有状态的计算机环境和可评分的最终状态的情况下完成该任务。保留的任务必须满足两个设计标准,”他们写道。“估计有69.6%的任务需要熟练的人类用户超过一小时。”更广泛的软件:OSWORLD 1.0附带了一些内置软件来支持其部分任务,包括LibreOffice、GIMP、VLC、Thunderbird、VS Code和Chrome。OSWORLD 2.0附带了大量扩展的软件集,包括:Slack、LinkedIn、Shortcut、REAPER、MuseScore、WPS、GitLab、Overleaf、LabPlot、Zotero、AWS,以及旨在模仿专业服务(如保险索赔、签证申请和会议管理门户)的网站。人们需要完成的任务类别包括:文件准备、软件和数据库工作、财务/运营分析、行政支持、销售和客户服务、图形演示等。目前表现不佳:“我们的实验表明,当前代理在使用计算机方面仍远未可靠:最强的设置,Claude Opus 4.8在最大思考和批量工具调用下,仅达到20.6%的二进制准确率和54.8%的部分得分准确率,”他们写道。“随着任务变长,性能急剧下降,当代理必须恢复隐藏状态、跟踪多项物品、解决冲突信息或适应变化要求时,代理表现最差。”我们应预期这里的表现会提高,就像OSWORLD 1.0那样;2025年7月最高评分模型达到约30%,而近期模型得分更接近约75%(MiniMax M3;2026年6月)。我们应预期OSWORLD 2.0会出现同样的增长曲线。为什么这很重要 - 这就是AI如何进入更广泛的经济领域:计算机使用是AI能够执行各种经济价值任务的基本技能,也是其能够进行更多类型科学研究的基本技能。在现实世界中完成任务通常不仅仅是编写一些文本或计算机代码;通常你需要通过不同类型的软件将多个文本和代码块串联起来,有时你还需要将你的文本和代码通过互联网传输,以便它们被其他软件接收。OSWORLD 2.0等基准应被视为AI系统在计算机上执行非常复杂和多样化任务能力的代理指标。正如这些结果所示,计算机已经能够胜任使用一组有限软件工具且需要人类几分钟完成的任务;现在我们需要看到它们多快能熟练使用更广泛的软件集并完成需要人类数小时完成的任务。阅读更多:OSWorld 2.0:在长期现实任务上对计算机使用代理进行基准测试(官方论文网站)。在这里查看研究论文:OSWorld 2.0:在长期现实任务上对计算机使用代理进行基准测试(xlang-ai,OSWorld-V2,GitHub,pdf)。
*** 现实世界中的AI是什么样子:深度学习与结构化系统在中国亚马逊的库存管理中融合:……Oxygen AI商品中心让我们看到了国家规模电子商务的复杂性……中国的亚马逊JD发布了其构建的用于管理庞大库存系统的软件细节。JD拥有7亿用户和数百万商家,其目录包含数十亿SKU。该软件 - Oxygen AI商品中心(Oxygen AIIC) - 是这家电商巨头跟踪库存的关键。JD在其关于该软件的研究论文中写道:“Oxygen AIIC现在涵盖了数万个JD类别,每天在华为昇腾NPUs上处理数亿个商品更新。”Oxygen AIIC的四个关键要素。对Oxygen独特之处的描述从技术角度来看是有帮助的,同时也以一种新博尔吉亚式的写作风格令人愉悦,描述了先进技术所要求的奇怪、缥缈的结构(例如,“统一商品隧道”)。
- 由高效人机协作驱动的本体工程。“专家专注于提炼行业知识,而算法则从中学习,以实现本体构建的规模化并推动持续演进”。
- “语义搜索后继判别”:“在语义搜索阶段,动态演进的本体被外部化为独立的本体知识库,使本体持续更新无需重新训练模型”,他们写道。“在判别阶段,模型仅需判断目标是否匹配检索到的本体条目。这种设计显著降低了任务复杂度,缓解了模型幻觉问题,并增强了对本体演进的泛化能力”。
- 自我演进的商品理解大语言模型/视觉语言模型:“通过增量学习和模型自我演进,系统填补了针对性的知识空白并缓解了灾难性遗忘”,他们写道。“核心方法是在稳健的多任务基础之上,开发轻量级‘专家模块’以满足增量需求,并将其动态集成到专家池中,实现敏捷的能力扩展”。
- “统一商品通道”:Oxygen AIIC与其他业务应用之间的主要接口。“它支持日级、分钟级和秒级的生产和分发流水线,同时保持数据一致性”。
引发思考的细节——作为中国推动技术主权战略的一部分,Oxygen AIIC涉及中国算力。“在Oxygen AIIC的大规模部署过程中,底层计算平台面临两大主要技术挑战:在华为昇腾NPUs上进行模型训练和推理,以及高效利用计算资源。”其重要性体现在自更新业务:像Oxygen AIIC这样的技术是现代AI工具如何让我们创建将智能融入后台功能(如库存管理)的业务的典范,这些业务能够在远超以往规模的水平上运行,同时具备自我更新和学习的能力,通常无需大量人工监督。了解更多:JD Oxygen AI Item Center (Oxygen AIIC) V1: An Industrial-Scale LLM/VLM-Centric Solution for Item Understanding, Management, and Applications (arXiv) 。*** 技术故事:文明的黄铜齿轮 [2050,衰落后] 当你被纳入行会时,他们会问你想解决哪类问题。这些问题数量有限,但对文明至关重要:
- 天气预测
- 海洋分析
- 洪水准备
- 地震模拟
- 电网模型
- 水资源与海水淡化
为了解决这些问题,你需要研究解决它们所需的特定类型模拟计算。天气预报需要一台庞大的计算机,其地理特征如山脉以固定阻抗结构的形式嵌入硬件中;洪水模拟需要精确的物理模型来重现平原和河流的特性,电子元件被编织进地形中,通过物理规律与计算结合得出更优解;电网则是电力系统的玩具模型,每当新增发电站或调整输电线路时,都需要耗费大量精力重新构建和平衡系统。每个问题都有对应的计算方案,而每个具有足够文明重要性的难题,最终都会催生出专用计算机。过去我们曾拥有通用计算机,但最终被认为过于危险——不可预测性使其难以控制。随着算力不断增强、相关知识逐渐扩散,它们开始触及各种潜在危机的边缘:可能撕裂世界的合成思维、释放针对特定个体或种族的致命毒药、通过低语操控人类心智并诱导其走向疯狂或恶意行为。因此大规模重构发生了。通用计算被全面禁止——被视作禁忌技术加以封锁。我们为此付出了惨痛代价:数十亿人丧生、数万亿美元经济损失,才将世界转向模拟计算。如今,行会监督着地球“世界计算机”的建造,学术界也找到了新的使命:将特定学科的专业知识与定制化工程学院结合,协助构建让各领域专业工作得以开展的模拟计算机。令人不安的传闻正在传播:投入一万亿资金,或许就能用模拟方式实现通用思维。启发这个故事的元素包括:思考模拟计算的潜力,若预算达到100亿至200亿美元能推进到何种程度;将人工智能存在性威胁的隐喻推至逻辑终点;差分机;蒸汽朋克;以及神经网络可通过容器、管道和液体实现权重的特性。感谢阅读!