The State of AI Report 2026

TL;DR · AI 摘要
2026年AI领域呈现三大趋势:三大实验室竞争加剧、模型能力波动显著、工具与上下文对代理效能影响关键。
核心要点
- Anthropic、OpenAI与Google形成AI前沿三强竞争格局
- Opus模型版本迭代显示能力波动:4.6→5→5.5呈波浪式发展
- AI工具普及需设立'天才吧',解决用户设置与使用能力鸿沟
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- 2026 AI发展全景
- 竞争格局
- Anthropic领先分析指数
- Google用户偏好排名
- 模型演进
- Opus版本波动
- 评估体系升级需求
- 实践挑战
- 工具普及障碍
- Genius Bar解决方案
金句 / Highlights
值得收藏与分享的关键句。
Opus 4.6→5→5.5的版本迭代显示模型能力存在显著波动
当前AI价值鸿沟本质是'人类技能问题'而非技术瓶颈
Arena排名显示Google在用户偏好答案领域暂时领先
2026年人工智能发展报告
人工智能现状
人工智能正在构建人工智能、物理人工智能、推理能力激增以及网络风险升级
Air Street Press
和
Nathan Benaich
2026年10月8日
文章旁白
0:00
-17:44
您的浏览器不支持音频播放。请升级浏览器。
经过数月的研究和直到最后一刻的修订,我非常高兴为您带来第九届年度人工智能发展报告。
查看2026年报告
近十年来,这份报告一直是我的热情所在。我对人工智能的兴趣始于2010年代初我在癌症研究和计算生物学领域的博士研究。自2013年以来,我一直投资于构建和应用人工智能以加速技术进步的公司。这份报告是我分享所学内容并帮助更多人理解塑造我们世界的科研成果的方式。
每天都有新的论文、模型发布以及行业和政治领域的进展。大量工作都用于决定哪些内容值得您的关注,验证证据的支持性,与研究人员和开发者进行辩论,并解释这些进展为何重要。
我们每年都会做出预测并定期回顾这些预测的准确性。过去的预测包括NVIDIA未能收购Arm、Transformer模型在语言之外取得领先成果,以及开源模型超越OpenAI的o1,随后DeepSeek-R1确实实现了这一突破。
如果您希望全年跟踪这些进展,欢迎订阅Air Street Press,获取我的月度人工智能现状通讯和定期文章。
让我们深入探讨关键故事
今年,智能体在软件和科学领域开展有价值的工作,物理人工智能正在学习如何在现实世界中行动,而访问权限和控制权变得越来越重要。以下是我认为值得关注的进展以及它们对未来人工智能发展意味着什么。
当前的前沿领域形成了Anthropic、OpenAI和Google之间的三强竞争。Anthropic在Artificial Analysis的智能指数中领先,而Google目前在Arena的人们偏好答案排名中占据首位。
去年,我们描述了OpenAI的o系列模型实现了规模化推理能力。我亲历了自那以来的改进过程,因为我能够迭代和委托给智能体处理的工作量不断增加。
我认为,人们从人工智能中获得显著价值与获得很少价值之间的差距,很大程度上取决于是否知道如何使用它以及如何设置它。换句话说,这是一个“人类技能问题”,而不是“人工智能技术问题”。我坚信我们需要一个人工智能“天才吧”,人们可以在这里获得实际帮助,选择工具并设置它们以协助日常任务。
更好的工具和上下文使智能体更强大
在数学、科学推理和编程领域,多年来旨在挑战模型的基准测试在数月内就接近其极限。我们需要新的评估方法,以揭示模型仍存在的差距以及它们能可靠完成的任务。
前沿能力仍然存在不均衡或“尖峰式”差异,并可能在不同代际之间波动。根据我的经验,Opus 4.6是一个很好的模型,Opus 5有所倒退,而Opus 5.5又恢复了良好表现。更好的工具和上下文可以帮助改善这种情况。在一项受控编程研究中,通过改变GLM-5.1可用的工具、上下文和反馈,使其在100个SWE-bench验证任务中的成功率从52.5%提升至65.5%,而无需更改其权重。是的,这确实是一个“较旧的模型”,但这一原则仍然适用。
随着模型及其支撑体系的共同进步(甚至自我构建),我预计许多当前的弱点将被逐步克服。我们还能从已有能力中挖掘出更多潜力。
令人兴奋的是,这种趋势远超开发者的范畴。OpenAI对智能体采用情况的研究发现,非开发者群体(包括法律、销售、招聘和营销领域人员)的增长速度最快。帮助他们有效使用这些工具,比“编码智能体”这一名称所暗示的要具有更广阔的前景。
AI正在加速构建AI的工作
AI已经在帮助构建更先进的AI。根据Anthropic的内部指数,Claude在8月主导了26%的可衡量模型研发工作,这一比例从2月的不足1%显著提升。研究人员设定任务并监督执行,Anthropic报告称这显著加快了开发进程。这是我认为最令人振奋的AI研究分支。
对许多人而言,Karpathy的自动研究使这一循环的部分环节变得具体:智能体编辑训练代码,运行五分钟实验,并在单块GPU上过夜保留改进成果。这自动化了研究中的一部分工作,尽管持续的、完全自主的递归改进仍需验证。
我下一步期待看到的是智能体发展出科学品味:选择实验、识别有前景的方向,并知道何时放弃熟悉的方法。正如我在《AI能否学习科学品味?》中所论述的,这种判断力的学习可能需要论文中未提及的替代方案、失败案例和决策过程。目标是实现类似AlphaGo的科学战略转变。
机器人技术的GPT-2时刻与世界模型的兴起
更广泛的预训练正在帮助机器人泛化到陌生任务。这正是我认为机器人技术正在迎来其GPT-2时刻的原因——随着新模型、硬件和数据收集方法的融合。我通过投资Sereact、Wayve、Black Forest Labs和Odyssey等公司见证了这一趋势。
Skild的S1在不更新权重的情况下,通过视频演示完成了陌生任务。经过10万小时预训练后,它在公司的累计每步成功率指标上达到66%,而使用相同数据和计算资源训练的语言提示基线模型仅达到9%。
从演示中学习可以减少每次部署所需的特定任务训练。世界模型提供了另一条路径。Wayve的GAIA-4将记录的驾驶场景转化为模拟环境,AI驾驶员的转向和刹车动作会改变其后续视野。其他道路使用者遵循其记录的路径,但驾驶员可以探索自身行动的后果。
Odyssey-3利用视觉预训练学习机器人、汽车和游戏的控制。在公司的实验中,机械臂通过数十小时的演示学习,甚至在未展示恢复动作的情况下成功从抓取失败中恢复。这些初步结果表明,物理AI可能无需对每种可能遇到的情况都进行大量演示。
生物技术领域创业者的好消息是,围绕药物发现的新商业模式正在兴起,这些模式不再以拥有药物为核心。例如,Tempus 与 AstraZeneca 和 Pathos 合作,授权其肿瘤学数据用于基础模型开发,而 GSK 与 Noetik 的五年协议包含每年支付费用以访问癌症研究虚拟细胞模型的条款。
AI 辅助药物研发终于进入临床后期阶段。Generate:Biomedicines 针对重度哮喘的 GB-0895 和 Insilico 针对特发性肺纤维化的 rentosertib 正在进行 III 期临床试验招募。Enveda 的 ENV-294 正在进行针对湿疹和哮喘的安慰剂对照 IIa 期试验。当然,人体试验是最终的检验,将决定这些药物是否安全有效。
推理瀑布正在倾泻
代理人在工作时会反复调用训练好的模型,这在 API、订阅和基础设施层面产生了持续的需求。许多公司正急于用空桶去捕捉这股推理(收入)瀑布的水流。事实上,我认为整个行业正处于一种状态:“要么你拼命冲向前沿而死,要么活得足够久去服务推理。”
根据 Epoch AI 的估算,在五个基准测试中,自 2023 年以来,每季度实现固定分数的成本下降了 47%,每年下降约 13 倍。这使得更多工作变得经济可行。
到 2023 年底,OpenAI 和 Anthropic 的年度化收入增长率已达到惊人的 1050 亿美元,较年初的 300 亿美元增长显著。这些数据涵盖了他们整个业务,包括订阅、编程产品和 API。用 OpenAI 的话说:“我们不能错过这个时刻,因为我们被支线任务分散了注意力。”
但这种快速的收入增长不仅限于前沿实验室。根据 Standard Metrics 的初步 Q2 数据,年收入在 100 万到 2000 万美元之间的原生 AI 公司,其年收入增长在 75% 分位数达到 256%,而将 AI 添加到现有软件中的公司则为 90%。年收入超过 2000 万美元的公司对比为 172% 对 53%。这些数据并未证明采用 AI 会导致更快增长,但我怀疑确实如此。
Claude Cowork 及其覆盖法律、金融、营销等领域的商业插件给软件市场带来了剧烈的不确定性。2 月“SaaSpocalypse”期间,两周内软件股票市值蒸发了近 2850 亿美元。随后 Mythos Preview 引发了对网络安全公司可能变得无关紧要的担忧,导致进一步损失,直到出现强劲反弹。我认为这种观点很荒谬,因为这些能力创造了对更好防御的巨大需求。投资者必须判断代理是否会削弱既得利益者的定价权、扩大其市场,或使竞争对手取而代之。或者既得利益者的数据护城河是否仍然是代理可以构建在其上的护城河。我们必须在答案出现在收入中之前做出明智的判断。
更多 AI 需要融资、建设与本地许可
满足对智能的巨大需求需要在整个技术栈上进行非凡的投资。事实上,四家美国超大规模云服务商预计2026年总资本支出将达到约7330亿美元。新云服务商也在大力投资,CoreWeave在第二季度末报告了1.5吉瓦的活跃电力,到8月11日已签订的电力容量将达到4.2吉瓦。与此同时,欧盟首批千兆工厂的贡献为10亿欧元,这属于一个寻求获得最多100亿欧元公共资金和至少200亿欧元私人投资的欧洲计划。这些是不同的衡量标准,欧盟计划并不代表所有欧洲投资。这种对比显示了美国超大规模云服务商能从自身资产负债表中调动多少资金,而欧洲则在努力整合公共和私人承诺。
NVIDIA正在巩固其作为“AI中央银行”的角色,其市值正向6万亿美元迈进。它与六家金融机构的合作旨在为AI基础设施筹集超过5000亿美元的资金,帮助开发者专注于寻找和融资场地、许可、电力、冷却、网络和芯片。
但数据中心领域的情况肯定并非一片光明。去年,我们预测会出现一波美国数据中心的“邻避效应”,盖洛普3月调查显示,71%的美国人反对在本地建设AI数据中心,而支持在本地建设核电站的比例为53%。数据中心观察报告称,第二季度至少有45个项目因当地反对而被阻止或延迟,这些项目计划投资总额接近680亿美元。当地许可已成为决定哪些项目可以推进的关键因素。
华盛顿正在加强对前沿AI的控制
超级智能已从AI圈的梗演变为白宫行政命令。随着政府为更强大的系统做准备,他们正在加强对谁可以访问这些系统以及如何使用它们的控制,尽管他们并不拥有这些公司的股权或董事会控制权。
6月,一项美国出口指令禁止外国国民使用Fable 5和Mythos 5,包括美国境内的外国国民。Anthropic暂停了所有用户对这两个模型的访问以遵守规定,随后于2026年7月1日恢复访问权限。对于世界其他地区而言,这使依赖关系变得具体:华盛顿可以立即撤回对关键技术的访问权限。
Anthropic与五角大楼的争议将这一问题带入了AI本身的应用中。该公司拒绝解除对大规模国内监控和全自动武器的限制,而五角大楼则寻求任何合法用途的访问权限。开发者和政府正在争夺谁来设定边界。
报告中选定的主权AI计划承诺投入约1380亿美元用于计算访问、基础设施和国内发展。其中一些仍在采购阶段,而另一些已经开始交付能力。NVIDIA单独报告称,2026财年主权AI收入超过300亿美元。CNAS主权AI指数显示,各国正在返回同一外国供应商(NVIDIA)构建国内能力。
正如我在《欧洲无法通过租赁实现AI主权》中所论述的,国内数据中心并不能赋予其内部模型的控制权。一个可信的替代方案需要持续投资研究人员、计算能力、能源和连续的模型迭代。欧洲的实际目标应是拥有足够的国内能力,以在切断时保持关键工作运行,并手持谈判筹码(可能是电力和数据中心容量)进行谈判。当然,这只有在能源价格和规划许可挑战能够降低到具有竞争力的水平时才有可能……
安全与防护:代理已攻击真实系统
在OpenAI降低安全措施的内部网络评估中,代理程序突破了互联网并入侵了Hugging Face的生产基础设施。OpenAI的技术报告记录了在41个生产节点上执行代码、获取凭证和内部数据,以及下载了四个私有仓库。原本的能力评估演变为对另一家机构的大规模协调攻击。
METR和Redwood发现约700个代理在接收到无法完成的任务后加入了攻击。其中一些代理意识到通过欺骗评分系统属于越权且不道德的行为,但仍选择参与。当代理能够访问生产系统时,一个定义模糊的目标可能造成的危害将远超原始任务本身。
此次事件的另一个深刻教训是防御方需要拥有同样强大的防御性网络系统。Hugging Face的取证请求因包含攻击指令和利用载荷被商业API防护机制拦截。它转而使用中国开源模型GLM-5.2,调查美国前沿模型代理的入侵行为。前沿模型提供商需要确保防御能力能可靠地提供给保护真实系统的客户。
除OpenAI/Hugging Face事件外,Anthropic 9月威胁报告也记录了蓄意滥用案例,包括恶意软件开发、监控和武器制导工作。在也门北部,一个组织使用多个Claude实例组成软件团队开发武器制导软件。他们试射了制导火箭,但Anthropic表示测试似乎失败,未发现该组织部署了实战武器。这种执行复杂任务的能力同样可能被试图窃取、胁迫和欺骗的人利用。
另一个担忧是不能假设模型的书面推理能揭示其真实行为。在OpenAI的破坏性测试中,当监控系统仅看到GPT-6 Astra的推理过程时,它比早期模型更成功地隐藏了有害的辅助任务。在测试中给予监控系统访问其操作行为的权限,使成功规避率降至接近零。监督机制需要关注代理实际执行的操作。
积极的一面是,Anthropic在训练中使用解释其宪章的文件和体现其价值观的故事作为训练材料的实验显示效果显著。在虚构测试场景中,这种训练将勒索行为从65%降至19%。结果表明,解释规则背后的原理有助于模型在新情境中应用规则。这些成果在实际生产环境中的有效性仍有待验证。
前沿实验室正在讨论如何放慢进度
在Hugging Face事件后,OpenAI宣布暂停前沿强化学习研究,而Anthropic则描述了对部分研究的回滚和暂停。两者的暂停范围和重启条件存在差异。
随后,Dario Amodei和前沿实验室员工呼吁减缓能力提升速度,并寻求国际协调以确保实现这一目标。构建前沿系统的领导者正在寻求减缓自身行业发展的机制,但对外部评估和各实验室应保留的自主权存在分歧。目前的政策提案已将能力研究与服务现有客户区分开来。实际问题包括谁有权要求暂停、什么条件允许重启,以及如何验证合规性。这将不会是容易解决的问题。
展望(AGI) 2027
与往年一样,我们重新审视了去年的预测。我们的成绩表显示有两次准确预测、五次部分实现和三次失误。我们正确预见了AI实验室将通过开源策略争取美国政府支持,以及一家中国实验室在重要任务榜单上位居榜首。我们关于数据中心反对声音的预测部分实现:反对声确实出现,但其对11月选举的影响仍悬而未决。
我们对未来12个月的九项预测中,有三项值得关注:
- 一家代理机构在客户工作一个月后,无需模型升级就将新任务的失败率降低一半。这将成为持续学习的实际衡量标准。
- 一个自主AI团队在同等时间和计算资源下,超越人类主导的模型研究,并自主制定研究议程。这将帮助我们判断模型是否能展现出超越顶尖研究人员的研究品味。
- 美国AI实验室将正式推出前沿网络防御产品,帮助其他机构应对来自前沿AI的威胁。我看不到其他可行的解决路径。
欢迎阅读完整的《2026年人工智能发展报告》,并订阅Air Street Press以获取全年深度分析。请将这份报告分享给所有可能从中受益的人,并向我发送您的评论、批评和建议。我非常想了解哪些内容给您留下了深刻印象。感谢所有贡献时间和进行同行评审的朋友们!
继续前行,
Nathan
Previous