Gradient Flow

How AI Is Changing Mathematical Research

8.5内容质量
How AI Is Changing Mathematical Research

TL;DR · AI 摘要

AI正在改变数学研究,但其在解决复杂问题、验证结果和人类判断方面仍存在局限性,需谨慎看待其应用。

核心要点

  • AI擅长处理有多种解法的问题,但难以应对需要重新定义问题或发明新概念的挑战。
  • AI生成的证明可能看似正确,但存在定义偏移或重复已有成果的风险,验证成本高。
  • 人类判断在AI生成结果的验证、新颖性和实际应用中仍不可替代。

结构提纲

按章节快速跳转。

  1. AI数学研究中的快速进展及其对其他领域的影响。

  2. AI在处理多种解法和验证结果中的优势。

  3. 处理需要重新定义问题或发明新概念的挑战。

  4. 验证困难、定义偏移、重复已有成果。

  5. 验证、新颖性和实际应用中的必要性。

  6. 验证成本、工具发展、跨学科应用。

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • AI在数学研究中的影响
    • 当前优势
      • 覆盖范围广
    • 局限性
      • 定义偏移
      • 重复已有成果
    • 人类角色
      • 验证必要性
      • 新颖性判断

金句 / Highlights

值得收藏与分享的关键句。

#AI#数学研究#验证#机器学习
打开原文

AI如何改变数学研究 - Gradient Flow

AI如何改变数学研究

发布者

Ben Lorica

2026年8月17日

2026年8月14日

分类

未分类

.meta-info

.post-thumbnail

鉴于近期关于AI系统解决研究数学问题的大量报道,我决定更新之前写的一篇相关文章。除了编程之外,研究数学可能是AI工具和代理进展最快的领域。即使你对数学本身不感兴趣,这也值得关注。数学为我们提供了异常清晰的视角,可以观察这些系统的能力边界、失败模式以及随着工具改进专家角色的变化。我认为这些模式也能为AI如何重塑其他知识工作提供有价值的启示。

目录

  • 数学研究中AI的当前优势领域
  • AI的失败方式及为何难以察觉
  • 验证性发现的真实成本
  • AI研究的新瓶颈
  • 人类判断仍然重要的领域
  • 每个AI结果背后的四个问题
  • 生成成本降低的时刻

##### 数学研究中AI的当前优势领域

从近期数学研究结果中,我学到的最重要教训不是AI能解决难题,而是某些类型的问题与当前AI系统的工作方式高度契合。当存在大量可行的尝试路径、过程中能识别进展、且结果能低成本验证时,模型具有明显优势。在这样的环境中,巨大的信息召回能力加上低成本搜索,使AI能够探索人类研究者根本无暇顾及的领域。与其它学术领域一样,数学研究也高度专业化,研究者无法与AI跨数学领域阅读论文的能力相提并论。这种价值可能更多来自机器的覆盖范围而非机器的天才。

当进展依赖于重新定义问题、发明新概念或沿着一条困难思路持续探索直到出现意外想法时,当前AI系统的表现就显得不那么令人印象深刻。我也会对"模型解决了某个问题"这类标题保持谨慎。在文献中已有答案、以新方式结合两个已知想法、以及对开放性问题做出真正贡献,这三者是完全不同的能力。对我而言,这便是实际启示:不要问AI是否足够聪明来完成这项工作,而要问这是什么类型的工作。

返回目录

##### AI的失败方式及为何难以察觉

最重要的失败模式正在发生变化。由于AI输出不再显而易见地错误,因此越来越难以驳斥。多个模型运行可能收敛于相同的错误论证。一个证明可能看似严密,除了一个关键步骤之外。形式检查器可以确认数学正确性,而系统可能在不被察觉的情况下改变了被要求证明的定义。甚至一个正确的结果也可能早已在数十年前被发表。对我而言,这个教训是:合理性、共识、正确性和新颖性是四个独立的问题。

这意味着验证需要成为工作流程中的分层组成部分,而非最终检查。团队需要验证规范、推理过程、现有技术,以及日益重要的评估本身。形式化方法仍然极其有用,将问题形式化的过程甚至可能产生新的洞见。但没有任何单一的信任信号能够解决所有问题。随着模型在生成令人信服成果方面的能力提升,我预计AI辅助研究中昂贵的部分将从生成答案转向确定哪些内容值得被相信。

##### 验证发现的真实成本

我将不再关注的指标是每个成功AI生成结果的成本。它忽略了最关键的因素:失败案例。在一项有记录的实验中,约85个代理程序挖掘了62个开放性问题,攻击了其中8个,解决了5个,并在不到1000美元的标价下,约14小时内生成了一个存活候选方案。超过一半的计算资源被用于代理程序试图破解其他代理程序的工作。这颠覆了传统的成本模型。生成正在变得廉价,而确定某事物值得留存才是消耗大量资源的环节。

这还改变了AI研究系统的形态。这不是一个极其聪明的助手回答难题,而是更接近于一条专门代理程序的生产线,这些代理程序负责挖掘、生成、攻击、形式化并传递结果。更高的可靠性突然使这条流水线变得经济,因为验证和修复的难度大幅降低。可重复使用的库、评估器、模式和验证过的领域知识能让每次新运行都从更靠前的起点开始。这就是为什么我会优先优化可信的吞吐量,而非单字价格,并衡量从大量候选方案到领域专家真正愿意背书的成果的完整成本。

##### AI研究中的新瓶颈

我发现有用的一个框架是:研究不是一项任务,而是一个流程。你生成结果、验证它、解释它、发表它、让其他人吸收它,最终将其转化为标准知识。AI对这个流程前端的加速效果远大于对后端的加速。因此,如果生成速度提升十倍,而审查和吸收几乎没有任何进展,你并未实现吞吐量十倍的提升,而是创造了队列。这个队列已经开始显现,机器生成甚至机器验证的证明正在等待人类去阅读和理解。

这改变了稀缺资源的定义。审查能力的增长速度远不及计算能力,廉价的生成会制造大量需要过滤的材料,直到人们知道什么值得关注。我也认为“完成工作”的定义将变得更加严格。一个被生成和验证但无人能解释或进一步构建的结果其实并不实用。对于任何以AI为主的流程,实际教训是显而易见的:一旦生产变得廉价,注意力、解释和吸收将成为真正的制约因素。

##### 人类判断依然重要的领域

许多最强大的AI辅助数学成果背后隐藏的模式并非“模型解决问题,人类检查答案”。其过程比这更有趣。模型提出一个方向,通常执行得并不理想,而专家则能从失败中识别出潜在的优秀思路。同样的人类判断力也体现在决定放弃哪些分支、将模糊问题拆解为可处理的模块,以及判断任务是需要广泛搜索还是少数深度概念性押注。这种专业知识存在于工作流程中,而非仅仅停留在审批环节。

有一个重要的前提条件。在问题表述清晰、定义明确的情况下,拥有较少正式专业知识的人已能利用公开模型产出有意义的结果。因此我不会将专业知识视为固定成本。它随着模糊性的增加而上升。对组织而言,实际教训是将机械化重复工作与需要判断力的复杂工作区分开来。重复性工作显然是自动化目标。但如果你消除了所有困难的概念性步骤,也可能同时抹杀了培养能识别AI生成答案微妙错误的人才的训练过程。

##### 每个AI结果背后的四个问题

解读近期AI数学成果的难点在于,“解决”可能描述着几种截然不同的情况。模型可能从文献中检索出已有答案,以新颖方式整合已知概念,或真正为开放性研究问题做出贡献。这些成果往往被压缩成相同的统计数据。即使数学本身正确,创新性也难以确认,因为我们无法可靠地区分真正的新见解与成功检索出的冷门知识。这使得能力声明的解读难度远超单纯的“解决”数量所暗示的。

分母同样重要。如果10次成功来自10次尝试与10000次尝试,其意义截然不同。而大多数公告都会忽略重试次数、人力投入和总计算量。好的测试应使用模型未接触过的问题,并验证完整解决方案,而不仅仅是答案是否正确。还有一个陷阱:一旦基准变得容易且有价值可优化,它就会开始改变自身周围的行为。此时,仪表盘可能仍在上升,但指标本身可能已变得不再具有信息量。

##### 当生成变得廉价

当生成成果的成本降低后,价值开始转向其他方向。率先完成的重要性不如让工作变得易于理解。更强的评审标准是:负责人是否能在不调用AI的情况下解释并捍卫结果。职业决策也变得具有信号价值。当资深研究者改变研究方向或工作机构时,实际上是在押注哪些技能和制度将在未来变得重要。

这种再校准也体现在训练和治理中。我会用AI节省重复性任务的时间,但保留足够复杂的思考环节以培养真正的判断力。团队也需要在所有人都陷入最容易的流程之前,明确什么是良好的评审和披露标准。我发现有趣的是,人们经常一边声称AI将改变一切,一边继续以几乎相同的方式工作。人们可以相信技术会重塑领域,却仍以一贯的方式工作。这很可能是转型期的特征,而非矛盾。

##### 相关内容

  • 数学家关于 AI 的发现,大多数企业尚未意识到
  • [与 Tudor Achim 的对话] 构建数学超级智能

/think