Air Street Press

Can AI learn scientific taste?

8.5内容质量
Can AI learn scientific taste?

TL;DR · AI 摘要

AI可通过学习科学探索中被忽视的失败数据培养科学直觉,但传统论文记录不足构成瓶颈。

核心要点

  • RAAIS 2026会议通过记录科学探索过程中的分歧与失败,构建动态知识图谱
  • Journal of Negative Results在2017年关闭,显示科学界对负面数据记录的持续需求
  • AI需要非传统数据源(如被弃用的实验方案)来训练科学判断力

结构提纲

按章节快速跳转。

  1. 科学探索的非线性过程被传统论文严重简化,导致AI训练数据缺失关键信息。

  2. 论文仅展示成功路径,抹去了实验失败、方法弃用等关键探索过程。

  3. 通过实时记录科学讨论,构建包含分歧与失败的动态知识图谱。

  4. Journal of Negative Results的兴衰揭示科学界对负面数据的矛盾态度。

  5. 现有科学记录无法提供AI培养科学直觉所需的非传统数据。

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • AI学习科学直觉
    • 数据来源
      • 传统论文(局限性)
      • 非传统记录(RAAIS方法)
    • 关键挑战
      • 数据缺失
      • 科学界态度矛盾
    • 实践案例
      • Journal of Negative Results
      • Black Forest Labs FLUX 3

金句 / Highlights

值得收藏与分享的关键句。

  • 论文呈现的是从假设到结论的‘清洁路径’,抹去了探索过程中90%的试错数据。

    — 第3段

    ⬇︎ 下载 PNG𝕏 分享到 X
  • RAAIS 2026通过记录会议中的分歧,使AI能学习科学家如何在数据迷雾中导航。

    — 第4段

    ⬇︎ 下载 PNG𝕏 分享到 X
  • Journal of Negative Results在2017年关闭时,已有2000多篇负面研究被其他期刊收录。

    — 第6段

    ⬇︎ 下载 PNG𝕏 分享到 X
#AI#科学#数据记录#研究方法
打开原文

AI 能否学会科学品味?

分析

科研论文是理想路径。如果我们希望 AI 具备科研品味,就必须从那些曾被考虑、被拒绝、从未写下的分支中学习。

Air Street Press

和

Nathan Benaich

2026年8月13日

文章配音

0:00

-9:50

您的浏览器不支持音频播放。请升级浏览器。

“实际上,这才是黄金所在,”我的研究生同学 Alasdair Russell 说道,他目前在剑桥大学领导一个临床前基因编辑小组。

他谈论的是被发表论文所忽略的科研曲折之路。“当你讨论如何进行实验,为什么这种方法优于另一种方法,以及数据究竟意味着什么时?我知道它显示了什么,但它意味着什么?”

在 RAAIS 2026 上,他描述了他团队如何开始记录发现过程中的曲折路径,记录那些通常会消失的口头和书面交流。想法成为活体图谱中的节点:当一次会议产生两个可行的实验时,节点会分叉;当不同证据线汇聚时,节点会合并;当有人悄悄停止探索时,节点会消失。在他的实现中,一个代理负责评估新颖性,另一个则试图学习“科学家如何思考以及如何在复杂的数据世界中导航”,从而让高潜力节点触发更深入的调查。

随着前沿 AI 实验室将代理部署到科学发现中,赋予 AI 真正的科学品味仍然是一个价值千亿美元的难题。瓶颈在于,我们数百年来记录的科学成果可能不足以实现这一目标。

由 Black Forest Labs FLUX 3 构想的科学曲折之路

永远无法发表的实验

1960年诺贝尔奖得主、移植医学“之父”Peter Medawar 在1963年曾质疑科学论文是否是一种欺诈,并给出了肯定回答:论文的形式扭曲了产生它的思维过程。六十年后,这一诊断依然成立。论文呈现的是从假设到结果再到结论的清晰进展。在这个过程中丢失的,是那些非常规理论、被放弃或无法负担的方法,以及平淡无奇且结论不明的数据。

这读起来就像删除了所有死胡同的浏览器历史记录:十个打开的标签页、四次重新表述的查询、误入的子论坛。所有内容都被清除,只留下从问题到答案的一条干净路径作为标准路径。

自那以后变化的是,被丢弃的材料现在变得有价值了。没有哪家高影响力期刊愿意收录这些“废料”,但原始的试错过程最有可能成为培养科学直觉所需训练数据的来源,或者说研究人员所说的“品味”。

早期试图捕捉这些被丢弃材料的尝试源于对科学诚信的追求。2002年《生物医学负面结果杂志》创立,旨在发表挑战既定模型或揭示无效治疗的严谨研究。其档案保存了这些论文得出的负面结论,而非产生这些结论的实时替代方案和论点。BioMed Central 于2017年关闭该杂志,称其他期刊现在已开始发表零结果,使命已完成。另一种更苛刻的解读是,十五年来该杂志只发表了约200篇论文,因为几乎没人愿意阅读负面结果,更不用说在这些结果无法计入学术职称的情况下撰写它们了。

AI模型各不相同。即使是一个无趣的负面结果,只要被正确标记,也可能具有价值。

今年早些时候,Anthropic对这一点进行了验证。该公司从2026年1月至3月期间的真实Claude Code会话中提取了129个决策点,向模型展示了人类绕开路径前的工作内容,并询问接下来应该采取什么行动。Claude Mythos Preview在64%的情况下优于人类选择,而Opus 4.5则在51%的情况下表现更优。此次比较对模型有利,因为Anthropic刻意选择了人类决策仍有改进空间的时刻。在另外127个场景中,当人类行动已经足够强时,模型仅在约20%的情况下进行了改进。

这项研究之所以可行,是因为Anthropic的研究人员使用的是默认会记录数据的工具。推理过程、绕开路径和结果都产生于相同的协作环境。生物学领域没有等价物。其推理过程发生在走廊、实验台、Slack线程和白板上,而结果则在数周后出现在其他地方。记录必须从工作本身中产生。如果让科学家事后重建,我们只会得到另一个经过修饰的版本。

日志不等于标签

在这些内容成为训练数据之前,负面结果必须说明失败的原因。发表在《生物医学负面结果期刊》上的第一篇论文分析了五家领先医学期刊上的234项负面研究。只有30%的研究讨论了统计功效,一半的研究明确界定了主要结果。如果告诉模型实验失败了,却不说明实验是否因统计效力不足、试剂降解或假设本身错误,模型会带着确定性学习噪声。

决策历史还缺少第二个标签。当实验室考虑了五个实验并只执行其中一个时,只有被选中的分支会返回结果。另外四个实验则是反事实的实验。研究人员将这种现象称为“选择性标签问题”:数据只揭示了某人选择采取行动的结果。这样的记录可以让模型模仿实验室的偏好,但无法证明这种偏好本身是合理的。它还会将局部约束带入普遍性结论中。一个从未运行冷冻电镜实验(因为没有显微镜)的实验室,会教会模型冷冻电镜实验很少是正确选择。

Alasdair的节点保留了候选集,这是必要的第一步。要让每个决策记录具有价值,需要包含以下六个字段:

  • 该时刻可用的证据,以及后续到达的任何信息都不包含在内。
  • 考虑过的候选方案,包括那些被一句话驳回的选项。
  • 对于每个候选方案:预期结果、附带的信心值,以及时间和金钱成本。
  • 选择的路径及其原因。
  • 接下来发生的事情。
  • 证据如何改变了科学家的观点。

这些字段必须在结果发生前进行时间戳标记,因为事后回顾会将不确定性转化为必然性。分歧也必须保留。将三位科学家的意见平均成一个整洁的解释,会精确地重现我们试图修复的信息丢失问题。

但这里显然存在一种失败模式。一旦决策被记录并评分,人们就会出于记录目的在事后进行补充。任何见过电子实验记录本被回顾性整理填满的人都知道,研究工具会多么迅速地变成合规性练习。一份让科学家每项决策花费10分钟诚实反思的记录,其价值远高于一份需要花费一小时绩效时间的记录。

让备选方案参与竞争

自主实验室展示了当决策和结果形成闭环时会发生什么。利物浦的移动机器人化学家在八天内于十变量配方空间中完成了688次实验。批量贝叶斯搜索利用每个结果选择下一个实验,发现了活性是初始配方六倍的光催化剂混合物。每次完成的实验都会改变系统接下来的行动。

机器人在人类预先设定的目标和搜索空间内进行优化,它并未决定哪些科学问题具有优先级。因此这项工作展示的范围较为有限,但仍具价值:当选项能快速返回标准化结果时,搜索历史会产生显著价值。开放式的生物学研究更具挑战性,因为分支探索可能需要数周时间,被舍弃的备选方案可能永远无法再被验证。

因此部分探索需要投入资源。当两个分支都具有合理性且投入成本值得时,实验室有时应选择运行备选方案。否则记录只会反映科学家通常的选择,而对系统性忽视的选项保持沉默。资助方可以将资助金额的一小部分专门用于未被采纳的分支,前提是决策记录和结果都已存档。这需要花费资金,但让每个实验室重新发现已被放弃的路径同样需要成本。

测试品味是否可迁移

当我们评估新AI系统是否具备科学品味时,比较应跨实验室和领域进行。在实时研究活动中的关键决策点,我们应冻结六个要素:证据、候选方案、预期结果、置信度、成本和最终选择。专家在结果揭晓前对选项进行排序,随后由独立团队验证这些结果。

我们可以为模型提供两种"饮食":仅提供论文,或同时提供论文和决策历史,然后要求它们对陌生项目中的下一个实验进行排序。接着我们评估每美元和每周获得的信息量、校准精度以及弱分支被放弃的速度。

如果历史记录仅在产生它们的实验室内部提升决策质量,它们就相当于有用的组织记忆。如果它们能提升其他领域陌生问题的决策质量,那么阿萨代尔团队就实现了科学界从未成功记录的突破:可迁移的品味记录。在实现这一目标之前,科学搜索历史仍是一种有前景的记录,尚未成为训练数据集。

Previous