Can AI learn scientific taste?

TL;DR · AI 摘要
AI可通过学习科学探索中被忽视的失败数据培养科学直觉,但传统论文记录不足构成瓶颈。
核心要点
- RAAIS 2026会议通过记录科学探索过程中的分歧与失败,构建动态知识图谱
- Journal of Negative Results在2017年关闭,显示科学界对负面数据记录的持续需求
- AI需要非传统数据源(如被弃用的实验方案)来训练科学判断力
结构提纲
按章节快速跳转。
- §引言
科学探索的非线性过程被传统论文严重简化,导致AI训练数据缺失关键信息。
论文仅展示成功路径,抹去了实验失败、方法弃用等关键探索过程。
通过实时记录科学讨论,构建包含分歧与失败的动态知识图谱。
Journal of Negative Results的兴衰揭示科学界对负面数据的矛盾态度。
现有科学记录无法提供AI培养科学直觉所需的非传统数据。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- AI学习科学直觉
- 数据来源
- 传统论文(局限性)
- 非传统记录(RAAIS方法)
- 关键挑战
- 数据缺失
- 科学界态度矛盾
- 实践案例
- Journal of Negative Results
- Black Forest Labs FLUX 3
金句 / Highlights
值得收藏与分享的关键句。
论文呈现的是从假设到结论的‘清洁路径’,抹去了探索过程中90%的试错数据。
RAAIS 2026通过记录会议中的分歧,使AI能学习科学家如何在数据迷雾中导航。
Journal of Negative Results在2017年关闭时,已有2000多篇负面研究被其他期刊收录。
AI 能否学会科学品味?
分析
科研论文是理想路径。如果我们希望 AI 具备科研品味,就必须从那些曾被考虑、被拒绝、从未写下的分支中学习。
和
Nathan Benaich
2026年8月13日
文章配音
0:00
-9:50
您的浏览器不支持音频播放。请升级浏览器。
“实际上,这才是黄金所在,”我的研究生同学 Alasdair Russell 说道,他目前在剑桥大学领导一个临床前基因编辑小组。
他谈论的是被发表论文所忽略的科研曲折之路。“当你讨论如何进行实验,为什么这种方法优于另一种方法,以及数据究竟意味着什么时?我知道它显示了什么,但它意味着什么?”
在 RAAIS 2026 上,他描述了他团队如何开始记录发现过程中的曲折路径,记录那些通常会消失的口头和书面交流。想法成为活体图谱中的节点:当一次会议产生两个可行的实验时,节点会分叉;当不同证据线汇聚时,节点会合并;当有人悄悄停止探索时,节点会消失。在他的实现中,一个代理负责评估新颖性,另一个则试图学习“科学家如何思考以及如何在复杂的数据世界中导航”,从而让高潜力节点触发更深入的调查。
随着前沿 AI 实验室将代理部署到科学发现中,赋予 AI 真正的科学品味仍然是一个价值千亿美元的难题。瓶颈在于,我们数百年来记录的科学成果可能不足以实现这一目标。
由 Black Forest Labs FLUX 3 构想的科学曲折之路
永远无法发表的实验
1960年诺贝尔奖得主、移植医学“之父”Peter Medawar 在1963年曾质疑科学论文是否是一种欺诈,并给出了肯定回答:论文的形式扭曲了产生它的思维过程。六十年后,这一诊断依然成立。论文呈现的是从假设到结果再到结论的清晰进展。在这个过程中丢失的,是那些非常规理论、被放弃或无法负担的方法,以及平淡无奇且结论不明的数据。
这读起来就像删除了所有死胡同的浏览器历史记录:十个打开的标签页、四次重新表述的查询、误入的子论坛。所有内容都被清除,只留下从问题到答案的一条干净路径作为标准路径。
自那以后变化的是,被丢弃的材料现在变得有价值了。没有哪家高影响力期刊愿意收录这些“废料”,但原始的试错过程最有可能成为培养科学直觉所需训练数据的来源,或者说研究人员所说的“品味”。
早期试图捕捉这些被丢弃材料的尝试源于对科学诚信的追求。2002年《生物医学负面结果杂志》创立,旨在发表挑战既定模型或揭示无效治疗的严谨研究。其档案保存了这些论文得出的负面结论,而非产生这些结论的实时替代方案和论点。BioMed Central 于2017年关闭该杂志,称其他期刊现在已开始发表零结果,使命已完成。另一种更苛刻的解读是,十五年来该杂志只发表了约200篇论文,因为几乎没人愿意阅读负面结果,更不用说在这些结果无法计入学术职称的情况下撰写它们了。
AI模型各不相同。即使是一个无趣的负面结果,只要被正确标记,也可能具有价值。
今年早些时候,Anthropic对这一点进行了验证。该公司从2026年1月至3月期间的真实Claude Code会话中提取了129个决策点,向模型展示了人类绕开路径前的工作内容,并询问接下来应该采取什么行动。Claude Mythos Preview在64%的情况下优于人类选择,而Opus 4.5则在51%的情况下表现更优。此次比较对模型有利,因为Anthropic刻意选择了人类决策仍有改进空间的时刻。在另外127个场景中,当人类行动已经足够强时,模型仅在约20%的情况下进行了改进。
这项研究之所以可行,是因为Anthropic的研究人员使用的是默认会记录数据的工具。推理过程、绕开路径和结果都产生于相同的协作环境。生物学领域没有等价物。其推理过程发生在走廊、实验台、Slack线程和白板上,而结果则在数周后出现在其他地方。记录必须从工作本身中产生。如果让科学家事后重建,我们只会得到另一个经过修饰的版本。
日志不等于标签
在这些内容成为训练数据之前,负面结果必须说明失败的原因。发表在《生物医学负面结果期刊》上的第一篇论文分析了五家领先医学期刊上的234项负面研究。只有30%的研究讨论了统计功效,一半的研究明确界定了主要结果。如果告诉模型实验失败了,却不说明实验是否因统计效力不足、试剂降解或假设本身错误,模型会带着确定性学习噪声。
决策历史还缺少第二个标签。当实验室考虑了五个实验并只执行其中一个时,只有被选中的分支会返回结果。另外四个实验则是反事实的实验。研究人员将这种现象称为“选择性标签问题”:数据只揭示了某人选择采取行动的结果。这样的记录可以让模型模仿实验室的偏好,但无法证明这种偏好本身是合理的。它还会将局部约束带入普遍性结论中。一个从未运行冷冻电镜实验(因为没有显微镜)的实验室,会教会模型冷冻电镜实验很少是正确选择。
Alasdair的节点保留了候选集,这是必要的第一步。要让每个决策记录具有价值,需要包含以下六个字段:
- 该时刻可用的证据,以及后续到达的任何信息都不包含在内。
- 考虑过的候选方案,包括那些被一句话驳回的选项。
- 对于每个候选方案:预期结果、附带的信心值,以及时间和金钱成本。
- 选择的路径及其原因。
- 接下来发生的事情。
- 证据如何改变了科学家的观点。
这些字段必须在结果发生前进行时间戳标记,因为事后回顾会将不确定性转化为必然性。分歧也必须保留。将三位科学家的意见平均成一个整洁的解释,会精确地重现我们试图修复的信息丢失问题。
但这里显然存在一种失败模式。一旦决策被记录并评分,人们就会出于记录目的在事后进行补充。任何见过电子实验记录本被回顾性整理填满的人都知道,研究工具会多么迅速地变成合规性练习。一份让科学家每项决策花费10分钟诚实反思的记录,其价值远高于一份需要花费一小时绩效时间的记录。
让备选方案参与竞争
自主实验室展示了当决策和结果形成闭环时会发生什么。利物浦的移动机器人化学家在八天内于十变量配方空间中完成了688次实验。批量贝叶斯搜索利用每个结果选择下一个实验,发现了活性是初始配方六倍的光催化剂混合物。每次完成的实验都会改变系统接下来的行动。
机器人在人类预先设定的目标和搜索空间内进行优化,它并未决定哪些科学问题具有优先级。因此这项工作展示的范围较为有限,但仍具价值:当选项能快速返回标准化结果时,搜索历史会产生显著价值。开放式的生物学研究更具挑战性,因为分支探索可能需要数周时间,被舍弃的备选方案可能永远无法再被验证。
因此部分探索需要投入资源。当两个分支都具有合理性且投入成本值得时,实验室有时应选择运行备选方案。否则记录只会反映科学家通常的选择,而对系统性忽视的选项保持沉默。资助方可以将资助金额的一小部分专门用于未被采纳的分支,前提是决策记录和结果都已存档。这需要花费资金,但让每个实验室重新发现已被放弃的路径同样需要成本。
测试品味是否可迁移
当我们评估新AI系统是否具备科学品味时,比较应跨实验室和领域进行。在实时研究活动中的关键决策点,我们应冻结六个要素:证据、候选方案、预期结果、置信度、成本和最终选择。专家在结果揭晓前对选项进行排序,随后由独立团队验证这些结果。
我们可以为模型提供两种"饮食":仅提供论文,或同时提供论文和决策历史,然后要求它们对陌生项目中的下一个实验进行排序。接着我们评估每美元和每周获得的信息量、校准精度以及弱分支被放弃的速度。
如果历史记录仅在产生它们的实验室内部提升决策质量,它们就相当于有用的组织记忆。如果它们能提升其他领域陌生问题的决策质量,那么阿萨代尔团队就实现了科学界从未成功记录的突破:可迁移的品味记录。在实现这一目标之前,科学搜索历史仍是一种有前景的记录,尚未成为训练数据集。
Previous