🔬 The Coolest Diffusion Research Isn't in LLMs — Evan Feinberg & Sergey Edunov, Genesis Molecular AI
TL;DR · AI 摘要
🔬 The Coolest Diffusion Research Isn't in LLMs — Evan Feinberg & Sergey Edunov, Genesis Molecular AI Latent Space: The A...
核心要点
- 主题聚焦:🔬 The Coolest Diffusion Research Isn't in LLMs —
- 来源:Latent Space,建议结合原文判断细节。
- AI 分析暂不可用,本条为保底评分与摘要。
🔬 最酷的扩散研究不在大语言模型中 — Evan Feinberg & Sergey Edunov, Genesis Molecular AI
Latent Space: The AI Engineer Podcast
🔬 最酷的扩散研究不在大语言模型中 — Evan Feinberg & Sergey Edunov, Genesis Molecular AI
1×
0:00
当前时间:0:00 / 总时长:-1:48:39
-1:48:39
您的浏览器不支持音频播放。请升级浏览器。
🔬 最酷的扩散研究不在大语言模型中 — Evan Feinberg & Sergey Edunov, Genesis Molecular AI
为什么Llama团队离开Meta转向药物发现,PEARL在零样本OpenBind任务上的突破,以及当协同折叠最终突破精度门槛后可能发生什么。
Brandon Anderson
2026年7月1日
文字记录
这期节目有一个有趣的个人故事:存在一个反事实的世界,我曾是Genesis Molecular AI的首位员工1,这是一家制作本期节目的公司。某个介绍晚了数周,我已愉快地签约Atomwise2,另一家专注于机器学习的药物发现初创公司。同样的问题,不同的公司。我确信机器学习将彻底改变小分子药物发现。早期结果令人失望。虽然有时有用,但远未达到革命性。在过去一年中,我看到了迹象表明机器学习终于准备兑现我十年前的信念。Genesis可能是最终解决这个问题的公司之一。我非常兴奋能完成一个完整的循环,与联合创始人Evan Feinberg和CTO Sergey Edunov重逢。
如果您对小分子药物发现感兴趣,我们会认为您会发现这非常有趣!
在我们近两个小时的对话中,我们讨论了:
- 什么是小分子药物发现,为什么它如此困难
- 结构预测作为AI算法创新的热点领域
- 其他领域的AI进展如何逐步提升预测能力
- 社区基准测试实际上将AI的粗糙实现视为足够好
- Genesis旗舰模型(PEARL)能够常规达到实际应用所需的门槛
- 这些高精度模型带来的新型智能工作流
继续阅读以了解更多信息,以及我对未来的个人思考。
最酷的扩散研究正在Genesis发生
Sergey Edunov从Meta加入Genesis,曾领导Llama 2训练和Llama 3预训练。Sergey曾是物理学家,经过多年的LLM训练后认为自己已与物理告别。然后他发现了Genesis,对其开发的全新架构工作感到震撼。
现代LLM研究没有带来根本性或令人兴奋的架构更新,这可能不会让任何人感到意外——自Transformer出现以来,整个领域都在使用原始“Attention is all you need”论文中提出的相同概念的变体。当然,有些改进确实很有用(特别是专家混合架构使我们今天能够实现大规模模型范式),但概念上令人兴奋的创新非常有限。
“我们实际上不得不等待正确的基础模块被创造出来,结果发现是扩散模型……事实上,我们领域中最创新的扩散研究正在3D结构预测领域发生。” —— Evan Feinberg
另一方面,3D结构预测领域一直是研究的热点。Genesis最近推出的PEARL(Place Every Atom at the Right Location)模型能够理解蛋白质的灵活性,不仅预测配体的结合位置,还能对蛋白质结构进行微调,使两者结合得比单独存在时更加契合。学界早就意识到这一能力的缺失,但直到现在才真正具备建模能力。
自主发现
是什么让这个问题如此困难?正如Sergey指出的,宇宙中存在10^60种可能的类药物小分子。你永远无法穷尽所有可能性,寻找其中有效的分子就像大海捞针——但不同的是,除了你寻找的那根针,其他所有东西都可能是致命的。
“宇宙中存在10^60种类药物小分子……这就像在麦垛中找针,而除了你的那根针,其他所有东西都非常危险。” —— Sergey Edunov
“或许更贴切的比喻是,在针堆中找麦秆。” —— Evan Feinberg
解决多参数优化问题的难度更是雪上加霜。一个强效的结合分子和具有良好“ADMET特性”(吸收、分布、代谢、排泄和毒性)的分子往往存在矛盾。例如,强效结合分子通常具有脂溶性,但脂溶性分子往往难以溶解,无法进入血液到达作用部位!
Genesis在生成式AI领域的突破使他们突破了关键阈值,认为自主药物发现循环终于成为可能。我们还记得LLM(大语言模型)的早期阶段。当时它们是优秀的聊天机器人,但作为代理(agent)却表现糟糕,因为微小错误会迅速累积导致失效。随着LLM能力提升,代理的实用性也迅速增强。Evan和Sergey认为,Genesis最近的模型也达到了类似的临界点。其内部自主药物发现系统(代号SAPPHIRE)现在可以像化学家一样进行迭代:分析并推理分子构象,形成假设,查阅文献,使用内部工具,为下一轮迭代生成候选分子。结合Genesis与Incyte等实验室的自动化合作,我们正迅速接近药物发现代理全天候运行、持续生成/测试新分子的时代。激动人心的时刻即将到来!
基准危机:大家最爱的基准其实是垃圾
一个鲜有人讨论但令人惊讶的要点:在“共折叠”(co-folding)学术领域,人们已默认将“2埃 RMSD”(均方根偏差)作为衡量“良好构象”的基准。Evan直言不讳地指出:这个阈值本身就是糟糕的,甚至可能是具有欺骗性的。对于许多强效结合分子,其正确构象在PDB电子密度图中甚至可以直接解析!然而,使用2埃的RMSD阈值时,仍可能以误导性的方式得出错误构象,甚至可能误导药物化学家。例如,仅仅翻转一个芳香环,所有数据看起来都合理,但你已经不再模拟正确的相互作用。
Evan强烈主张,1埃的RMSD才是确保分子核心位于正确位置、准确模拟所有相互作用的必要阈值。
“如果你的模型RMSD在1.8到1.9埃之间,那基本上就是垃圾。” —— Evan Feinberg
作为简单例子,他指出氢键在蛋白质-配体系统中负责许多关键相互作用。氢键的有效作用范围仅有0.6埃!显然,如果你能准确解析所有氢键,通常必须远超2埃的阈值。
这显然是Evan和Genesis来之不易的教训。在他们看来,社区之所以陷入这些基准测试的困境,是因为开发方法的学术研究者本身并非用户。Evan确实看到了一些积极的迹象,例如使用lDDT等新指标进行共折叠评估。希望社区很快能达成共识,认为“1.8Å RMSD只是粗略的指标”,并开始在这项更具挑战性的任务上攀登更高的目标。
如需更深入探讨传统基准测试的局限性,请参阅PEARL技术报告。
PEARL超越OpenBind
这使得接下来发生的事情更加引人注目。在播客接近尾声时,我们讨论了Genesis最近的一个“实践检验真理”时刻——在新发布的OpenBind基准测试中评估他们的PEARL模型。该基准测试包含802个此前从未见过的与目标蛋白EV-A71相关的复合物。这个目标蛋白似乎专门挑选来考验大多数传统对接方法。当配体结合到主要结合位点时,蛋白质会移动以封闭配体进入结合口袋的路径。这一被称为“诱导契合”的过程,对传统方法来说 notoriously 难以建模。这种权衡很容易理解:将蛋白质视为静态结构时,很难将配体放置在结合口袋中;若将蛋白质视为动态结构,则需要模拟耗时的复杂过程。
PEARL能够在不进行长时间分子动力学模拟的情况下,成功建模配体的诱导契合过程。在不同评估指标中,PEARL的表现不仅优于所有公开模型,很多时候甚至大幅领先。这一结果令人真正印象深刻。
“PEARL特别出色的地方在于如何确定这个环的移动方式。我们对每一个构象都基本准确。” —— Sergey Edunov
更令人兴奋的是,这一切都是在没有任何微调或使用目标蛋白及同源蛋白数据的情况下完成的——模板PDB是在PEARL训练截止后发布的。
协同折叠的未来方向
作为一名几乎十年来一直关注或参与蛋白质-配体相互作用机器学习技术的研究者,我确实对Genesis最近发布的成果感到印象深刻。这项成果经历了多年的开发,我确信Evan和团队在达到这一阶段的过程中经历了无数个不眠之夜。我也认为其他团队正在取得类似的进展——Isomorphic和Deep Origin都发布了看似精神内核相似的成果,它们结合计算、湿实验数据和机器学习,实现了十年前看似不可能的真实预测能力。令人遗憾的是,以上所有成果都是闭源的,因此无法进行诚实的比较。根据现有结果,我认为在不远的将来,我们或许可以将蛋白质-配体结合视为“已解决”的问题。
我真诚希望学术界能从这些进展中获得启发。一旦知道某件事可以实现,执行起来就会容易得多。然而,我认为上述所有成就的关键推动力在于机器学习、大规模计算和实际药物发现应用的紧密结合。令人遗憾的是,学术界目前的结构并不利于此类发展。
带着这些临别感言,我们希望您能聆听这期播客!
当时称为Genesis Therapeutics
现在称为Numerion
ADMET 代表吸收(Absorption)、分布(Distribution)、代谢(Metabolism)、排泄(Excretion)和毒性(Toxicity)。这组约30项属性都需要进行优化,才能使一种分子被认定为“优质药物”。
#### 关于本期内容的讨论
评论
Restacks
由AI工程师打造、面向AI工程师的播客!2025年,超过1000万读者和听众通过Latent Space了解Software 3.0领域的新闻、论文和访谈。我们直接从推动前沿技术的创始人、开发者和思想家处,报道基础模型(Foundation Models)在代码生成、多模态、AI代理、GPU基础设施等领域的变革。我们力求为您提供最权威的当前热点解读,以及未来三个月您将使用的技术的首次介绍!我们独家披露来自OpenAI、Anthropic、Gemini、Meta(Soumith Chintala)、Sierra(Bret Taylor)、tiny(George Hotz)、Databricks/MosaicML(Jon Frankle)、Modular(Chris Lattner)、Answer.ai(Jeremy Howard)等机构的最新消息和独家专访。完整节目备注始终在 https://latent.space
收听渠道
Substack App
Apple Podcasts
Spotify
RSS Feed
本期内容
近期节目
为什么前沿生态系统必须开放 —— Matei Zaharia 和 Reynold Xin,Databricks
6月24日
Mythos 之后的红队演练 —— Zico Kolter & Matt Fredrikson,Gray Swan
6月22日
输出最大化教授 —— Anjney Midha,AMP
6月18日
🔬 自动驾驶实验室 —— Joseph Krause,Radical AI
6月17日
•
现实:最终评估 —— Andon Labs 的 Lukas Petersson 和 Axel Backlund
6月4日
🔬 超越非正式AI的扩展 —— Carina Hong,Axiom Math
6月3日
RJ Honicky
⚡️Satya Nadella:No Priors x Latent Space 跨界特别节目,微软Build大会