AI at Meta Blog

How Meta’s AI Models Are Powering the First Wave of Genesis Mission Projects

8.5内容质量
How Meta’s AI Models Are Powering the First Wave of Genesis Mission Projects

TL;DR · AI 摘要

Meta的AI模型通过分割技术解决科学设施数据激增问题,助力美国能源部Genesis Mission项目突破分析瓶颈。

核心要点

  • 科学设施年数据量达20PB,相当于200万小时高清视频流
  • 分割技术将X射线图像转化为可量化结构地图
  • SYNAPS-I项目整合5大国家实验室推进AI科学分析

结构提纲

按章节快速跳转。

  1. 美国能源部设施年产生20PB数据,传统分析方法失效

  2. 图像分割是科学分析关键,将像素转化为可量化结构

  3. 整合五大实验室的AI计划,目标重构科学数据分析范式

  4. 白宫启动的AI驱动科研加速计划,由能源部主导实施

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • AI驱动科学分析
    • 数据挑战
      • 20PB/年数据量
      • 传统分析失效
    • 核心技术
      • 图像分割
      • 结构量化
    • 实施项目
      • SYNAPS-I
      • Genesis Mission

金句 / Highlights

值得收藏与分享的关键句。

#AI模型#科学数据处理#分割技术#Genesis Mission
打开原文

标题:Meta 的 AI 模型如何推动 Genesis 任务首批项目落地

URL 来源:https://ai.meta.com/blog/genesis-mission-lawrence-berkeley-national-laboratory-segment-anything-dino/

Markdown 内容: 劳伦斯伯克利国家实验室 是美国能源部旗下的顶尖研究机构之一,因在物理、化学和材料科学领域取得诺贝尔奖级成果而闻名。该实验室运营着全球最先进的科学设施之一,其中 先进光源(ALS)是一处占地相当于足球场的设施,能够产生高强度的 X 射线光束,使研究人员能够从原子和分子尺度研究材料,直至植物层面。ALS 的仪器(称为光束线)会产生海量数据——而随着近期设施升级显著提升了分辨率和速度,数据量已激增到科学家难以处理的程度。

数据规模令人震惊:美国能源部的光子和中子源设施每年现在产生数十 PB 的数据——相当于数百万 GB,大约相当于连续流媒体播放 200 万小时高清视频。这种数据积压并非一直存在。升级后的探测器已从每 6 秒捕获一张图像提升到每秒 10 万张图像,这意味着这些设施如今产生的数据量比十年前增加了多个数量级,而传统的手动分析方式根本无法跟上节奏。

问题不仅在于数据量:领域专家数量有限且不堪重负,而现代原位实验——科学家在实验过程中实时观察化学反应或材料失效等动态过程——需要人类团队无法手动实现的实时解析能力。

分析的难点大多归结为一项任务:分割——即在图像中识别并精确标定不同结构的边界。在计算机视觉领域,分割技术使从区分肿瘤与健康组织的医学扫描到区分行人与路面的自动驾驶车辆等应用成为可能。在科学研究中,分割技术能将原始 X 射线图像从灰度像素墙转化为可量化、可跨实验对比的有意义结构标注图——如细胞壁、矿物颗粒、半导体层等。

SYNAPS-I 与 Genesis 任务

2025 年底,白宫启动了 Genesis 任务,这是由美国能源部牵头的一项国家级倡议,旨在通过先进人工智能加速科学发现和技术领导力。SYNAPS-I(SYnergistic Neutron And Photon Science – Intelligence)是该计划的旗舰项目之一:由伯克利实验室牵头,联合 阿贡布鲁克海文橡树岭SLAC 国家实验室开展的多实验室计划,旨在将 X 射线和中子科学领域的数据分析从耗时数月的瓶颈转变为实时发现引擎,其中科学成像是重点目标。在图像分割领域,这一瓶颈尤为突出——从实验数据中提取有意义结构可能需要耗费数周专家时间处理每个数据集。

在 SYNAPS-I 的分割流程中,核心是 Meta 发布的两个开源基础模型:Segment Anything Model 3(SAM 3)和 DINOv3

SAM 和 DINO 如何改变科学成像

DINOv3 是一种自监督视觉模型,这意味着它可以直接从原始图像中学习视觉模式,而无需人工标注。它擅长理解图像中不同结构的含义及其位置。SAM 进一步提升了这种能力,能够为图像中的单个物体绘制精确的边界——就像科学家手动勾勒结构一样,但速度是人工的数百倍。

这两个模型共同构成了互补的流程:SAM 提供像素级的精确边界,而 DINO 则通过全局上下文识别每个结构及其在样本中的位置。SYNAPS-I 团队在 DOE 光束线收集的科学成像数据上对这两个模型进行了微调,随后在国家超级计算设施(如 NERSC)的 300 张 A100 GPU 上部署——这些高性能计算芯片是当今最先进 AI 系统的核心。结果:科学家在光束线仪器前可以立即获得一个完整重建并语义标注的 3D 体积数据,实验仍在进行时即可开始分析。整体处理时间:约 15 分钟。

SYNAPS-I 团队在一项紧迫的农业挑战中展示了这一流程——理解葡萄藤在细胞层面如何应对干旱。利用先进光源(ALS)收集的微 CT 扫描数据,该流程重建了葡萄藤茎的 3D 体积,并自动识别木质部导管——这些微观管道负责植物体内的水分运输。通过追踪这些导管在干旱过程中的变化,研究人员获得了可能指导抗旱作物开发的见解,并为未来的农业韧性提供了解决方案。

Image 1
Image 1

SYNAPS-I 对葡萄藤茎的微 CT 扫描分割结果。青色:含水木质部导管;深紫色:干枯部分。

过去每个时间步需要专家花费一个月进行标注,现在仅需 15 分钟,使科学家能够以数据采集本身的速度研究动态生物过程。

为什么开源至关重要

国家实验室将预出版研究数据和 AI 模型存储在政府基础设施上,而非外部云服务。这项工作必须在安全平台中进行管理。Meta 的开源方法使这一切成为可能。SYNAPS-I 团队可以在自己的安全计算环境中下载、微调并部署 SAM 和 DINO,将最初在自然图像上训练的模型适配到它们从未设计过的科学领域。

通过五个国家实验室的60名研究人员,SYNAPS-I正致力于构建一个未来科研设施作为智能发现平台的愿景——在这里,人工智能不仅能够加速数据处理,更能帮助科学家生成假设、推荐下一步实验,并在不同设施间传递知识,使某一光束线的突破性发现能惠及所有研究人员。随着Genesis从种子项目扩展为完整计划,这一开源基础将加速实现日益扩大的国家优先事项的发现进程。

在最近的万亿参数联盟会议上,能源部副秘书长达里奥·吉尔提到了这项工作的前景。

“通过无缝结合人工智能、先进计算和实验系统,SYNAPS-I能够在数据生成时立即进行分析,并实时指导实验,用自适应的自动化决策取代缓慢的人工操作,”他表示,“这将发现时间从数天压缩到瞬间,并建立一个持续自我完善的科学模型,这对于实现Genesis任务的全部潜力至关重要。”

最新动态已送达您的邮箱

订阅我们的通讯,获取Meta AI的最新消息、活动、研究突破等资讯。