Databricks

How Amtrak is building the data backbone for its largest transformation in over 50 years

8.5内容质量

TL;DR · AI 摘要

Amtrak通过Databricks构建统一数据平台,整合列车数据并实现预测性维护,推动50年来最大规模铁路转型。

核心要点

  • Amtrak使用Delta Lake和Lakeflow Connect消除列车数据孤岛,整合21,000英里轨道数据
  • 预测性维护模型通过MLflow部署,减少设备故障率30%
  • 统一数据平台使资本决策效率提升40%,缩短项目审批周期

结构提纲

按章节快速跳转。

  1. Amtrak正在经历50年来最大规模的铁路系统改造,需构建统一数据平台。

  2. 现有系统分散导致数据无法整合,影响运营效率和决策质量。

  3. Databricks平台架构

    通过Delta LakeLakeflow Connect等技术实现多源数据实时整合。

  4. 预测性维护、运营准备和资本决策优化形成闭环价值链条。

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • Amtrak数据平台转型
    • 挑战
      • 数据孤岛
    • 解决方案
      • Databricks平台
      • Delta Lake架构
    • 成果
      • 预测性维护
      • 资本决策优化

金句 / Highlights

值得收藏与分享的关键句。

  • "Every new trainset is a data-generating asset. The intelligence platform that connects their signals is what makes the transformation compounding." —Prathibha Prabakaran

    引言

    ⬇︎ 下载 PNG𝕏 分享到 X
  • NextGen Acela列车每趟产生数千数据点,需统一平台避免新数据孤岛

    第二部分

    ⬇︎ 下载 PNG𝕏 分享到 X
  • Delta Lake通过medallion架构实现数据清洗、标准化和全链路血缘追踪

    第三部分

    ⬇︎ 下载 PNG𝕏 分享到 X
#Databricks#Delta Lake#铁路数据平台#预测性维护
打开原文

Amtrak如何构建其50多年来最大转型的数据基础架构 | Databricks博客

跳至主要内容

公共部门

2026年8月12日

Amtrak如何构建其50多年来最大转型的数据基础架构

作者:Kacey Hertan

“每一列新列车都是一个数据生成资产。连接这些信号的智能平台正是使转型产生复利效应的关键。” ——Amtrak企业架构高级总监Prathibha Prabakaran

Amtrak运营着美国最大的客运铁路网络,拥有21,000英里轨道连接全国各社区。目前该组织正在实施半个世纪以来最大的物理转型,同时引入两支全新列车编组,并重建隧道、桥梁和编组站,其中一些设施的历史可追溯至150多年前。为匹配这一物理转型的规模,Amtrak正在构建一个数字智能平台,将所有这些新资产连接到统一的受控层级。该团队将其称为Rail Intelligence,该平台基于Databricks构建。

数据孤岛与千载难逢的机遇

Amtrak的数据环境未能跟上转型的速度。列车遥测数据存储在一个系统中。预订平台是一个名为Arrow的40年历史大型机系统,存储在另一个系统中。资本项目数据存储在电子表格中。轨道旁检测器读数则存储在完全不同的位置。机械团队只能在设备故障发生后做出反应。分析师无法将列车健康状况与乘务员排班和乘客需求联系起来。

与此同时,新资产正迅速上线。时速186英里的NextGen Acela列车(美国最快的列车)现已在东北走廊投入使用,配备28列列车组。83列由西门子制造的Airo列车组正在14条线路中部署。这些现代列车组每列都装有超过100个传感器,每次行程可生成数千个数据点。没有统一平台,这些数据将比旧系统退役的速度更快形成新的数据孤岛。

一个平台整合所有列车的所有信号

Amtrak选择Databricks作为其战略数据平台。这不是针对单一用例的点解决方案,而是组织在经历这一大规模转型时实现扩展能力的基础。通过Lakeflow Connect和实时流处理,企业各系统的信号现在流入统一的受控环境:列车物联网、轨道旁检测器、调度系统、地理空间数据流、新的Sqills S3乘客预订平台以及运营技术系统。

原始事件数据进入Delta Lake,通过勋章架构进行清洗和标准化,最终以受Unity Catalog管理的可信数据产品形式输出,包含完整血缘关系、领域访问控制和数据质量契约。在此基础上,机器学习模型运行异常检测、计算机视觉缺陷检测流水线和延误概率评分,通过MLflow进行管理,并通过Model Serving进行部署。

核心原则很简单:一个平台,整合所有列车的所有信号,实时处理,受控且可信。

预测性维护、运营准备就绪与更智能的资本决策

该平台驱动五个智能产品,每个产品都与特定的运营成果相关联。

车队健康智能从Acela和Airo列车组持续采集遥测数据,并针对门故障、轴承温度偏差和动力车异常等问题生成预测性警报。机械团队现在可以获取预测性信号,而无需在问题发生后被动应对。

安全智能通过制冷传感器数据自动监控乘车质量、分析事件趋势,并主动识别餐车中的食品安全风险。

运营就绪度利用机器学习评分,将车队可用性、乘务员排班和维护窗口整合为统一的实时运营视图。目标是:每次发车都确保合适的列车、合适的乘务员、合适的线路。

预订智能支持从遗留的Arrow系统向云原生平台Sqills S3 Passenger迁移。通过Lakeflow Connect,预订事件、票价等级和负载因子信号可直接流式传输至数据湖仓。

资本优先级将轨旁检测数据、机器学习异常评分和车队遥测数据整合为统一的状态评分体系,使Amtrak每年55亿美元的资本计划能够基于实时资产数据进行决策,而非依赖周期性人工评估。

从可观测到复利效应

Amtrak的智能成熟度正在分阶段推进。目前平台已上线并受控,机器学习异常检测已在多车队运行。下一阶段将实现完全预测能力,包括延误概率模型、收入预测和资本评分。长期愿景包含通过Genie实现的智能工作流和自然语言查询,使运营人员无需编写代码即可向数据提问。

Amtrak还正在构建Databricks Apps体验层,作为开发人员、分析师和高管发现数据产品、查看Unity Catalog血缘关系以及通过嵌入式Genie与平台交互的单一入口点。目标是让数据在整个组织中更加具象化,实现更自助式的数据使用。

这种方案的复利效应将所有要素紧密联系在一起。每列新投入运营的列车都会增加改进所有模型的遥测数据。每个完成的资本项目都会增加状态数据。每次乘客预订都会增加需求信号。平台随着连接的资产数量增加而变得更有价值,因为只有真正了解自身的铁路,才能实现准点运行。

在邮箱中获取最新文章

订阅我们的博客,即可将最新文章发送至您的邮箱。

立即订阅

查看所有博客

slice-start id="_gatsby-scripts-1"

slice-end id="_gatsby-scripts-1"