Building High-Quality and Trusted Data Products with Databricks
TL;DR · AI 摘要
Databricks分享构建高质量数据产品的实践,强调数据产品所有者和数据网格范式的重要性。
核心要点
- 数据产品所有者需负责产品开发与质量监控
- 数据网格范式可提升数据资产的民主化管理
- Databricks提供数据产品标准化建设方案
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- 数据产品构建实践
- 核心概念
- 数据产品定义
- 数据网格范式
- 实施要素
- 数据产品所有者
- Databricks工具
金句 / Highlights
值得收藏与分享的关键句。
数据产品所有者需理解业务需求并转化为技术设计
数据网格范式使数据资产所有权更民主化
现代数据产品可创造新价值和数据共享机会
使用 Databricks 构建高质量且可信的数据产品 | Databricks 博客
跳至主要内容
最佳实践
2026年9月3日
使用 Databricks 构建高质量且可信的数据产品
作者:Amr Ali、Bernhard Walter、Fran Medina Castro、Glenn Wiebe、Karthik Subbarao、Lexy Kassan、Magnus Pierre 和 Pawarit Laosunthara
介绍
致力于成为人工智能和数据驱动型组织的企业通常需要为内部团队提供高质量且可信的数据产品。构建此类数据产品可确保组织为其数据和人工智能目标建立标准并奠定可信的业务事实基础。将质量和可用性置于首位的一种方法是通过使用数据网格范式,实现数据资产所有权和管理的民主化。我们的博客文章([第1部分](#)、[第2部分](#))为客户提供指导,说明如何在企业中利用 Databricks 应对数据网格的基础支柱,其中一个是“数据即产品”。
尽管将数据视为产品的理念随着数据网格的出现而变得流行,但我们观察到,即使未选择采用数据网格的客户,应用产品思维也产生了共鸣。无论组织结构或数据架构如何,数据驱动的决策仍然是普遍的指导原则。数据质量和可用性至关重要,以确保这些数据驱动的决策基于有效信息。本文将概述我们关于构建企业级数据产品的一般建议和具体使用 Databricks 的建议。
当用户和应用程序在正确的时间以正确的格式获得正确质量的数据时,数据产品最终会创造价值。虽然这种价值传统上通过降低成本、加快流程和降低风险以更高效的操作形式实现,但现代数据产品还可以为组织所在行业或合作伙伴生态系统内的新价值增值方案和数据共享机会铺平道路。
数据产品
尽管数据产品可以以多种方式定义,但它们通常与 DJ Patil 在《Data Jujitsu: The Art of Turning Data into Product》中给出的定义一致:“首先,……数据产品的良好定义是通过使用数据来实现最终目标的产品”。因此,数据产品不限于表格数据;它们也可以是机器学习模型、仪表板等。为了将这种产品思维应用于数据,强烈建议每个数据产品都应有数据产品负责人。
$
/$
图1:数据产品的关键方面
数据产品负责人负责管理数据产品的开发并监控其使用情况和性能。为此,他们必须了解底层业务,并能够将数据消费者的需求转化为高质量、易于使用的数据产品设计。他们与组织中的其他人一起,弥合业务和技术同事(如数据工程师)之间的差距。数据产品负责人需确保其产品组合中的产品在可信度特征方面符合组织标准。
数据产品必须满足五个关键特征:
- 质量与可观测性:数据质量包含准确性、一致性、可靠性、及时性以及文档的清晰度。通过定义数据产品的质量指标并进行监控和暴露,可以确保数据质量随时间推移保持预期水平。总体目标是使数据产品成为数据消费者可信赖的信息来源。
- 语义一致性:湖仓架构的目标是让数据使用更加便捷。因此,需要协同使用的数据产品应保持语义一致性。换句话说,它们需要遵循商定的治理规则,并共享术语定义,以便消费者能够以有意义且正确的方式组合这些数据产品。
- 隐私保护:隐私涉及信息的保密性和安全性,涵盖数据的收集、共享和使用方式。数据隐私通常受法规和法律(如GDPR、CCPA)约束。遵守隐私规则可能涉及匿名化、加密、数据驻留地管理、数据标签(如PII)、限制存储环境以及将数据访问权限最小化到少数员工等主题。
- 安全性:除了部署经过信息安全部门批准的数据平台外,数据产品负责人仍需定义访问权限(谁可以访问数据、数据可以与哪些合作伙伴共享等)以及数据产品的可接受使用政策。
- 可发现性:数据产品需要以组织内所有人都能发现的方式发布。这可能包括中央数据目录或内部数据市场等场所。数据产品负责人应在发布的产品中包含有助于理解数据及其与其他数据产品组合方式的资产(如示例笔记本、仪表板等)。
数据产品生命周期
典型的数据产品生命周期包含以下阶段:
- 构思阶段 - 在此阶段定义所需数据产品的商业价值并指定负责人。还应为监控目的定义性能和质量指标。
- 设计阶段 - 在此阶段创建具体细节,如设计规范和数据契约,确保与其他数据产品的一致性。
- 开发阶段 - 创建实际数据产品可能包括模式、表、视图、模型、任意文件(卷)、仪表板等,以及生成它们的流水线。此阶段还包括根据定义的数据契约对生成的数据产品进行测试。
- 发布阶段 - 数据产品的创建和发布常被混为一谈,但它们有显著区别。此阶段包括部署模型、将模式发布到共享目录、根据数据契约管理访问权限等活动。发布应包含版本管理以处理已发布数据产品的变更。
- 运营与治理 - 运营涉及持续活动,如监控质量、权限和使用指标。治理部分包括处理合规性请求和审计数据产品访问等操作。
- 使用与价值创造 - 数据产品在业务中用于解决各种问题。消费者可能根据使用产品的体验向数据产品负责人反馈,并建议未来能促进进一步价值创造的改进措施。
- 退役 - 退役数据产品可能有多种原因,例如使用率低下、数据产品不再符合合规要求等。无论如何,数据产品的退役都应平稳进行。这意味着弃用该产品、通知消费者、归档资产并清理资源。在此过程中,了解下游使用情况的可见性通常非常重要,而如果血缘关系能被自动捕获,这一过程将显著简化。
图2:数据产品的典型生命周期
在上图中,数据产品所有者需对数据产品的所有阶段负责,从构思到退役。然而,具体任务的责任可以与其他利益相关者(如数据管理员、数据工程师等)共享。
数据产品实施的最佳实践
使用Databricks实现高质量的数据产品需要超越单纯技术执行的深思熟虑的方法。首先应明确所有权,指定专门的数据产品所有者,他们需同时理解业务需求和技术要求。提前定义涵盖质量指标、模式定义、使用策略和安全参数的全面数据合同,以确保生产者和消费者之间的对齐。
在构建管道时,使用Delta Live Tables (DLT)并在代码中直接实施质量控制,利用内置的期望值和约束条件在每个阶段验证数据。采用分阶段的开发方法,使用独立的开发、测试和生产环境,确保发布前的质量。使用湖仓监控自动化监控,设置质量指标阈值警报,以便尽早发现问题。
在Unity Catalog中进行详尽的文档记录,结合技术规范和业务背景,帮助用户理解并正确使用您的数据产品。为提高治理效率,跨数据产品标准化命名约定和元数据,以提升可发现性和互操作性。最后,与消费者建立正式的反馈循环,根据实际使用模式和用户需求持续改进数据产品。
Databricks数据+AI平台可用于数据产品生命周期中的多项活动:
- ETL管道 - 可使用Delta Live Tables (DLT)构建稳健且受控的数据管道。Auto Loader和流式表可用于将数据增量加载到DLT管道或Databricks SQL查询的青铜层。
- 治理 - Databricks Unity Catalog功能丰富,旨在实现企业范围内的简单统一治理。可使用目录资源管理器进行数据发现,访问控制机制可促进将数据产品发布给目标消费者。血缘关系和系统表会自动跟踪,对操作治理至关重要。
- 监控 - 湖仓监控为监控数据和AI资产质量提供统一解决方案。这种主动方法对于满足数据合同条款是必要的。
对于数据产品生命周期中的某些活动,如设计数据产品和数据合同,Databricks目前尚无支持功能。这些流程应在Databricks数据+AI平台之外完成,数据产品发布后,结果需在Unity Catalog中进行文档记录。
数据合同
数据合同是一种正式对齐领域并实现联邦治理的方式。数据生产者应提供数据合同,但其设计应以消费者为导向。合同应以所有类型用户均可使用的方式进行表述。
一个典型的数据合同具有以下属性:
- 数据描述(名称、描述、源系统、属性选择等)
- 数据模式(表、列、匿名化和加密信息、过滤器、掩码等)和数据格式(半结构化和非结构化数据)
- 使用策略(标签、PII、指南、数据驻留等)
- 数据质量(应用的质量检查和约束、质量指标等)
- 安全性(允许使用数据产品的人员)
- 数据SLA(最后更新时间、过期日期、保留时间等)
- 责任(所有者、维护者、升级联系人、变更流程等)
此外,还可以提供支持性资产(如笔记本、仪表板等),以帮助消费者理解并分析数据产品,从而促进更轻松的采用。
数据治理团队
企业中的数据治理团队通常由业务负责人、合规和安全专家以及数据专业人员等不同群体的代表组成。该团队应作为合规和数据安全主题的卓越中心(CoE),并支持对数据产品负责的数据产品所有者。他们在制定数据合同时发挥关键作用,通过扩展使用策略以及影响谁被允许使用数据产品的决策来发挥作用。对于大型组织,此类团队可以帮助在与数据管理办公室等全球职能对齐的背景下,指导和标准化数据合同制定流程。
发布与认证
尽管已经建立了数据合同,数据产品的治理仍然是一个广泛的主题,涵盖访问控制、个人身份信息(PII)分类和各种使用策略等方面,这些在不同组织之间可能存在差异。然而,我们观察到的一个一致趋势涉及数据产品的发布。随着消费者接触到越来越多的数据集,他们通常需要确保数据是经过策划、标准化并正式批准使用的。例如,大型组织内的报告或主数据管理用例可能需要在企业内部不同数据资产之间实现高度的语义一致性和互操作性。
这正是数据产品“认证”概念对某些数据产品可能具有价值的地方。在此过程中,数据生产者可以首先提出数据合同规范,通常需要由数据治理管理员或团队进行审查。在获得批准后,可以运行持续集成/持续部署(CI/CD)流程,以部署将数据物理写入客户云存储账户的生产管道。然后,这些数据可以通过Unity Catalog表、视图甚至非表格数据的卷进行发布和轻松发现。在此背景下,Unity Catalog支持使用标签以及markdown来指示数据产品的认证状态和详细信息。
Figure 3: 数据产品“认证”流程
一些客户甚至会选择通过在Databricks Marketplace发布对应的私有列表来推广其认证数据产品,并提供全面的指南和使用示例。此外,Databricks的REST API以及与企业目录解决方案(如Alation、Atlan、Coalesce和Collibra)的集成,也使得认证数据产品能够通过多种渠道被轻松发现,即使是在Databricks平台之外的渠道。
用例与成功案例
汽车制造:Rivian的车辆智能平台 作为一家电动汽车制造商,Rivian利用Databricks处理道路上超过25,000辆汽车的物联网传感器数据,每辆车每天生成数TB的数据。其高级驾驶辅助系统(ADAS)团队使用该平台分析包括车身倾斜、滚动、速度、悬挂系统和安全气囊活动等信息的遥测数据,帮助Rivian了解车辆性能和驾驶模式。通过使用Databricks Lakehouse平台,他们实现了运行时性能30%-50%的提升,从而加快了洞察速度并提高了模型准确性。这种数据驱动的方法使Rivian能够实施预测性维护,优化组件可靠性,并持续改进客户驾驶体验。
医疗健康:Walgreens的处方个性化服务 作为美国最大的药房连锁企业之一,Walgreens利用Databricks大规模处理处方数据,彻底改变了患者体验。在近9,000个门店每年处理超过8.25亿张处方的背景下,Walgreens基于Databricks构建了信息、数据与洞察(IDI)平台,每秒可处理40,000个数据事件。这使他们通过精准调整库存水平优化了供应链,节省了数百万美元,并将药剂师生产力提高了20%。该平台通过包含药物相互作用警报、药物属性变更和其他关键信息的完整患者档案,使药剂师能够提供更优质的护理服务,实现更安全的处方管理。
制造业:Mahindra的AI驱动分析 作为一家全球制造集团,Mahindra & Mahindra Limited利用Databricks部署企业级AI解决方案,以提升其业务运营效率。其为财务分析师开发的GenAI机器人使团队在日常任务上的耗时减少了70%,使团队能够专注于更高价值的战略性工作。公司正在利用Databricks Data + AI平台处理多种用例,包括基于Databricks DBRX开源大语言模型构建的客户之声聊天机器人,该机器人通过Delta Lake整合内部数据,并结合网站和社交媒体的外部数据。这种综合性方法正在帮助Mahindra推动增长、提升客户体验并优化运营效率。
数据产品的未来趋势 数据产品的未来正受到多项新兴趋势的影响,这些趋势将改变组织利用Databricks等平台的方式。实时数据产品日益重要,因为企业需要越来越及时的洞察力,流式架构正成为关键运营数据产品的标准。我们还看到自助式数据产品创建的兴起,业务领域专家使用低代码/无代码界面来定义和构建数据产品,同时保持治理控制。
AI增强型数据产品正变得越来越普遍,这些产品能够自动整合机器学习功能和洞察力,模糊了传统数据与AI资产之间的界限。数据网格架构正在成熟,组织正在实施联邦计算治理,平衡中央标准与领域自主权。跨组织的数据产品正在出现,这些产品能够安全地跨越企业边界,数据洁净室和隐私保护计算使新的协作洞察成为可能。
数据合同正在演变,包含更复杂的质量保证、隐私控制和使用权限,成为可执行的规范而非静态文档。操作应用程序中的嵌入式分析正在增长,数据产品专门设计用于支持应用内洞察,而非独立的分析环境。最后,可持续性指标正被纳入数据产品,与传统业务KPI一起跟踪环境影响,以支持ESG报告和绿色倡议。
结论
在大型企业环境中,制定数据产品和数据合同可能变得非常复杂。鉴于与数据交互的新技术不断涌现,加上现代商业和监管要求,数据产品和合同的规范持续演变。如今,Databricks Marketplace和Unity Catalog是数据消费者在数据发现和引入体验中的核心组件。对于数据生产者而言,Unity Catalog提供了关键的企业治理功能,包括血缘分析、审计和访问控制。
随着数据产品从简单的表格或仪表板扩展到涵盖AI模型、数据流等更多内容,客户可以在Databricks上获得统一且一致的治理体验,适用于所有主要用户角色。
本文中强调的企业数据产品关键要素可作为您探讨该主题的指导原则。如需了解更多关于使用Databricks Data + AI平台构建高质量数据产品的信息,请联系您的Databricks代表。
常见问题
数据产品与普通数据集有何区别?数据产品不仅提供数据,还围绕特定用户需求进行设计,包含质量保证、文档和配套支持。与普通数据集不同,数据产品具有明确的所有权、定义完善的SLA,并在其整个生命周期中持续主动管理,以确保持续满足用户需求。
组织中应由谁负责数据产品?数据产品应由同时了解业务领域和数据技术细节的人员负责。这些数据产品负责人需对数据质量、可用性及与业务目标的一致性负责。根据组织架构,他们可能隶属于业务领域(在数据网格模式下)或中央数据团队。
我们如何衡量数据产品的成功?成功指标应涵盖技术层面(质量、可用性、性能)和业务影响指标。跟踪使用模式、用户满意度、用户洞察获取时间以及数据产品直接推动的业务成果。在实施前建立基准指标,并随时间衡量改进情况。
Unity Catalog在数据产品管理中扮演什么角色?Unity Catalog通过集中化元数据管理、访问控制、血缘追踪和发现功能,为数据产品治理奠定基础。它通过标签、注释和模式定义等功能支持数据契约的实施,同时提供企业级数据产品所需的审计和合规控制。
我们如何处理已发布数据产品的变更?为数据产品实施正式的版本管理和变更控制流程。提前向用户沟通变更内容,在可能的情况下保持向后兼容性,并为重大变更提供迁移路径。利用Unity Catalog的功能追踪版本并管理版本间的过渡。
我们可以在不采用完整数据网格架构的情况下创建数据产品吗?当然可以。虽然数据网格强调数据产品的领域所有权,但无论组织结构如何,都可以将产品思维应用于数据资产。聚焦用户需求、数据质量和可用性,实施明确的所有权和治理——这些原则即使在没有完整数据网格实施的情况下也能创造价值。
我们如何确保数据产品符合不断变化的法规要求?将合规性嵌入数据产品生命周期,定期由治理团队进行审查。在Unity Catalog中实施基于元数据的控制,自动执行策略,并利用血缘功能了解法规变更对数据产品的影响。在数据契约中记录合规要求,并通过审计日志监控遵守情况。
订阅博客获取最新文章
订阅我们的博客,将最新文章直接发送到您的邮箱。
立即订阅
查看所有博客
slice-start id="_gatsby-scripts-1"
slice-end id="_gatsby-scripts-1"