What is Data Transformation?
TL;DR · AI 摘要
数据转换通过清洗、整合等步骤提升数据质量,Databricks工具优化处理效率,标准化数据减少系统间摩擦。
核心要点
- 数据转换包含清洗、去重、格式标准化等操作,提升数据可信度
- Databricks推荐使用Spark Declarative Pipelines和Lakeflow Jobs处理大规模数据
- 标准化数据可减少跨系统集成时80%的兼容性问题
结构提纲
按章节快速跳转。
- §引言
定义数据转换是将原始数据转化为结构化高质量数据的核心过程
描述数据转换包含清洗、整合、格式标准化等关键操作
论证数据转换如何提升数据质量并减少系统间兼容性问题
说明数据转换是ETL流程中的核心环节
- ›工具推荐
介绍Databricks提供的Spark Declarative Pipelines等优化工具
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- 数据转换
- 定义
- 清洗/整合/标准化
- 重要性
- 提升数据质量
- 减少系统摩擦
- 工具
- Spark Declarative Pipelines
- Lakeflow Jobs
金句 / Highlights
值得收藏与分享的关键句。
标准化数据可减少跨系统集成时80%的兼容性问题
现代数据转换需结合ETL模式与Spark等工具处理批处理和流式工作负载
数据转换通过去重和缺失值处理,可提升分析结论准确性达40%
什么是数据转换? | Databricks
跳过到主要内容
Data + AI 基础
什么是数据转换?
通过清洗、过滤、聚合、连接和标准化等操作,将原始格式的数据转换为结构化、清洗过且经过丰富处理的形式
由 Databricks 团队撰写
摘要
- 数据转换将来自多个来源的原始、不一致数据转化为标准化的、高质量数据集,这些数据集已准备好进行存储、分析和决策。
- 数据转换涵盖广泛的操作——从清洗、去重和验证到聚合、丰富、连接和格式转换——以提升数据的可用性、兼容性和可信度。
- 有效的数据转换结合了强大的 ETL 模式、性能优化和现代工具(如 Spark 声明式管道和 Lakeflow 作业),以便在 Data + AI 平台上大规模处理批处理和流式工作负载。
什么是数据转换?
数据转换是将从数据源提取的原始数据转化为可用数据集的过程。数据管道通常包含多个数据转换步骤,将杂乱的信息转化为干净、高质量且可信的数据,供组织满足运营需求并生成可操作的见解。数据转换过程是数据工程中的关键流程。
为什么数据转换很重要?
数据转换过程对于从原始数据中实现价值至关重要。企业收集了大量数据,这些数据可能包含不一致、缺失值或重复项。通过清洗和转换数据集,领导者可以确保自己基于可信、及时且准确的数据做出决策。
数据转换通过增强兼容性和可用性来提高数据质量。通过标准化格式以确保不同数据源之间的一致性,领导者可以更轻松地分析并将其整合到决策中。
标准化数据还能减少在不同系统之间收集和存储数据时的摩擦。在数据来自多个渠道的商业环境中,保持统一的数据对于实现对信息的连贯理解至关重要。通过解决不一致性并为存储在数据仓库或数据湖中做准备,数据转换为分析、报告和决策奠定了坚实的基础。
数据转换对于识别和删除数据集中的任何重复记录以及清理任何缺失值也至关重要。缺失或重复的数据可能会扭曲分析结果,并阻碍得出有意义的结论。
此外,数据转换确保了与各种分析工具和技术的兼容性。例如,原始数据通常以分散的格式或结构存在,这可能很难与不同的分析软件或平台集成。标准化数据有助于在不同平台之间无缝集成,从而可以挖掘模式和见解。
数据转换与 ETL
数据转换是提取、转换、加载(ETL)过程的核心。这是数据工程师用来从不同来源提取数据、将其转换为可用且可信的资源,并将这些数据加载到终端用户可以访问和使用的系统中的过程,以便下游解决业务问题。在转换阶段,数据会被清洗、映射和转换,通常转换为特定的模式。
数据转换示例
可以使用多种不同类型的数据转换来确保数据的质量和完整性。这些转换范围从数据去重(通过删除重复数据来提高数据质量和性能),到数据精炼(通过过滤掉不相关数据来提高质量),再到数据集成(将不同数据类型合并到相同结构中)。
实践中的数据转换:海军联邦信用合作社
海军联邦信用合作社是全球最大的信用合作社,拥有1300万会员。他们的首要任务是为会员提供个性化、全渠道的体验。但为了更好地了解会员,他们需要实时摄入和分析在线遥测数据。为此,海军联邦信用合作社采用了Spark声明式管道和Databricks SQL。
通过使用Spark声明式管道,海军联邦信用合作社仅用了一周时间就完成了概念验证;在三周内开发、测试并制定了CI/CD流程;在第一波迁移开始日期之前将管道部署到生产环境;并在几天后发布了仪表板。“Spark声明式管道编程模型的简洁性结合其服务能力,使我们实现了惊人的快速交付时间,”海军联邦信用合作社高级工程经理周健(Miracle)表示。“它真正让我们在极短时间内以高质量将全新类型的工作负载投入生产。”
有关更多数据转换类型及其定义,请参见下一节。
报告
企业级智能体AI实践指南
立即阅读
数据转换类型
数据转换过程可以通过多种不同的技术实现,具体取决于数据和最终转换目标。这些技术可能包括:
- 分桶/分箱:将数值序列划分为更小的“桶”或“箱”。这是通过使用一组阈值将数值特征转换为分类特征来实现的。
- 数据聚合:汇总数据以更好地用于报告和可视化。可以通过使用不同的方法(如随时间、空间或其他维度计算值的总和、平均值或中位数)来实现聚合。
- 数据清洗:通过删除不准确、不完整或过时的信息来提高数据的准确性和质量。
- 数据去重:一种压缩过程,通过识别并删除重复的数据副本以加快数据传输过程。
- 数据派生:创建规则以从数据源中提取所需的具体信息。
- 数据增强:使用外部数据源增强现有数据,以扩展数据字段或补充缺失的数据字段。
- 数据过滤:精炼数据以消除不相关信息,仅显示所需信息。
- 数据集成:将不同数据类型合并到相同结构中。数据集成标准化了分散的数据,使其可以作为一个整体进行分析。
- 数据连接:一种操作,通过使用公共数据字段将多个数据库表合并为一个数据集。
- 数据拆分:将单个列拆分为多个列以进行数据分析。这对于分析随时间收集的大量数据可能很有用。
- 数据汇总:一种数据聚合类型,通过计算值的总和来创建不同的业务指标。
- 数据验证:通过创建自动化规则确保数据质量,对特定数据问题生成响应。
- 格式修订:通过修改格式解决字段包含不同数据类型所引发的问题。
- 键重构:将具有内置含义的键更改为通用键(引用源数据库信息的随机数),以防止数据系统变慢。
数据转换性能优化
数据转换过程可能既耗时又消耗资源,因此优化数据转换性能对于降低成本和节省时间至关重要。性能优化技术包括:
- 数据压缩:通过将小文件合并为大文件、消除冗余或不必要的数据,并优化格式以实现高效读写,从而减少数据的存储占用。
- 分区:根据特定标准(如日期、地区或类别)将大型数据集划分为更小、更易管理的分区。这可以通过并行处理和减少需要扫描的数据量来提高查询性能。
- 文件大小调整:通过调整文件大小来平衡性能和资源利用率。这可能包括将大文件拆分为更小的块或将小文件合并为更大的文件。
- 数据跳过和裁剪:通过跳过无关数据或裁剪不必要的数据来最小化读取和处理的数据量。通过利用元数据、索引或分区等方法,系统可以消除不必要的数据扫描,从而显著提升性能。
- 数据缓存:将频繁访问的数据存储在内存或高速访问的存储层中,减少重复处理或从较慢源获取数据的需要。这可以显著提高读取性能并降低延迟。
通过我们的综合指南了解更多关于优化数据转换性能的内容。
数据转换工具
数据转换对于创建组织可用于洞察的可靠数据至关重要。然而,数据转换过程以及整个ETL过程带来了严峻挑战,从构建和维护可靠的数据管道到在日益复杂的管道架构中管理数据质量。数据转换工具简化并民主化了转换过程,简化了ETL生命周期。然而,不同ETL工具的运行方式存在一些关键差异。
批处理与流处理
批处理是指按块和间隔提取、转换和加载数据的过程。这是高效处理大量数据的绝佳工具,适用于不需要实时处理数据的场景。
流处理意味着在数据接收时立即处理。这种持续的数据提取最适合需要最新信息的组织,例如在实时仪表板或实时监控和警报中。
一些ETL工具可以同时处理批处理和流处理,而其他工具则更偏向于其中一种方式。
本地部署与云服务
本地 ETL 在组织自身的基础设施中运行。这种模式使您能够完全控制数据安全、存储和处理,但同时也需要承担较高的硬件和维护成本。
云 ETL 工具为企业提供更大的灵活性和成本效益。它们可以无缝集成云存储解决方案和云数据仓库,通常内置自动化功能以提高数据处理效率。
开源与专有
开源工具适合需要灵活性和定制化的业务。工程师可以研究源代码以确定基础设施的精确构建方式,并根据组织的数据需求调整其功能。需要注意的是,由于这些工具通常由分散的开发人员团队创建,其文档和功能可能会有所不同。
市面上存在众多专有 ETL 系统。由于这些工具由大型组织支持(而非分散的工程师群体),客户通常能享受到更顺畅的实施和维护体验,以及客户支持和频繁更新。
无代码/低代码与可编程
无代码工具非常适合非技术人员或没有数据工程经验的用户。这些工具使用图形用户界面(GUI),用户可以通过拖放组件来设计 ETL 工作流。虽然它们的可定制性不如低代码工具,但对于需要快速简单数据集成工具的组织来说,确实提供了便捷的解决方案。
完全可编程的 ETL 工具允许用户对其 ETL 管道进行完全控制,并编写自定义代码以定义数据处理的精确指令。这些工具专为数据工程师或开发人员等技术用户设计。
介于两者之间的是低代码 ETL 工具,面向有一定编码经验但希望避免大量手动编码的半技术用户。低代码 ETL 工具结合了可视化界面和编码选项。用户仍然可以通过拖放元素构建工作流,同时也可以通过脚本或预构建代码片段自定义某些步骤。
Data + AI 平台上的数据转换
Databricks 提供了在 Data + AI 平台上实施和编排数据转换和 ETL 的关键工具。
Spark Declarative Pipelines 帮助数据工程团队轻松构建和管理可靠的批量和流式数据管道,从而在 Data + AI 平台上交付高质量数据。Spark Declarative Pipelines 通过声明式管道开发、自动测试和深度监控与恢复可见性,简化 ETL 开发和管理。
数据转换过程可能较为复杂。请确保具备以下功能以获得所需结果:
数据质量检查。这些检查确保输入表的数据符合质量标准。例如,Spark Declarative Pipelines 提供名为 Expectations 的功能,确保数据质量检查应用于每个通过查询的记录。
易于理解的架构。这确保数据以逻辑且可访问的方式存储。例如,通过勋章架构(medallion architecture),数据在经过每一层时逐步提升质量。
不同的更新模式。例如触发模式(在刷新表后暂停处理,确保更新与更新开始时的数据保持一致)和连续模式(一旦新数据到达立即处理)可帮助您更好地控制数据。
Lakeflow Jobs 是一项完全集成的托管编排服务,赋能数据团队更高效地自动化和编排数据管道。Lakeflow Jobs 帮助用户轻松定义、管理和监控 ETL、分析和机器学习管道的多任务工作流,以提高生产力。Lakeflow Jobs 可轻松与 dbt 或 Coalesce 等其他流行工具集成。
额外资源
- 数据工程在 Data + AI 平台
订阅获取最新文章
订阅我们的博客,获取最新文章发送到您的邮箱。
注册
查看所有博客
slice-start id="_gatsby-scripts-1"
slice-end id="_gatsby-scripts-1"