How Daikin Applied Americas builds consistent data pipelines at scale with Genie Code
TL;DR · AI 摘要
Daikin Applied Americas 使用 Databricks Genie Code 通过结构化方法和 AI 工程提高数据管道构建效率。
核心要点
- Genie Code 可将数据管道构建时间从数天缩短至数分钟。
- DAA 采用 MECE 原则定义 AI 技能,确保输出一致性。
- Genie Code 被视为需遵守架构约束的初级工程师,而非特殊工具。
结构提纲
按章节快速跳转。
- §引言
Daikin Applied Americas 面临数据管道构建效率和一致性挑战。
Genie Code 通过 AI 工程加速数据管道构建,减少手动工作。
DAA 采用 MECE 原则定义 AI 技能,确保输出一致性。
Genie Code 需遵循架构约束,避免因 AI 导致架构漂移。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- Genie Code 在数据工程中的应用
- 加速数据管道构建
- 减少手动工作
- 缩短构建时间
- 确保一致性
- MECE 原则
- 架构约束
金句 / Highlights
值得收藏与分享的关键句。
Genie Code works best when treated like a junior engineer who works fast but must respect the same architectural constraints as everyone else, no special exemptions 'because it’s AI.'
Pipelines that previously took days to prototype could be generated in minutes.
Instructions varied across teams, prompts became difficult to maintain and similar tasks produced inconsistent outputs.
代理数据工程正在改变管道的构建方式
Daikin Applied Americas(DAA)在美国和加拿大制造和维护商用暖通空调系统。这意味着要管理大量来自设备遥测、供应链数据和现场服务记录的运营、制造和服务数据。
数据团队支持工程、运营和客户服务中的分析和人工智能用例,所有这些都依赖于可靠且结构良好的管道。
随着这些需求的增长,数据团队所面临的压力也越来越大,包括更多的管道、更多的用例以及跨团队更多的协调工作。为了解决这个问题,团队定义了一个更结构化的运营模型,用于管道的设计、构建和治理,并使用 Databricks Genie Code 来加速该模型内的执行。
团队将 Genie Code 作为人工智能辅助的数据工程方法。直接在 Unity Catalog 中治理数据,可以帮助规划和生成跨工作流的多步骤管道。这使工程师能够更快地从一个想法过渡到一个可用的管道,而无需切换工具或手动拼接组件。
这种速度从根本上改变了团队的工作方式。以前需要几天时间进行原型设计的管道现在可以在几分钟内生成。迭代周期缩短,工程师花更少的时间编写样板代码,而更多的时间用于优化逻辑和结果。
同时,在一个大型共享数据环境中运行需要一致性。管道必须遵循常见的架构模式,使用共享定义,并在跨团队时行为一致。
在这种情况下,大型语言模型引入了结构性的挑战。当团队依赖于不同的提示或松散定义的指令时,相同的请求可能会产生不一致的输出,并随着时间的推移导致架构漂移。
为了解决这个问题,DAA 团队专注于定义人工智能在受控企业环境中的操作方式,而不是仅仅依赖于提示工程。
正如 Daikin Applied Americas 的高级总监 Trent Lezer 所说:“当 Genie Code 被视为一个工作速度快但必须与其他所有人遵守相同架构约束的初级工程师时,它的效果最好,没有因‘它是人工智能’而给予特殊豁免。”
每项技能在数据工程生命周期中定义了特定的能力。这些技能互不重叠,共同覆盖了完整的流程。这些技能包括奖章架构设计、源数据准备和粒度定义、转换模式、规范对齐和治理标准。
团队没有将规则嵌入提示中,而是构建了环境,使 Genie Code 在运行时加载适当的技能,并在规划和执行过程中应用这些技能。这将行为从解释临时指令转变为在定义的执行模型中运行。
从治理角度来看,这也改变了标准的执行方式。正如 Databricks 的解决方案架构师 James VanGordon 所指出的:“我经常看到的 Genie Code 模式非常简单:提示可以让你入门,但它们不是执行团队标准的好地方。如果某个规则需要多次使用,它应该作为技能存在于工作区中,这样 Genie Code 才能真正使用它。”
他还强调将标准直接嵌入到执行环境中:“这才是让这一切变得现实而不是空想的关键。技能、Unity Catalog 上下文和 Genie Code 都在同一个地方工作。指导内容位于工作创建的地方,而不是在后续的审查流程中,需要某人之后记住。”
使用奖章架构指导管道开发
团队还加强了奖章架构在治理和推理框架中的作用。青铜、白银和黄金层级已经存在,但变化在于在管道生成过程中,它们被明确地作为决策边界,而不仅仅是存储层级。
青铜层代表原始源数据的真实情况。白银层代表清洗和统一后的数据。黄金层代表可用于业务分析的数据。
为了使这一结构可操作化,团队在层级之间引入了检查点。在数据推进之前,必须满足诸如源数据粒度定义、连接验证和数据稳定性检查等要求。
这些检查点是在开发工作流程本身中强制执行的,而不是作为下游的审查步骤。Genie Code 在生成和修改管道时在这些约束条件下运行。
这确保了团队之间的一致性,同时减少了在快速开发过程中出现架构捷径的风险。
将管道连接到业务概念
在企业数据工程中,一个反复出现的挑战是将技术模型与业务语言对齐。
在 DAA,利益相关者使用设备、客户、服务事件和合同等术语进行思考,而不是使用表、连接或转换等技术术语。
为了解决这个问题,团队将管道设计锚定在稳定的业务实体上。工程师不再从技术结构开始,而是首先识别数据所代表的内容以及它随时间的变化方式。
这种转变改善了下游工作,并减少了在跨领域重用数据集时的歧义。
随着时间的推移,白银层模型和黄金层数据集变得更加一致,因为它们基于共享的业务概念,而不是孤立的技术决策。
输出在各团队之间也变得更加一致。相似的使用场景遵循了相似的结构模式,从而提高了可维护性和复用性。
更重要的是,对生成输出的信任度提高了。工程师花更少的时间验证结构的正确性,可以更快地进行迭代。
在开发流程中统一决策制定
为了使这些成果可以重复实现,团队在开发过程中统一了关键决策。
不再依赖隐含的知识,而是将定义明确化,包括哪些数据符合青铜、白银和黄金标准,源粒度是如何定义的,哪些转换模式是可复用的,以及业务实体是如何表示的。这种结构对于扩展至关重要。它确保 AI 在各团队之间始终在一个一致的框架内运行,即使使用场景发生变化。
规模化带来的回报:这在规模化中解锁了什么
这种运营模式的结果不仅仅是更快的管道。它使数据工程能够在受控的企业环境中进行扩展。
更少的修正,更快的交付
工程师花更少的时间修复结构不正确的管道,而更多的时间用于优化逻辑和业务成果。
减少团队间的架构漂移
技能和治理检查点的一致应用,防止了在处理类似数据挑战的团队之间出现分歧。
工程与业务之间更强的一致性
将管道建立在业务概念之上,提高了清晰度,减少了后续的返工。
无需人工负担的可扩展治理
防护措施直接嵌入系统中,减少了对人工执行的依赖。
对 AI 生成输出的信任度提高
由于定义了技能和检查点,AI 在生产工作流中可以可靠地运行。
正如 Trent 总结的那样:“目标不是让 AI 遵循更多规则。而是让正确的规则变得无法被忽视。”
结论
在 Daikin Applied Americas,将结构化的运营模式与 AI 辅助开发相结合,使数据团队能够更快地扩展,同时保持一致性、清晰度和控制力。
通过定义管道应如何构建,并将这些规则直接嵌入开发环境,团队创建了一个系统,其中速度和治理相互增强,而不是相互竞争。
了解更多关于**Genie Code**。