Databricks

Governance beyond security: knowledge, context & ontology on the lakehouse

8.5内容质量

TL;DR · AI 摘要

数据治理不仅是安全控制,更是构建AI基础的关键,通过知识、上下文和本体论实现更高效、可信的AI模型。

核心要点

  • 数据治理的五个支柱(数据、AI、人员、产品、上下文)是构建AI基础的关键。
  • Unity Catalog和DEP通过现有治理工作,使AI模型更便宜且可信。
  • 数据目录作为语义存储,减少对昂贵LLM的依赖,提升模型效率。

结构提纲

按章节快速跳转。

  1. 数据治理不仅是安全控制,更是构建AI基础的关键。

  2. 数据目录作为语义存储,整合分类标签、模型卡等治理工件。

  3. DEP框架

    通过五个支柱(数据、AI、人员、产品、上下文)实现全面治理。

  4. Unity Catalog将治理转化为AI模型的基础,降低模型成本。

  5. 治理与AI协同,推动更高效、可信的AI发展。

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • 数据治理与AI协同
    • 五个治理支柱
      • 数据本身
      • AI模型
      • 人员
      • 产品
      • 共享上下文
    • 关键技术
      • Unity Catalog
      • DEP框架

金句 / Highlights

值得收藏与分享的关键句。

#数据治理#AI#Databricks#Lakehouse#Unity Catalog
打开原文

超越安全的治理:湖仓中的知识、上下文与本体论 | Databricks 博客

跳至主要内容

医疗与生命科学

2026年9月3日

超越安全的治理:湖仓中的知识、上下文与本体论

将治理工件视为语义内容,您已执行的审计工作将成为一流AI战略的基础——实现更低成本的模型与更高的可信度。

作者:Srikanth Mandalapu、Travis Paulson 和 Bernie Kuan

摘要

  • 大多数团队将治理工件视为合规负担——分类标签、去标识化策略、数据契约、模型卡片、血缘关系——实际上是企业数据语义的原材料;您已执行的审计工作将成为AI战略的基础。
  • 以目录为中心的智能体生命周期使AI代理能够基于精心策划的Unity Catalog元数据构建、测试、去标识化并部署,通过共享的人工审核关卡同时认证数据产品和代理。生产环境中的患者健康信息(PHI)永远不会离开治理边界。
  • 由于含义和上下文存储在目录而非更昂贵的LLM令牌中,更低成本的模型可以以更高的可信度满足大部分需求。

当问及大多数组织AI的数据治理意味着什么时,通常会得到安全相关的答案:严格管控、限制访问、通过审计。在医疗领域,安全是不可妥协的——但它是不完整的。安全只告诉您谁可以接触数据,却对数据的含义、是否可信,或AI模型是否应该从中学习保持沉默。

我们的数据赋能计划(DEP)基于不同的前提:治理是知识、上下文和本体论,而不仅仅是控制手段。大多数团队视为合规负担的工件(如分类标签、去标识化策略、模型卡片和数据契约)实际上是企业数据语义的原材料。

以这种方式看待问题,您不是在治理与AI之间做出选择,而是治理帮助构建AI。新的治理方法需要在AI时代实施。唯一的问题在于:您是等到后期仅为了通过审计才开展工作,还是现在就着手为AI奠定基础?

我们的目标是证明您已执行的安全和治理工作就是AI运行的基础。只要数据治理得当,AI就可以在更低成本的模型上运行并建立更高的可信度。

治理必须通过单一视角审视五大支柱

从每个治理工件都贡献于语义的视角开始。每个分类标签都是一个概念,每个模型卡片都是上下文,每个数据契约都是共享定义,每条血缘关系都是一个关联。以这种方式阅读,您已运行的安全堆栈就是本体论的初稿,而目录就是其存储位置。

随后,治理不再是一个单一概念,而是同一学科的五个维度:数据本身及其控制方式、基于数据构建的AI、需要理解数据的人、将数据带入业务的产品,以及将这四个方面联系在一起的共享上下文。这是同一视角,但从五个不同角度切入。

通过DEP,我们设想通过五大支柱实现语义:

  • 数据治理 —— 目录、质量、编目、血缘关系,内置安全与合规功能(如PII分类、访问控制、HIPAA/GDPR合规性及AI特定隐私风险)。
  • 知识(AI/ML)治理 —— 模型文档、治理及负责任的AI标准(如偏见与公平性、可解释性、人工监督及欧盟AI法案合规性)。
  • 数据素养 — 培训、自助服务赋能、从业者认证以及采用率、使用指标和项目投资回报率等关键绩效指标。
  • 数据管理 — 架构、数据工程和数据产品合同应包含模式协议、服务等级协议(SLA)与质量阈值,以及生产者/消费者义务。
  • 本体论 — 术语表、分类法、知识图谱,最终形成人工智能语义层。这包括大语言模型(LLM)的上下文、检索增强生成(RAG)的锚定基础,以及聊天查询的就绪状态。

通过代理实现愿景的落地

我们的五支柱愿景如果仅停留在幻灯片演示层面,而无法通过平台转化为实际运作,就毫无意义。当治理成果以结构化、机器可读的元数据形式存在时,它们就不再仅仅是文档,而是代理的执行指令集。

当我们提到“代理”时,我们从两个角度进行思考:一是“构建代理”,负责组装和交付数据产品;二是“分析代理”,在数据产品之上回答业务问题;每个代理都绑定到单一数据产品。

让我们从构建代理开始。构建代理自动化数据产品的交付生命周期,从源映射到ETL、测试、去标识化直至生产发布。它们所需的一切都以Unity Catalog中的治理元数据形式存在:源到目标映射、业务定义、分类层级、去标识化策略、数据合同和模型卡片。平台通过标签、注释、认证标志、血缘关系和术语表链接的术语进行推导。目录不仅是治理文档的存放地,更是代理执行操作的运行时环境。

每个代理都在一个循环中工作。它从目录中读取指令;执行一个具体任务,如生成流水线代码、运行测试套件、生成去标识化数据或部署认证数据集;然后将证据以测试结果、质量评分、血缘关系或变更捕获数据的形式写回目录。这个过程不断重复。

图1 — 以目录为中心的代理架构。Unity Catalog管理元数据。五个AI代理消耗这些元数据执行生命周期任务——ETL生成、测试、整理验证、去标识化、部署——并将结果写回目录。

在实践中,我们首先部署去标识化和测试代理。它们在前期消除最高风险和最繁重的手动工作。从回报最快的环节开始有助于早期建立动量。随着循环的持续进行,任何代理都不会对目录未描述的数据采取行动。

现代目录使这种模式具备可扩展性,因为它可以自动生成列和表描述供管理员批准,自动分类敏感字段,并在无需人工维护的情况下捕获列级血缘关系。人类角色从元数据的创建者转变为批准者,这正是人类应该从事的判断性工作。

数据与AI构建生命周期:证明与持续上下文

构建代理在端到端生命周期中运行,该生命周期旨在同时发布两项资产:受治理的数据产品(映射、整理、流水线)和在其之上运行的分析代理(语义层、提示配置、评估套件)。

这种方法标志着从以流水线为中心的工程(将数据从A点传输到B点)向以上下文为中心的工程(使数据对大语言模型(LLM)可理解且可操作)的根本转变。与仅验证代码质量不同,该生命周期中的关卡验证语义、上下文和所有权。

两个核心特性使该框架区别于传统软件开发生命周期(SDLC):

  • 它具备自动证明能力:可信性证明是交付过程的自然产物,而非事后拼凑的审计演练。
  • 持续优化上下文:生产环境行为会反馈到AgentOps循环中——将失败查询、幻觉集群和用户差评转化为下一次迭代的语义待办事项。

人类管理员作为这两项特性的责任层:代理提出建议,人类进行审批。虽然管理两个轨道上五个关卡看似会制造冗长的瓶颈,但大多数关卡可在数小时内完成审批。审批直接在标准开发工具中进行。自动化测试套件在工单创建前就附加数据质量结果、评估分数和血缘关系。正式的关卡会议是例外情况,用于调查而非标准操作流程。

图2. 数据与AI构建生命周期:双轨道、共享关卡、统一认证。一个生命周期中的双轨道:数据产品(轨道A)和基于它的AI代理或模型(轨道B)通过相同的五个关卡,获得统一的认证。

AI认证是关卡机制的核心驱动力

使这些关卡具有客观性而非任意性的机制是AI认证。直接记录在Unity Catalog中,该认证作为可查询的自动化评分表,而非人工法律证明。它在四个核心维度上管理发布资格:

  • 自动评分与人工评分:治理、质量和语义评分通过可查询的系统表、流水线结果和评估运行自动计算。所有权评分和最终部署印章需要明确的管理员签名。
  • 持续失效机制:认证是动态的。模式变更、合同更新或评估套件失败会立即撤销认证,直到重新运行并通过检查。
  • 数据层强制执行:访问控制通过数据层的基于属性的访问控制(ABAC)实现,而非应用层。如果用户无法在SQL中查询某行数据,任何代理都无法通过向量搜索或嵌入方式获取该数据。
  • 严格边界隔离:非生产环境(SIT、回归测试、模型测试)仅使用合成数据或去标识化数据。这确保生产环境的敏感健康信息(PHI)永远不会离开受控边界。

当代理出错时,由谁来修复?

认证和关卡机制证明了代理在发布时的可信性。但治理领导者关心的问题不是"它如何运作",而是"当它给出错误答案时,谁来负责?"答案必须是一个具体的人名,而非指导委员会。

为解决这个问题,每个分析代理(例如Databricks Genie代理)都绑定到一个特定的受控数据产品,并指定一个所有者。当代理因底层指标定义错误返回错误结果时,问题不属于AI工程团队,而是直接指向数据产品所有者,由其修正目录定义。将代理绑定到领域限定的认证数据产品也是提升准确性的最大杠杆:专注于查询认证元数据的代理,其表现优于在企业全范围内猜测的全局模型。

关键的是,这种共享的指标定义是强制执行的,而非仅仅记录在案。一旦在目录中定义了认证指标,回答代理就必须直接基于该指标进行计算。这将静态文档转化为主动的运行时逻辑。

问责机制得以实现,因为对AI的无监督操作设定了明确限制:任何代理在未有人类干预的情况下,均不得将代码部署到生产环境、修改策略或处理未分类数据。虽然认证评分会自动计算,但最终的发布关口始终需要人工签名。如果目录中未明确描述某个数据资产,系统将默认采取抑制措施,而非猜测。在运行时,这种“拒绝开放”的策略强制执行清晰的边界:

  • 对于分析代理:面对原始数据时,代理不会进行推测或推断上下文,而是明确拒绝回答,返回透明提示信息(例如:“此数据集缺乏处理请求所需的活跃认证或语义映射”)。
  • 对于构建代理:在流水线组装过程中,若检测到未分类的模式或缺失的合同,执行将自动中止,防止进入预发布环境,并记录未映射资产标志供管理员审查。

在纸面上定义这些防护措施很简单,但要在实践中落实,需要将模糊的治理委员会替换为四个明确且可问责的角色:

  • 数据产品负责人:对受管控产品的定义和质量负责。当回答出现错误时,他们是唯一联系人。
  • 数据与AI治理工程师:将政策转化为可执行的目录元数据(分类、合同、血缘关系),使规则在运行时生效,而非停留在PDF文档中。
  • 管理员:审查自动化发现结果并批准发布关口。自动化提出建议,管理员做出最终决定。
  • 安全/身份与访问管理:负责定义分类层级和访问属性,这些属性会自动驱动去标识化处理和行级权限分配。

在不损害安全性的前提下进行严格测试

我们描述的生命周期中隐藏着一个硬性前提条件:所有测试和评估阶段都需要真实数据进行验证——而在医疗保健领域,你无法使用真实PHI(个人健康信息)进行测试。因此,挑战转化为在任何地方都需要真实测试数据,同时又不损害安全性。

去标识化处理是保持数据分析价值和安全性的关键。去标识化代理从哪里获取知识?不是来自人工维护的电子表格,而是基于企业工具已生成的安全策略。流程分为三个步骤:

  • 发现 - 自动发现扫描器和信息安全策略引擎对敏感列和文件进行分类。
  • 策略制定 - 分类结果以策展后的策略元数据形式存入目录;代理读取这些策展信息并执行。
  • 执行 - 吞吐元数据,生成合成数据或去标识化源文件。符合HIPAA Safe Harbor规范,保持引用完整性,具备分析能力。

图3 — 去标识化代理:策展-策略-执行流程。策展-策略-执行流程:安全工具进行发现,目录按列策展去标识化策略,管理员批准后,代理执行——从元数据生成合成数据并去标识化源文件。任何未分类的内容将被抑制,直到有人类进行分类。

对于安全与IAM团队而言,这是一个双向通道。信息安全政策不再停留于PDF文档,而是转化为可执行的规则:分类层级和保留规则会自动驱动去标识化处理。作为回报,安全团队可以获得对敏感数据的持续更新视图、对新发现内容的封闭式保护机制,以及每次运行都会生成审计证据的残留扫描。访问模型从端到端保持一致。因为任何代理的数据检索都会继承查询用户的目录授权,RAG方法无法展示用户无权查看的行的嵌入表示。相同的ABAC规则适用于SQL和向量搜索,代理始终以查询用户的权限身份行动,而非特权服务账户。每个代理提示都会记录用于回答它的血缘信息,且遵循与数据本身相同的治理规范。

这才是真正的突破:一个统一的权限模型覆盖数据、模型、嵌入表示和审计轨迹——而非将数据目录缝合到独立的模型注册表,再缝合到独立的向量存储。治理工作成为AI的基础而非并行项目。

捕获指标,证明成果,赢得信任

注意整个生命周期一直在做的事情:每个阶段、每个关卡、每个认证都在生成指标。将四个认证维度整合为每个数据集的单一AI准备度评分,并使其具备可操作性而非仅停留在愿景层面。只有当每列都带有术语表链接的定义且表具有签署的数据合同,语义维度才能达到100%;只有当指定所有者响应问题时,所有权维度才能达到100%。

评分带来的结果构成了整个DEP项目的商业案例:指标证明了AI的成果,证据赢得信任,而信任正是将试点转化为日常使用的关键。没有任何业务用户会因为架构图优雅而采用代理。他们采用代理是因为上周的数字准确,且有负责人在数字不准确时进行了修正。评分解释了数字为何准确:评分越高,模型需要猜测的内容就越少。它不会推断列的含义、补偿重复项或幻觉连接——因为目录已经告诉它答案。

图4 — 数据准备度与模型支出。决定项目成败的对比:未受管控的数据集迫使前沿模型支出用于弥补缺失的语义和质量——但仍需猜测。经过认证的数据集可以让成本更低的模型在信任度更高的前提下完成报告和基础分析,因为智能存在于目录而非token账单中。

不要追逐模型头条,要追逐模型经济学

每周都会出现更大、更昂贵的模型。但 hype cycle 忽视了这一点:当目录已经提供了含义、质量和上下文时,模型无需再做这些。较小的或开源权重的模型足以满足治理数据的报告和分析需求。

前沿模型经常被用来掩盖底层元数据的缺陷。当模式和业务规则被明确记录在目录中时,更小的领域专用模型可以在不到1/10的token成本下实现相同的准确性。

这是一个成本与质量的权衡选择,而非质量上限。合理配置日常工作的模型规模,将前沿模型支出保留给真正需要的难题,成本就永远不会迫使AI暂停。修复数据。合理配置模型。保持准确性。这就是治理根基为AI战略带来的价值:不是更便宜的AI——而是无法阻挡的AI。

立即行动:从一个数据产品开始

不要一次性尝试全面的企业级改造。通过让一个数据产品完整经历生命周期来验证该模式:

  • 扫描:在单一目标模式上启用自动化发现扫描功能。
  • 定义:在Unity Catalog中为完整性、语义和质量设置明确的认证阈值。
  • 绑定:将一个分析代理与数据集绑定,并配备专用的评估套件和去标识化测试路径。
  • 指派:指定一位明确的数据产品负责人,对定义和问题解决负责。

当流程开始运转后,按一个认证数据产品为单位重复该过程。安全机制会告诉你可以访问数据的人是谁,但治理机制会告诉数据意味着什么,以及AI是否可以信任这些数据。

治理不是数据驱动型组织面前的闸门。如果实施得当,它应该是支撑组织的基石。

订阅最新文章

订阅我们的博客,将最新文章直接发送到你的邮箱。

立即注册

查看所有博客文章

slice-start id="_gatsby-scripts-1"

slice-end id="_gatsby-scripts-1"