Databricks

Introducing Feature Views

8.5内容质量

TL;DR · AI 摘要

Databricks推出Feature Views,通过统一定义特征逻辑消除训练/服务偏差,实现高效实时推理。

核心要点

  • Feature Views通过单一定义消除训练/服务偏差,提升模型性能。
  • 支持批处理和流式数据源,简化实时推理管道。
  • 与Unity Catalog集成,实现特征治理和追踪。

结构提纲

按章节快速跳转。

  1. 介绍Feature Views及其解决的实时ML挑战。

  2. 单一特征定义同时支持历史数据和实时推理

  3. 消除训练/服务偏差,减少基础设施复杂性。

  4. 展示批处理与流式数据源的转换代码。

  5. 欺诈检测、个性化推荐等场景的适用性。

  6. 公共预览版的发布和生态扩展。

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • Feature Views
    • 核心机制
      • 单一定义统一处理历史/实时数据
    • 优势
      • 消除训练/服务偏差
      • 简化基础设施
      • 治理集成
    • 用例
      • 欺诈检测
      • 个性化推荐

金句 / Highlights

值得收藏与分享的关键句。

#机器学习#特征工程#Databricks#实时推理
打开原文

介绍 Feature Views | Databricks 博客

跳过导航到主要内容

公告

2026年7月10日

介绍 Feature Views

一种更简单、受托管的方式来构建、服务和治理机器学习特征

作者:Nick Joung、Ian Ackerman 和 Julia Powell

摘要

  • 是什么:Feature Views 是一个受托管框架,用于一次性定义机器学习特征并在所有场景中使用——相同的定义既可为实验和训练提供历史数据,也可为批量或实时推理的生产流水线提供支持。
  • 解决的挑战:实时机器学习的生产化。在笔记本中使用特征进行实验,通过几次 API 调用即可快速实现生产化。消除训练/服务偏差、重复的特征代码,以及使机器学习难以扩展的脆弱自托管流处理和在线存储基础设施。
  • 结果:特征成为受管控的 Unity Catalog 对象,由受托管流水线生成,实时特征的端到端 p99 延迟低至 200 毫秒。

在理想世界中,机器学习特征只需构建一次。但对许多团队而言,即使在笔记本中能正常工作的特征仍会演变为重复的逻辑、脆弱的流水线、一次性回填、在线存储的复杂实现以及治理开销。对于欺诈检测、个性化和推荐等实时用例,这种复杂性会进一步加剧,因为模型需要依赖最新信号才能做出准确预测。常见挑战包括:

  • 在实时和历史训练中重复实现特征逻辑
  • 训练/服务偏差导致模型性能下降
  • 跨用例发现和复用特征
  • 将具有大规模历史回溯的特征回填到在线存储
  • 在大规模下维护复杂的生产基础设施
  • 跨组件和流水线治理和追踪血缘关系

Databricks 非常高兴宣布 Feature Views 的公开预览版,这是一个可在 Databricks 内直接创建受托管特征流水线的框架。通过 Feature Views,您只需定义一次特征,平台将负责从实验到实时服务的全流程。

什么是 Feature Views?

Feature View 是一个简单而强大的抽象,贯穿整个机器学习生命周期。数据科学家或机器学习工程师定义特征逻辑——数据源、实体、时间序列列和计算方式。基于这一定义,Databrick 的特征存储会生成用于实验和训练的历史、点时间准确数据。当准备就绪时,用户将 Feature View 实例化,Databricks 会运行计算特征数据的流水线以实现高效推理。

相同的特征定义可支持批量和流式数据源。批量和流式数据源的实验和生产化流程完全一致。从批量数据源切换到流式数据源只需修改几行代码。

以下是相同特征视图定义,分别以流式和批量特征运行的示例。

数亿旅行者的更好推荐始于更强大的功能。Feature Views 显著减少了我们的特征代码——数据科学家可以更高效地工作,专注于提升旅行者价值的核心因素,而非如何计算这些特征。——Skyscanner 数据高级总监 Jules Marshall

2. 用于实验的 Genie 代码

通过 Feature Engineering Client SDK 和 Genie 代码,可以快速便捷地开始构建。SDK 使数据科学家能够在笔记本中轻松声明特征,即时在历史数据上正确计算特征,并组装出时间点精确的训练集。

由于 Databricks 在单一环境中整合了特征定义、特征数据、模型训练和 MLflow,数据科学家可以在同一个笔记本中直接从特征想法过渡到模型实验。

借助 Genie 代码,团队可以使用 Feature Views 运行一次性模型实验工作流:识别合适的数据源、生成特征想法,并在单一笔记本中对模型和数据进行实验。

3. 无需运维的生产级流水线

当特征准备就绪用于生产时,在 Unity Catalog 中注册该特征并调用 materialize_features。Databricks 将为您创建并管理流水线,将数据写入合适的在线和离线存储。

生产级意味着高质量数据、可扩展的基础设施和关键任务级的可靠性。Feature Views 在后台协调经过实战验证的 GA 产品(如 Lakebase 和 RTM),优化组件协作方式以支持特征服务工作负载。边缘情况开箱即用,例如自动回填长窗口、流式特征或从在线存储中过期陈旧行。

$

/$

4. 需要时的实时新鲜度

对于需要每个新事件立即影响模型服务值的使用场景,Feature Views 支持来自 Kafka 的流式特征,实现从事件到在线可用性的端到端 p99 延迟 200 毫秒。RollingWindow 以毫秒级精度从每个事件的时间戳向后回溯,因此像“过去 10 分钟交易总额”这样的聚合值始终是实时的。

在底层,Databricks 协调了实现这一速度的组件:Spark Realtime Mode 持续处理事件并按事件更新滚动聚合,而非等待微批次;Lakebase 作为优化流式处理的在线存储,最小化频繁小规模更新的写入放大;Model Serving 在推理时检索特征。您只需编写滚动窗口特征——平台会为您构建流水线。

5. 在 Unity Catalog 中受管控,平台内全面集成

特征数据应像数据一样受到管控。在 Databricks 中,Feature Views 是 Unity Catalog 的一等公民对象——可被发现、访问控制,并具有完整的血缘追踪。特征与模型打包在一起:当您使用 MLflow 登记模型时,其特征依赖关系会被记录,推理时 Model Serving 会自动查找所需特征——无需自定义查找代码,无需手动连接。结合 MLflow、Model Serving 和 Genie 代码,Feature Views 使 Databricks 成为开发、部署和管控整个机器学习堆栈的单一平台。

Genie Code 与 Feature Views 原生集成,使数据科学家能够通过简单提示构建和迭代特征。只需让 Genie 将新特征添加到笔记本中,Genie Code 即可基于 Databricks 中已有的数据和治理规则,生成符合上下文的代码。

团队使用 Feature Views 的方式

  • 金融服务团队使用 RollingWindow 流式特征,以亚秒级交易信号进行欺诈检测。
  • 个性化和推荐团队捕获用户当前会话中的最新意图以提升参与度,同时复用相同定义进行离线模型训练。
  • 平台团队将原本碎片化的特征管道整合为受控的 Unity Catalog 对象,消除了自建在线存储和流处理器的操作负担。

入门指南

只需让 Genie 使用 Feature Views 构建新实验即可开始:

  • 帮助你定义特征、分析数据集重要性、构建训练集
  • 准备生产时注册并固化特征(流式固化需要 Lakebase 支持区域的企业版工作区)

了解更多请查阅文档:

  • [阅读 Feature Views 文档](#) 定义你的首个特征
  • [尝试 Feature Views 快速入门笔记本](#) 立即上手代码
  • [查看 Feature Views 模型训练文档](#) 了解完整的训练和服务工作流

Feature Views 让你只需定义一次特征,即可在实验、批量和实时服务中复用——无需管理底层基础设施。将现有批量特征转化为毫秒级实时特征,看看信号强度提升多少,让 Databricks 运行实现这一目标的管道。

如果你希望解决这类问题,我们正在招聘。

订阅最新动态

订阅我们的博客,获取最新文章直送邮箱。

立即订阅

[查看所有博客](#)

slice-start id="_gatsby-scripts-1"

slice-end id="_gatsby-scripts-1"