Introducing Feature Views
TL;DR · AI 摘要
Databricks推出Feature Views,通过统一定义特征逻辑消除训练/服务偏差,实现高效实时推理。
核心要点
- Feature Views通过单一定义消除训练/服务偏差,提升模型性能。
- 支持批处理和流式数据源,简化实时推理管道。
- 与Unity Catalog集成,实现特征治理和追踪。
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- Feature Views
- 核心机制
- 单一定义统一处理历史/实时数据
- 优势
- 消除训练/服务偏差
- 简化基础设施
- 治理集成
- 用例
- 欺诈检测
- 个性化推荐
金句 / Highlights
值得收藏与分享的关键句。
Feature Views通过单一定义消除训练/服务偏差,提升模型性能。
支持批处理和流式数据源,简化实时推理管道。
与Unity Catalog集成,实现特征治理和追踪。
介绍 Feature Views | Databricks 博客
跳过导航到主要内容
公告
2026年7月10日
介绍 Feature Views
一种更简单、受托管的方式来构建、服务和治理机器学习特征
作者:Nick Joung、Ian Ackerman 和 Julia Powell
摘要
- 是什么:Feature Views 是一个受托管框架,用于一次性定义机器学习特征并在所有场景中使用——相同的定义既可为实验和训练提供历史数据,也可为批量或实时推理的生产流水线提供支持。
- 解决的挑战:实时机器学习的生产化。在笔记本中使用特征进行实验,通过几次 API 调用即可快速实现生产化。消除训练/服务偏差、重复的特征代码,以及使机器学习难以扩展的脆弱自托管流处理和在线存储基础设施。
- 结果:特征成为受管控的 Unity Catalog 对象,由受托管流水线生成,实时特征的端到端 p99 延迟低至 200 毫秒。
在理想世界中,机器学习特征只需构建一次。但对许多团队而言,即使在笔记本中能正常工作的特征仍会演变为重复的逻辑、脆弱的流水线、一次性回填、在线存储的复杂实现以及治理开销。对于欺诈检测、个性化和推荐等实时用例,这种复杂性会进一步加剧,因为模型需要依赖最新信号才能做出准确预测。常见挑战包括:
- 在实时和历史训练中重复实现特征逻辑
- 训练/服务偏差导致模型性能下降
- 跨用例发现和复用特征
- 将具有大规模历史回溯的特征回填到在线存储
- 在大规模下维护复杂的生产基础设施
- 跨组件和流水线治理和追踪血缘关系
Databricks 非常高兴宣布 Feature Views 的公开预览版,这是一个可在 Databricks 内直接创建受托管特征流水线的框架。通过 Feature Views,您只需定义一次特征,平台将负责从实验到实时服务的全流程。
什么是 Feature Views?
Feature View 是一个简单而强大的抽象,贯穿整个机器学习生命周期。数据科学家或机器学习工程师定义特征逻辑——数据源、实体、时间序列列和计算方式。基于这一定义,Databrick 的特征存储会生成用于实验和训练的历史、点时间准确数据。当准备就绪时,用户将 Feature View 实例化,Databricks 会运行计算特征数据的流水线以实现高效推理。
相同的特征定义可支持批量和流式数据源。批量和流式数据源的实验和生产化流程完全一致。从批量数据源切换到流式数据源只需修改几行代码。
以下是相同特征视图定义,分别以流式和批量特征运行的示例。
数亿旅行者的更好推荐始于更强大的功能。Feature Views 显著减少了我们的特征代码——数据科学家可以更高效地工作,专注于提升旅行者价值的核心因素,而非如何计算这些特征。——Skyscanner 数据高级总监 Jules Marshall
2. 用于实验的 Genie 代码
通过 Feature Engineering Client SDK 和 Genie 代码,可以快速便捷地开始构建。SDK 使数据科学家能够在笔记本中轻松声明特征,即时在历史数据上正确计算特征,并组装出时间点精确的训练集。
由于 Databricks 在单一环境中整合了特征定义、特征数据、模型训练和 MLflow,数据科学家可以在同一个笔记本中直接从特征想法过渡到模型实验。
借助 Genie 代码,团队可以使用 Feature Views 运行一次性模型实验工作流:识别合适的数据源、生成特征想法,并在单一笔记本中对模型和数据进行实验。
3. 无需运维的生产级流水线
当特征准备就绪用于生产时,在 Unity Catalog 中注册该特征并调用 materialize_features。Databricks 将为您创建并管理流水线,将数据写入合适的在线和离线存储。
生产级意味着高质量数据、可扩展的基础设施和关键任务级的可靠性。Feature Views 在后台协调经过实战验证的 GA 产品(如 Lakebase 和 RTM),优化组件协作方式以支持特征服务工作负载。边缘情况开箱即用,例如自动回填长窗口、流式特征或从在线存储中过期陈旧行。
$
/$
4. 需要时的实时新鲜度
对于需要每个新事件立即影响模型服务值的使用场景,Feature Views 支持来自 Kafka 的流式特征,实现从事件到在线可用性的端到端 p99 延迟 200 毫秒。RollingWindow 以毫秒级精度从每个事件的时间戳向后回溯,因此像“过去 10 分钟交易总额”这样的聚合值始终是实时的。
在底层,Databricks 协调了实现这一速度的组件:Spark Realtime Mode 持续处理事件并按事件更新滚动聚合,而非等待微批次;Lakebase 作为优化流式处理的在线存储,最小化频繁小规模更新的写入放大;Model Serving 在推理时检索特征。您只需编写滚动窗口特征——平台会为您构建流水线。
5. 在 Unity Catalog 中受管控,平台内全面集成
特征数据应像数据一样受到管控。在 Databricks 中,Feature Views 是 Unity Catalog 的一等公民对象——可被发现、访问控制,并具有完整的血缘追踪。特征与模型打包在一起:当您使用 MLflow 登记模型时,其特征依赖关系会被记录,推理时 Model Serving 会自动查找所需特征——无需自定义查找代码,无需手动连接。结合 MLflow、Model Serving 和 Genie 代码,Feature Views 使 Databricks 成为开发、部署和管控整个机器学习堆栈的单一平台。
Genie Code 与 Feature Views 原生集成,使数据科学家能够通过简单提示构建和迭代特征。只需让 Genie 将新特征添加到笔记本中,Genie Code 即可基于 Databricks 中已有的数据和治理规则,生成符合上下文的代码。
团队使用 Feature Views 的方式
- 金融服务团队使用 RollingWindow 流式特征,以亚秒级交易信号进行欺诈检测。
- 个性化和推荐团队捕获用户当前会话中的最新意图以提升参与度,同时复用相同定义进行离线模型训练。
- 平台团队将原本碎片化的特征管道整合为受控的 Unity Catalog 对象,消除了自建在线存储和流处理器的操作负担。
入门指南
只需让 Genie 使用 Feature Views 构建新实验即可开始:
- 帮助你定义特征、分析数据集重要性、构建训练集
- 准备生产时注册并固化特征(流式固化需要 Lakebase 支持区域的企业版工作区)
了解更多请查阅文档:
- [阅读 Feature Views 文档](#) 定义你的首个特征
- [尝试 Feature Views 快速入门笔记本](#) 立即上手代码
- [查看 Feature Views 模型训练文档](#) 了解完整的训练和服务工作流
Feature Views 让你只需定义一次特征,即可在实验、批量和实时服务中复用——无需管理底层基础设施。将现有批量特征转化为毫秒级实时特征,看看信号强度提升多少,让 Databricks 运行实现这一目标的管道。
如果你希望解决这类问题,我们正在招聘。
订阅最新动态
订阅我们的博客,获取最新文章直送邮箱。
立即订阅
[查看所有博客](#)
slice-start id="_gatsby-scripts-1"
slice-end id="_gatsby-scripts-1"