Databricks

Building for the AI Era: Lakebase, Streaming, and Lakehouse Innovations at VLDB 2026

8.5内容质量

TL;DR · AI 摘要

Databricks在VLDB 2026展示Lakebase等创新,该架构通过存储计算分离支持AI代理,提升数据库性能与灵活性。

核心要点

  • Lakebase通过存储计算分离实现亚秒级冷启动和Git式分支操作
  • Structured Streaming微批处理架构支持百万级周任务的可扩展性
  • LTAP范式统一事务与分析处理,降低AI代理工作负载延迟

结构提纲

按章节快速跳转。

  1. Databricks在VLDB 2026展示三大数据库创新方向

  2. ·Lakebase架构

    第三代云数据库通过存储计算分离支持AI代理工作负载

  3. Structured Streaming十年优化实现百万级任务可扩展性

  4. ·LTAP范式

    统一事务与分析处理的新架构降低数据处理延迟

  5. 自动优化技术提升数据湖分析效率

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • 数据库创新与AI时代
    • Lakebase架构
      • 存储计算分离
      • Git式分支操作
      • 云对象存储集成
    • Streaming演进
      • 微批处理架构
      • 百万级任务支持
      • 精确一次语义
    • LTAP范式
      • 事务分析统一
      • 低延迟处理
      • AI代理优化

金句 / Highlights

值得收藏与分享的关键句。

#Lakebase#Structured Streaming#Lakehouse#云数据库#AI代理
打开原文

为AI时代构建:VLDB 2026上Lakebase、流处理与湖仓一体创新 | Databricks博客

跳至主要内容

公司

2026年8月27日

为AI时代构建:VLDB 2026上的Lakebase、流处理与湖仓一体创新

作者:Indrajit Roy 和 Ippokratis Pandis

摘要

  • 了解Databricks在Lakebase、结构化流处理和湖仓一体优化方面的创新
  • 探索Lakebase如何满足智能代理工作流需求(Lakebase作为第三代云数据库,将事务处理计算与存储解耦)
  • 了解我们在VLDB的工程团队与招聘团队

我们即将前往VLDB 2026,分享多项驱动Databricks平台的创新技术。Databricks联合创始人兼首席架构师Reynold Xin将通过主题演讲开启大会。Databricks有四篇论文被VLDB 2026接受,涉及Lakebase、Spark结构化流处理和自动湖仓优化。酶(Enzyme)引擎的演示论文将展示我们如何增量维护物化视图。以下是这些演讲的预览。

主题演讲:数据库工程的三个黄金时代

Databricks联合创始人Reynold Xin将探讨AI代理如何开启数据库工程的"第三个黄金时代"。部分读者可能还记得他在2012年于伯克利开发的可扩展分析系统Shark。Reynold将回顾自己从伯克利时期至今在数据库技术认知上的演变,包括湖仓架构的兴起,以及事务处理与分析引擎的最新需求变化。他将介绍两种新范式来满足AI代理需求:(1) Lakebase,将存储与计算分离应用于OLTP数据库;(2) LTAP(湖事务分析处理),统一事务处理与分析处理。

Lakebase:基于开放数据湖的无服务器PostgreSQL

AI代理工作负载正在创造独特的使用模式,例如数百万个短暂且深度分支的数据库。传统OLTP引擎是单体架构,无法满足这些挑战性需求。Stas Kelvich将介绍Lakebase架构,这是第三代云数据库架构。Lakebase通过将无服务器PostgreSQL计算与存储解耦,直接使用开放格式在云对象存储中持久化数据和预写日志,从而满足智能代理工作流需求。Lakebase不仅提供亚秒级冷启动性能,还通过写时复制分支实现高效的类似Git的数据库工作流。此外,凭借其计算-存储分离架构,它能够对实时事务数据进行低延迟分析。图1展示了Lakebase如何开启第三代云数据库时代。

图1:Lakebase Postgres非常适合智能代理时代,构建在开放数据湖之上。

Apache Spark结构化流处理十年演进:我们如何通过架构演进满足实际需求

结构化流处理在 Databricks 每周支持数百万个作业。它采用独特的微批次处理架构,相比其他设计具有可扩展性、容错性和精确一次语义等优势。然而,为了满足真实客户的需求并达到当前的规模,结构化流处理需要许多创新。董思颖将介绍流处理架构多年来的演进历程——微批次流水线技术使吞吐量提升了高达 3 倍,新的有状态 API 让复杂业务逻辑的表达更加便捷,系统现在还支持细粒度访问控制。

AutoLiquid:面向 Databricks 湖仓一体架构的自主数据布局优化

按键对表进行聚类可以显著提升查询性能。然而,在数百万个湖仓一体表中手动选择最佳聚类键并不具备可扩展性。张云嘉将介绍 AutoLiquid 如何通过简单的 CLUSTER BY AUTO 原语实现这一生命周期的自动化。AutoLiquid 结合键选择启发式算法和高效的影子验证技术,对数百万张表进行聚类。借助这些技术,AutoLiquid 在超过 95% 的评估工作负载中,性能优于客户选择的聚类键。

Ultron:Databricks 的基于历史的查询优化

如果优化器能近乎完美地了解数据,湖仓一体查询的延迟将显著降低。Ultron 是一个基于历史的查询优化框架,它利用分析型工作负载的重复性特性来改进优化器决策,例如选择连接操作符的类型。梁 Eric 将介绍 Ultron 的架构,包括其如何高效存储历史记录并管理执行查询的日志。Ultron 显著提升了生产环境工作负载的性能,包括将连接操作的中位数延迟降低了 25%。

除了这四篇论文,欢迎参加 Yuhong Chen 演示 Enzyme 的环节,这是我们为数据工程工作负载设计的增量视图维护引擎。

原生智能数据基础设施:LakehouseRT、Lakebase 与 LTAP(赞助商演讲) Databricks 是 VLDB 2026 的金牌赞助商。Ippokratis Pandis 将发表 Databricks 赞助商演讲,介绍 Databricks 如何演进其系统架构以适应自主智能代理循环。基于此,我们将介绍 LakehouseRT。LakehouseRT 由新的 Reyden 引擎驱动,专为在开放湖存储上直接进行实时低延迟分析而设计。Lakebase 与 LakehouseRT 的结合为构建首个真正的湖事务分析处理(LTAP)系统奠定了基础。

在 VLDB 2026 与团队见面

欢迎莅临 Databricks 展位,与我们的工程和研究团队交流,讨论我们的论文,并与我们的招聘人员对话。

订阅博客获取最新文章

订阅我们的博客,将最新文章直接发送到您的邮箱。

立即订阅

查看所有博客

slice-start id="_gatsby-scripts-1"

slice-end id="_gatsby-scripts-1"