Building for the AI Era: Lakebase, Streaming, and Lakehouse Innovations at VLDB 2026
TL;DR · AI 摘要
Databricks在VLDB 2026展示Lakebase等创新,该架构通过存储计算分离支持AI代理,提升数据库性能与灵活性。
核心要点
- Lakebase通过存储计算分离实现亚秒级冷启动和Git式分支操作
- Structured Streaming微批处理架构支持百万级周任务的可扩展性
- LTAP范式统一事务与分析处理,降低AI代理工作负载延迟
结构提纲
按章节快速跳转。
- §引言
Databricks在VLDB 2026展示三大数据库创新方向
第三代云数据库通过存储计算分离支持AI代理工作负载
Structured Streaming十年优化实现百万级任务可扩展性
统一事务与分析处理的新架构降低数据处理延迟
自动优化技术提升数据湖分析效率
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- 数据库创新与AI时代
- Lakebase架构
- 存储计算分离
- Git式分支操作
- 云对象存储集成
- Streaming演进
- 微批处理架构
- 百万级任务支持
- 精确一次语义
- LTAP范式
- 事务分析统一
- 低延迟处理
- AI代理优化
金句 / Highlights
值得收藏与分享的关键句。
Lakebase实现存储计算分离,数据直接持久化在云对象存储中
微批处理架构相比其他设计具有可扩展性、容错性和精确一次语义
LTAP范式通过统一处理降低AI代理工作负载的延迟和复杂度
为AI时代构建:VLDB 2026上Lakebase、流处理与湖仓一体创新 | Databricks博客
跳至主要内容
公司
2026年8月27日
为AI时代构建:VLDB 2026上的Lakebase、流处理与湖仓一体创新
作者:Indrajit Roy 和 Ippokratis Pandis
摘要
- 了解Databricks在Lakebase、结构化流处理和湖仓一体优化方面的创新
- 探索Lakebase如何满足智能代理工作流需求(Lakebase作为第三代云数据库,将事务处理计算与存储解耦)
- 了解我们在VLDB的工程团队与招聘团队
我们即将前往VLDB 2026,分享多项驱动Databricks平台的创新技术。Databricks联合创始人兼首席架构师Reynold Xin将通过主题演讲开启大会。Databricks有四篇论文被VLDB 2026接受,涉及Lakebase、Spark结构化流处理和自动湖仓优化。酶(Enzyme)引擎的演示论文将展示我们如何增量维护物化视图。以下是这些演讲的预览。
主题演讲:数据库工程的三个黄金时代
Databricks联合创始人Reynold Xin将探讨AI代理如何开启数据库工程的"第三个黄金时代"。部分读者可能还记得他在2012年于伯克利开发的可扩展分析系统Shark。Reynold将回顾自己从伯克利时期至今在数据库技术认知上的演变,包括湖仓架构的兴起,以及事务处理与分析引擎的最新需求变化。他将介绍两种新范式来满足AI代理需求:(1) Lakebase,将存储与计算分离应用于OLTP数据库;(2) LTAP(湖事务分析处理),统一事务处理与分析处理。
Lakebase:基于开放数据湖的无服务器PostgreSQL
AI代理工作负载正在创造独特的使用模式,例如数百万个短暂且深度分支的数据库。传统OLTP引擎是单体架构,无法满足这些挑战性需求。Stas Kelvich将介绍Lakebase架构,这是第三代云数据库架构。Lakebase通过将无服务器PostgreSQL计算与存储解耦,直接使用开放格式在云对象存储中持久化数据和预写日志,从而满足智能代理工作流需求。Lakebase不仅提供亚秒级冷启动性能,还通过写时复制分支实现高效的类似Git的数据库工作流。此外,凭借其计算-存储分离架构,它能够对实时事务数据进行低延迟分析。图1展示了Lakebase如何开启第三代云数据库时代。
图1:Lakebase Postgres非常适合智能代理时代,构建在开放数据湖之上。
Apache Spark结构化流处理十年演进:我们如何通过架构演进满足实际需求
结构化流处理在 Databricks 每周支持数百万个作业。它采用独特的微批次处理架构,相比其他设计具有可扩展性、容错性和精确一次语义等优势。然而,为了满足真实客户的需求并达到当前的规模,结构化流处理需要许多创新。董思颖将介绍流处理架构多年来的演进历程——微批次流水线技术使吞吐量提升了高达 3 倍,新的有状态 API 让复杂业务逻辑的表达更加便捷,系统现在还支持细粒度访问控制。
AutoLiquid:面向 Databricks 湖仓一体架构的自主数据布局优化
按键对表进行聚类可以显著提升查询性能。然而,在数百万个湖仓一体表中手动选择最佳聚类键并不具备可扩展性。张云嘉将介绍 AutoLiquid 如何通过简单的 CLUSTER BY AUTO 原语实现这一生命周期的自动化。AutoLiquid 结合键选择启发式算法和高效的影子验证技术,对数百万张表进行聚类。借助这些技术,AutoLiquid 在超过 95% 的评估工作负载中,性能优于客户选择的聚类键。
Ultron:Databricks 的基于历史的查询优化
如果优化器能近乎完美地了解数据,湖仓一体查询的延迟将显著降低。Ultron 是一个基于历史的查询优化框架,它利用分析型工作负载的重复性特性来改进优化器决策,例如选择连接操作符的类型。梁 Eric 将介绍 Ultron 的架构,包括其如何高效存储历史记录并管理执行查询的日志。Ultron 显著提升了生产环境工作负载的性能,包括将连接操作的中位数延迟降低了 25%。
除了这四篇论文,欢迎参加 Yuhong Chen 演示 Enzyme 的环节,这是我们为数据工程工作负载设计的增量视图维护引擎。
原生智能数据基础设施:LakehouseRT、Lakebase 与 LTAP(赞助商演讲) Databricks 是 VLDB 2026 的金牌赞助商。Ippokratis Pandis 将发表 Databricks 赞助商演讲,介绍 Databricks 如何演进其系统架构以适应自主智能代理循环。基于此,我们将介绍 LakehouseRT。LakehouseRT 由新的 Reyden 引擎驱动,专为在开放湖存储上直接进行实时低延迟分析而设计。Lakebase 与 LakehouseRT 的结合为构建首个真正的湖事务分析处理(LTAP)系统奠定了基础。
在 VLDB 2026 与团队见面
欢迎莅临 Databricks 展位,与我们的工程和研究团队交流,讨论我们的论文,并与我们的招聘人员对话。
订阅博客获取最新文章
订阅我们的博客,将最新文章直接发送到您的邮箱。
立即订阅
查看所有博客
slice-start id="_gatsby-scripts-1"
slice-end id="_gatsby-scripts-1"