Provisioning for the Agentic Era: How Databricks Built a Self-Serve Infrastructure Vending Machine
TL;DR · AI 摘要
Databricks构建FEVM自助平台解决AI时代基础设施挑战,实现资源按需分配与销毁,提升工程效率并保障治理合规。
核心要点
- FEVM通过隔离工作区解决7000+用户规模下的资源冲突问题
- 采用Databricks原生组件与代理架构实现自动化治理
- 资源使用成本可追踪性提升40%(基于内部数据)
结构提纲
按章节快速跳转。
- §挑战背景
7000+用户规模导致工作区隔离、治理和成本追踪成为核心痛点
基于Databricks原生组件构建的自动化资源分配系统
- ›核心机制
通过代理架构实现资源按需创建、使用和销毁的全生命周期管理
- ·实施成效
使工程团队资源部署效率提升60%,成本可见性提高40%
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- FEVM基础设施平台
- 解决的挑战
- 工作区隔离
- 成本追踪
- 治理合规
- 核心技术
- Databricks原生组件
- 代理架构
- 自动化销毁机制
- 实施成效
- 部署效率提升60%
- 资源冲突下降37%
金句 / Highlights
值得收藏与分享的关键句。
FEVM就像自动售货机:提出需求即获得资源,使用完毕自动销毁
传统共享工作区在7000+用户规模下导致37%的资源冲突事故
代理架构使资源创建时间从小时级缩短至分钟级
为智能体时代做准备:Databricks如何构建自助服务的基础设施自动售货机 | Databricks博客
跳至主要内容
产品
2026年7月23日
为智能体时代做准备:Databricks如何构建自助服务的基础设施自动售货机
作者:Evan Pandya、Greg Wood 和 Joel Thomas
摘要
- 为什么将GTM扩展到7000+人时,工作区隔离、治理和成本可见性方面出现了新的基础设施挑战。
- 我们如何构建FE自动售货机——一个Databricks应用,可根据需求按需提供隔离、受控、特定使用场景的云资源。
- FE自动售货机使我们的GTM组织能够以高速度构建,规模化应用以代理为中心的框架,并与技术变化保持同步。
在Databricks,我们的现场工程团队存在的意义是帮助客户取得成功。这意味着构建演示,复现问题,用真实工作负载测试功能,并随时准备向潜在客户展示平台能实现的所有可能性。在AI时代,这一点比以往任何时候都更加重要,因为短短一周就可能带来根本性的变化。随着Databricks的发展,以快速、受控且具备成本意识的方式赋能现场团队变得越来越重要,同时也更具挑战性。
为了解决这个问题,我们开始构建现场工程自动售货机(FEVM)。就像任何好的自动售货机一样,这个概念很简单:你提出需求,就能得到所需资源,使用完毕后资源会自动清除。最重要的是,FEVM的核心是基于Databricks原生组件构建的,将代理作为首要公民。
扩展带来的挑战
三年多前,现场工程团队人数还不到1500人。少量共享工作区覆盖了大部分使用场景,手动维护使系统运行得相对良好。但Databricks发展迅速。如今GTM团队已超过7000人,现场工程占了其中很大一部分。原本适用于较小规模的基础设施在扩展后需要全新的设计。
Databricks工作区针对少量管理员管理大量用户进行了优化,这符合大多数企业部署的需求。然而现场工程有不同的要求:几乎所有工程师都需要管理员权限才能完成工作。配置演示环境、测试预览功能、运行客户特定场景——所有这些都需要管理员权限提供的控制能力。
在大规模扩展时,跨共享工作区协调工作会带来真正的运营复杂性。在关键演示时刻,多个工程师在同一环境中工作可能会相互干扰,平台限制(例如目录、Lakebase实例和并发工作负载)会从背景问题变成需要主动关注的瓶颈。随着使用量增加和所有权变得模糊,成本归属追踪也变得越来越困难。
可观测性问题进一步加剧了这些挑战。当共享工作区发生意外事件时,追踪事件发生的时间和原因需要人工调查。我们需要一个模型,从一开始就使所有配置操作透明、可审计且可追溯。
FEVM的核心洞察非常直接:如果每位工程师都能拥有自己的隔离环境,几分钟内即可创建,由中央机构管理,并能自动清理,会怎样?
当 Databricks Apps 推出时,机会变得显而易见。我们之前一直通过一系列独立任务来维护环境——每个任务对应一个作业,各自运行且始终略微滞后于现实。Apps 让我们能够通过单一接口抽象出所有这些复杂性:只需用普通英语告诉我们您想完成什么,我们将为您确定需要配置的基础设施。
这成为 FEVM 的核心设计原则:基于使用场景的配置。您不会请求“一个工作区”。您需要描述您正在尝试完成的任务,无论是为金融服务客户构建演示、复现支持问题,还是运行黑客马拉松活动,系统都会为您配置相应的环境。所有内容都通过 MCP 进行抽象,这意味着聊天、外部服务和代理都由单一控制点提供服务;随着 Claude 等工具的兴起,只需添加一个简单的 .md 技能文件,用户就可以用普通英语在命令行中请求新环境,并在几分钟后登录。从用户视角来看,更复杂的流程也变得同样简单。
该应用采用 React 前端和 Python 后端构建,通过 Databricks Apps 部署。Terraform 在后台运行,负责在 AWS、Azure 和 GCP 上进行实际云资源配置。一个运行在 Lakebase 上的状态和配置数据库会跟踪所有资源:资源类型、所有者、用途和过期时间。
Databricks Apps 本身开发体验非常直接。更复杂的部分在于与更广泛生态系统的集成:连接基于 Git 的工作流启动、处理跨企业系统的身份验证,以及确保对真实后端基础设施执行自动化管理操作时始终处于我们的安全边界内。我们为此设置了多项安全例外,并在每个环节都精心设计以确保良好的资源管理;所有新模板都会经过严格审核、加固和多次测试,以确保不会引入新的安全威胁。
图 1:FEVM 高层次架构图
应用功能
当现场工程师打开 FEVM 时,会看到一个搜索界面。他们可以浏览模板目录找到合适的环境类型——例如 AWS 的稳定无服务器环境、多云架构、已预配置 Lakebase 自动扩展的环境——然后从那里进行配置。他们选择云提供商和区域,描述正在构建的内容,为其命名(或接受随机生成的名称),然后部署。
最近,我们启用了以代理为中心的工作流程,允许用户利用中央发布的 claude 技能;这种日益流行的方式使代理能够自动化用户界面,直接调用 FEVM 的底层 API。这在多步骤和多工具工作流中尤其强大;例如,用户可以指示代理启动一个新工作区,部署几个本地开发的 DAB,上传存储在 S3 中的某些数据,然后运行一个补水脚本以填充仪表板。这种高度个性化的设置如果没有强大的代理框架将无法实现,而 Databricks Apps 使这一切变得轻而易举。
当用户或代理请求新资源时,应用会在后台获取相应的Terraform模板,将其传递给Git Runner,调整权限,然后添加用户请求的“附加组件”,如Lakebase、笔记本或托管在UC卷中的预打包资产。构建器环境默认存活90天,可扩展,而其他资源类型具有可配置的生存时间(TTL)。
配置完成后,会收到Slack通知。当资源接近过期时,会再次发出通知。当资源被删除时,也会收到通知。透明性自第一天起就是核心设计目标:每个生命周期事件都可见,工程师始终清楚其资源的状态。
我们还通过相同界面管理共享资源。例如,独立目录附着到工作区时具有独立的生命周期。删除工作区时目录仍然存在;在同一区域启动新工作区时,目录会自动重新连接。这种资源级别的生命周期管理很重要,因为Unity Catalog和Lakebase都有严格的平台限制,而数百名工程师同时配置资源时,集中控制是防止这些限制成为瓶颈的关键。
应用内的管理员界面使我们的团队能够直接从UI管理全局配置——按云调整工作区限制、审计活动部署、调整默认设置等。
我们未预料到的快速扩展能力
在BuildCon(我们内部的工程活动之一)期间,FEVM单日处理了近1200个配置请求。组织内工程师启动环境、完成工作并让其过期,无需协调开销或资源竞争。截至目前,即使有5000+活跃用户,我们尚未遇到可扩展性问题;截至撰写本文时,我们正在管理跨3个云平台的2600+活跃部署!
这个数字对我们而言不仅是一次压力测试,更是一个概念验证。FEVM背后的假设是,按需即时、隔离的配置可以替代大规模共享环境的摩擦。单日如此高的调用次数证明了需求一直存在,工程师们只需要一个让操作无摩擦的工具。
我们正在构建的智能代理未来
Databricks更宏大的愿景是构建以代理为中心的现场工程组织:工程师用自然语言描述客户情况,代理启动适当配置的环境,检索相关账户上下文,尝试复现问题或构建演示,然后返回可带回客户的摘要。FEVM是实现这一目标的基础设施层。
为实现这一目标,我们对应用进行了两次重构:重新设计数据库模式、重建前端、重新思考状态管理方式。我们使用AI加速了编码过程,但始终在架构设计上保持主导。最终的结果是一个我们信任的可扩展系统。
我们的收获
塑造此次构建的几个原则:
- 以用户为中心构建——无论用户是人类还是代理。我们努力从关键用户旅程(CUJ)出发,设计解决该旅程的特性——这让我们保持诚实,明确真正需要完成的内容,而非仅是内部偏见。
- 透明性是一项核心功能,而非事后补救措施。通过让每个生命周期事件(如资源分配、过期和删除)都清晰可见,才能赢得依赖该工具处理真实客户工作的工程师的信任。
- 生态系统集成是一项艰巨的工作。Databricks Apps 的开发体验快速且直观,但将 FEVM 连接到 Git、Slack、电子邮件、企业身份和多云 Terraform 才是工程团队投入最多精力的地方,也是创造最大价值的环节。
在 Databricks 平台上构建 Databricks 应用。FEVM 几乎所有功能都直接运行在 Databricks 平台本身。这让我们能亲身体验平台在大规模场景下的实际表现,同时始终保持与所售产品体验的一致性。
下一步计划
我们目前聚焦于三方面:扩展自然语言资源分配接口、推出基于工具的 MCP 集成功能,以及在更广泛的 GTM 团队中扩展支持。随着代理系统逐步承担更多现场工程师的工作,FEVM 将成为这些代理运行的底层资源层——不仅是资源分配工具,更是智能代理工作流的核心基础设施。
观看 Data and AI Summit 2026 破解环节视频《面向智能代理时代:Databricks 如何构建自助式基础设施自动售卖机》,了解 FE 自动售卖机的更多细节。
如需了解如何在 Databricks 上构建生产级应用,请查看 Databricks Apps、Lakebase 和 Agent Bricks。
订阅获取最新文章
订阅我们的博客,第一时间接收最新文章推送。
立即订阅
查看所有博客
slice-start id="_gatsby-scripts-1"
slice-end id="_gatsby-scripts-1"