Databricks and NVIDIA: Building for the Agentic Era
TL;DR · AI 摘要
Databricks与NVIDIA合作,将NVIDIA GPU、Vera CPU和智能体AI工具集成到Databricks平台,加速企业级AI开发。
核心要点
- Databricks AI Runtime支持NVIDIA Hopper GPU和Quantum InfiniBand网络,用于多节点分布式训练。
- NVIDIA Vera CPU将用于下一代智能体基础设施,提升企业AI性能。
- Databricks平台集成NVIDIA Agent Toolkit,加速智能体AI开发。
结构提纲
按章节快速跳转。
- §引言
Databricks与NVIDIA深化合作,推动企业级AI平台发展。
NVIDIA加速计算技术支持Databricks平台上的大规模AI训练和推理。
Databricks AI Runtime利用NVIDIA GPU加速模型训练和微调。
NVIDIA Vera CPU将用于下一代智能体基础设施,提升AI性能。
Databricks与NVIDIA合作,提供针对医疗、供应链等行业的AI解决方案。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- Databricks与NVIDIA合作
- AI平台加速
- NVIDIA GPU支持
- Vera CPU支持
- Quantum InfiniBand网络
- 行业解决方案
- 医疗
- 供应链
- 机器人
金句 / Highlights
值得收藏与分享的关键句。
Databricks AI Runtime支持NVIDIA Hopper GPU和Quantum InfiniBand网络,用于多节点分布式训练。
NVIDIA Vera CPU将用于下一代智能体基础设施,提升企业AI性能。
Databricks平台集成NVIDIA Agent Toolkit,加速智能体AI开发。
Databricks 与 NVIDIA:为智能代理时代构建平台 | Databricks 博客
跳至主要内容
合作伙伴
2026 年 6 月 17 日
Databricks 与 NVIDIA:为智能代理时代构建平台
扩展合作,将 NVIDIA GPU、新的 Vera CPU 和智能代理 AI 工具引入 Databricks 平台。
作者:唐涵林 和 Sundaresan Tejas
摘要
- Databricks 与 NVIDIA 正在扩展合作,打造一个端到端的 AI 平台,以加速在受控企业数据上进行模型训练、推理和智能代理 AI 开发。
- 新功能包括 AI Runtime 中的多节点训练、Databricks 免费版中的 GPU 支持、模型服务增强功能,以及对 NVIDIA 技术(如 NVIDIA Agent Toolkit)的支持。
- 客户可以直接在 Databricks 中利用 NVIDIA 的行业专用 AI 框架,以加速医疗保健、生命科学、供应链、机器人、数字孪生和文档智能等领域的用例。
全面加速 AI 堆栈
NVIDIA 加速计算在 Databricks 上处理一些最苛刻的 AI 工作负载,从大规模训练、微调和推理到行业专用 AI 解决方案。今天在 Data + AI 峰会上,我们重点介绍 NVIDIA AI 基础设施如何成为 Databricks AI Runtime、模型服务和行业 AI 解决方案新公告的核心,包括对新的 NVIDIA Vera CPU 如何推动下一代智能代理基础设施的展望。
“我们与 NVIDIA 的合作贯穿整个 AI 生命周期。从 NVIDIA 加速的基础设施支持 AI Runtime 中的分布式训练,到运行在我们的服务和开发平台中的软件。我们很高兴将 NVIDIA 的技术与 Databricks 的数据和治理能力相结合,为我们的客户提供巨大的价值:快速、可扩展且建立在可信赖基础之上的企业 AI。” —— Databricks 产品高级副总裁 Adam Conway
“Databricks 使企业能够构建、部署、扩展和治理由其最有价值的资源——业务数据驱动的 AI 代理。通过我们的扩展合作,NVIDIA 和 Databricks 通过将完整的 NVIDIA 加速计算(包括 Vera CPU、Rubin GPU、NVIDIA Quantum InfiniBand 网络和 NVIDIA Agent Toolkit 软件)嵌入 Databricks 平台,正在推动下一代企业 AI 的快速发展。” —— NVIDIA 企业战略合作伙伴副总裁 Pat Lee
以下是 Databricks 与 NVIDIA 如何共同构建 AI 平台,从用于训练和推理的 GPU,到专为智能代理时代设计的 CPU。
1. 训练和微调
Databricks AI Runtime(AIR)将 NVIDIA GPU 加速直接带给数据和 AI 团队,使他们可以在受控的企业数据上训练和微调模型,而无需管理独立的 GPU 基础设施。通过 AIR,客户可以直接在 Databricks 上获得先进的 NVIDIA 硬件和网络,其受控数据所在的位置:
- 配备 NVIDIA Quantum InfiniBand 的 NVIDIA Hopper GPU:专为多节点分布式训练而设计。无论您是预训练基础模型还是运行大规模微调,AIR 都内置对 NVIDIA 高带宽、低延迟 GPU 互连(支持 RDMA 的网络)的支持,消除节点间的通信瓶颈。AIR 还正在为 NVIDIA Blackwell 架构做准备,确保客户始终处于加速计算的前沿。
- 免费版中的 NVIDIA GPU:在 DAIS,我们很兴奋地宣布,Databricks 免费版现在支持 GPU,使全球开发者、学生和初创公司能够在其 AI 工作负载上使用 GPU 进行构建和部署。
- 对 NVIDIA 容器的支持:不久之后,Databricks 将支持 NGC 容器和自定义的 NVIDIA CUDA 环境,使它们能够原生地在平台的数据上运行。
AI Runtime 使 Databricks 内部能够无缝访问 NVIDIA GPU。
2. 推理:Databricks 模型服务中的 NVIDIA 加速
Databricks 模型服务为数千名 Databricks 客户提供生产级推理服务。模型服务的核心是 NVIDIA 硬件和软件,它们能够以低延迟、高吞吐量的方式大规模地进行推理,满足客户在前沿模型(如 Qwen、GPT-OSS)和客户自定义神经网络上的需求。其他服务功能包括 NVIDIA 硬件和 Triton 推理服务器。模型服务支持领先的推理优化 GPU,Triton 的高级动态批处理和优化性能也将很快推出。通过模型服务,客户可以直接在托管的 Databricks 基础设施上运行他们在 NVIDIA 硬件上训练的模型。
3. 代理基础设施:探索 NVIDIA Vera 以应对下一个计算瓶颈
自主代理的兴起带来了新的基础设施挑战。虽然 GPU 在模型推理方面表现出色,但代理的控制、工具调用、基于 CPU 的分析以及多步骤推理的管理都运行在 CPU 上。如今的 CPU 经常成为瓶颈:工具调用的延迟、代理步骤之间的通信开销以及在负载下性能的不一致都会降低代理体验。
NVIDIA Vera 是专为这种工作负载设计的下一代 CPU。专为三个核心使用场景设计:代理工作负载、强化学习和基于 CPU 的数据分析,Vera 提供以下功能:
- 高性能的 NVIDIA 设计、兼容 Arm 的核心,可提供高达 3 倍更快的 SQL 查询和 80% 更快的代理性能,优化用于延迟敏感、突发计算模式,如工具调用和代理编排。
- 大规模的内存带宽,用于代理在模型调用之间执行的密集型数据操作。
- 快速的核心间通信,有助于在代理复杂度增加时提供可预测的性能。
愿景是在 Databricks 上实现端到端的 NVIDIA 加速堆栈:模型在 NVIDIA GPU 上进行推理,而代理控制和工具调用可以在 Vera CPU 上运行,每种工作负载都使用为其特性专门设计的芯片。开发者可以在 Databricks 上使用专有数据自定义模型,通过模型服务进行部署,而周围的代理基础设施则运行在专门为这种模式设计的计算硬件上。
4. 开发者体验:让加速 AI 更易于构建
NVIDIA Agent Toolkit:在 Databricks 上部署
基于 Databricks Apps,团队可以直接在其 Databricks 环境中托管和运行 NVIDIA Agent Toolkit,这是 NVIDIA 提供的开源开发平台,用于构建、自定义和部署代理 AI 工作流。这意味着你可以获得:
- NVIDIA Agent Toolkit 功能:在 Databricks 上托管的应用程序中运行护栏、工具使用、检索增强生成和多步骤推理。
- Databricks Apps 作为托管层:可以部署任何代码库,包括使用 NVIDIA Agent Toolkit 构建的代理或服务,作为带有内置身份验证、网络和治理功能的托管应用,通过 Unity Catalog 实现。
- 与 Databricks 的数据、模型和服务基础设施无缝集成。您的代理可以访问受控数据,通过 FMAPI 调用模型,并在不离开环境的情况下充分利用整个平台。
使用 Genie Code 进行 GPU 工作负载
GPU 功能强大,但要实现良好的利用率、诊断性能问题和调试工作负载,传统上需要深厚的系统专业知识。我们正在通过以代理为中心的方法改变这一现状:
Genie Code 支持围绕 NVIDIA 硬件和软件设计的技能。开发人员可以:
- 通过对话方式调试 GPU 工作负载:描述问题,获取可操作的指导
- 进行性能优化:识别利用率瓶颈、内存问题和通信开销
- 利用 NVIDIA 专有知识:理解 CUDA、cuDNN、NCCL 和 NVIDIA 性能分析工具的技能
Genie Code 和 NVIDIA 调试工具还与 Databricks 的各种产品界面完全集成,包括:
- 笔记本:在笔记本环境中实现一流的 GPU 监控、性能分析和调试
- MLflow:在实验过程中跟踪 GPU 指标和利用率
- 模型服务:诊断端点健康状况和 GPU 性能,识别优化端点机制(如自动扩展)的机会
5. 行业 AI:NVIDIA 软件在受控的 Databricks 数据上运行
每个行业都面临着由其生成的数据和构建的模型所塑造的独特计算挑战。这些挑战涵盖了从分析基因组、加速药物发现到优化供应链、解释医学图像和模拟工厂、机器人和数字孪生的各个方面。
为了解决这些问题,NVIDIA 在领域特定的加速计算库和框架上投入了大量资源。我们很兴奋能够将这些能力直接引入 Databricks 平台。
客户可以在整个 Databricks 体验中利用 NVIDIA 的加速计算堆栈——从数据工程和实验到模型开发和生产工作流程;现在,领域特定的研发团队可以在不离开 Databricks 平台的情况下使用 NVIDIA 的加速功能。
该合作涵盖了客户可以与 Databricks 一起用于行业特定 AI 工作负载的 NVIDIA 加速计算库和领域框架:
领域
NVIDIA 集成
能力
医学影像
NVIDIA MONAI
基于 AI 的医学影像分析和标注
图像处理
NVIDIA nvImageCodec
硬件加速的图像编码/解码
药物发现与生物学
NVIDIA BioNeMo
用于生物分子设计的生成式 AI
蛋白质与分子建模
NVIDIA Proteina-Complexa
蛋白质结构预测和分子相互作用建模
基因组学
NVIDIA Parabricks
基于 GPU 的基因组分析流水线
单细胞
NVIDIA cuML
使用 rapids-singlecell(scverse)进行基于 GPU 的单细胞分析
决策优化
NVIDIA cuOpt
基于 GPU 的数学优化,包括线性规划、混合整数规划、二次规划和路由
模拟与机器人
NVIDIA Isaac Sim
用于机器人物理精确的模拟
数字孪生与 3D 模拟
NVIDIA Omniverse
工业数字孪生的创建和可视化
文档智能
Nemotron Parse
高精度的文档解析与提取
展望未来:构建智能代理时代
NVIDIA AI 基础设施支持 Databricks 上 AI 的关键层级:用于训练和推理的 GPU,用于代理编排和数据分析的 Vera CPU,用于构建智能代理应用的 NVIDIA Agent Toolkit,以及帮助您充分利用每个计算周期的开发工具。
无论您是初创公司,正在 Free Edition 中尝试第一个 GPU 工作负载;还是制药公司,使用 BioNeMo 进行药物发现;或是企业,大规模部署前沿模型,Databricks 与 NVIDIA 共同为您提供所需的性能、简便性和治理能力。
立即开始:在 Databricks Free Edition 中尝试 NVIDIA GPU,在 Databricks Apps 上部署 NVIDIA Agent Toolkit,或探索由 NVIDIA 加速计算支持的 Foundation Model API。
在您的邮箱中获取最新文章
订阅我们的博客,获取最新文章发送到您的邮箱。
注册
查看所有博客
slice-start id="_gatsby-scripts-1"
slice-end id="_gatsby-scripts-1"