How Databricks is turning video into searchable, actionable intelligence
TL;DR · AI 摘要
Databricks 利用 VLMs 和无服务器 GPU 技术,将视频转化为可搜索、可操作的智能数据。
核心要点
- Databricks 使用 VLMs 和无服务器 GPU 技术实现视频的自动分析与摘要。
- Lakeflow 管道和 SAM3 分割模型可在数秒内处理视频数据。
- 该方法支持自然语言查询,提升视频分析效率与可扩展性。
结构提纲
按章节快速跳转。
- §引言
文章介绍了 Databricks 如何将视频转化为可搜索、可操作的智能数据。
传统方法依赖人工分析,难以处理大规模视频数据。
Databricks 使用 VLMs 和无服务器 GPU 技术,提升视频分析效率。
Lakeflow 管道结合 SAM3 分割模型,实现视频的快速处理与分析。
- ·应用场景
该方法适用于公共安全、基础设施和城市运营等场景。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- Databricks 视频分析
- 技术架构
- VLMs
- 无服务器 GPU
- Lakeflow 管道
- 应用场景
- 公共安全
- 基础设施
- 城市运营
金句 / Highlights
值得收藏与分享的关键句。
Databricks 使用 VLMs 和无服务器 GPU 技术,实现视频的自动分析与摘要。
Lakeflow 管道和 SAM3 分割模型可在数秒内处理视频数据。
该方法支持自然语言查询,提升视频分析效率与可扩展性。
Databricks 如何将视频转化为可搜索、可操作的智能 | Databricks 博客
跳至主要内容
解决方案
2026 年 6 月 26 日
Databricks 如何将视频转化为可搜索、可操作的智能
作者:Justin Monaldo、Kacey Hertan 和 Yvan Aquino
摘要
- 公共部门机构如何将无人机和摄像头生成的原始视频转化为可搜索、人工智能就绪的智能信息
- Databricks 如何使用 VLM(视觉语言模型)、无服务器 GPU 和 Lakeflow 管道自动检测、截取并总结视频中的关键时刻
- 可扩展、与模型无关的架构如何实现公共安全、基础设施和城市运营的实时视频分析
一家公用事业公司部署无人机来检查数百英里的输电线。一个警察部门提取数小时的交通摄像头录像来调查一起肇事逃逸事故。一个城市规划团队利用摄像头录像分析行人和交通流量。
每天都会生成数以太字节的视频数据,这些数据可以为从运营效率到公共安全的各个方面提供有价值的见解。但几乎没有任何数据以任何有意义的方式被分析。这是因为梳理这些非结构化视频数据非常耗时且昂贵。
想象一下,只需使用自然语言查询大规模地对视频内容进行搜索,不仅能找到特定内容,还能对其进行分析、评估和学习。
Databricks 可以支持这一点。方法是将视频视为一个数据工程问题。
Databricks 如何改变视频分析的方法?
传统视频分析方法是投入越来越多的人类分析师来解决问题。深度学习、计算机视觉以及最近的视觉语言模型(VLMs)的进步,使计算机能够以高精度识别视频中的对象。但随着推理规模的扩大和处理大量非结构化数据的管道的编排,构建这些管道的物流对组织来说变得困难。这一点在将 VLMs 应用于该问题时尤为明显。VLMs 在提示方面提供了灵活性,不需要在使用前对模型进行特定类别的预训练或微调,但与传统的对象检测模型相比,VLMs 更大、速度更慢,带来了扩展方面的挑战。
在 Databricks 中,您可以专注于使用这些模型进行视频分析如何融入数据管道,而不是模型推理和基础设施的复杂性。
用户可以使用 VLMs 和自然语言立即搜索视频录像。
Databricks 如何大规模处理和分析视频?
这种方法可以在直接部署在 Databricks 工作区中的 Databricks 应用中进行演示。用户上传视频或指向已存储在 Databricks Volume 中的视频,直接输入自然语言提示描述他们要查找的内容,例如白色集装箱卡车、保安人员、太阳能板,然后只需单击一次即可启动处理管道。
从那里开始,Databricks Serverless GPU Compute(SGC)接管了流程。一个 Lakeflow 作业被触发,它获取预热的 GPU,并在几秒钟内立即通过 Meta 的 SAM3 分割模型开始处理视频。该模型在视频的每一帧中识别与提示匹配的感兴趣对象。视频被截断为仅包含这些关键时刻,并重写到另一个 Databricks Volume 中。例如,一个 26 分钟的交通摄像头视频被缩减为 1 分钟 55 秒的相关片段,同时保留了原始时间戳,以便审查人员需要时可以回溯到原始视频。每个截断的片段随后通过 Databricks Foundation Model API(FMAPI)传递给基础模型,进行 AI 生成的摘要,从而提供可以写入表或流以供后续处理的文本数据。
由于整个过程被视为一个数据工程问题,该管道明确地与模型无关,利用 MLflow 使用户可以选择他们偏好的模型,甚至可以将新模型或微调模型引入工作流。MLflow 模型签名标准化了模型的输入和输出,以确保连续性和灵活性。你可以从 Huggingface 下载的任何模型或从头开始训练的模型都可以在该管道中使用。SAM3 可以被 YOLO 模型、其他基于变压器的视觉模型或微调的领域特定模型所替代。
这种灵活性也扩展到了摘要和异常检测层。任何多模型基础模型或较小的图像字幕模型都可以用来将帧内容转换为文本描述。拥有这些文本描述可以为基于文本的 AI 工作流提供支持,用于对视频进行摘要以便分析师审查,或识别意外内容并标记视频片段进行审查。使模型可以互换而不破坏管道,使这个示例可以扩展到几乎所有视频处理的使用场景。
由于无服务器 GPU 计算已预先配置为与流行的 NVIDIA GPU 和深度学习框架一起工作,你只需编写数据工程代码即可。你无需担心 GPU 计算能力或 Python 包版本与 CUDA 的兼容性。
管道如何处理大规模视频?
由应用程序触发的工作流只是与管道交互的一种方式。相同的管道也可以作为文件或事件驱动的过程运行:视频进入 Databricks Volume 后,会自动触发 LakeFlow 作业,生成截断的输出和基于文本的分析,而无需任何人工干预。下游,这些文本可以触发警报、路由给审查人员,或输入到其他 AI 处理流程中。
Databricks 生成一个截断的视频和 AI 驱动的摘要,仅展示最相关的片段,以便快速或自动化审查。
并发性通过简单的配置进行处理。你可以一次性导入 20 个视频,它将同时启动 20 个相同作业的实例。每个作业独立获取自己的无服务器 GPU 计算资源,根据需要水平扩展,并在完成时释放资源。无需集群管理,且在 GPU 未使用时无需为其付费。
视频智能可以应用在哪些地方?
此应用和流程只是一个起点。部署到任意 Databricks 工作区后,其底层架构支持任何需要处理、搜索或总结大量视频的场景。这包括基础设施检查、物理安全、公共安全、机场运营等。包含该应用和流程代码的 GitHub 仓库对希望部署、扩展或根据自身使用场景进行调整的团队是公开可用的。
Databricks 协调了一个端到端的视频智能流程,能够以大规模方式摄入、处理和分析视频,从而在几分钟内提供可搜索的见解。
今天就在 Databricks 上构建您的视频智能流程
了解您的机构如何在不使用复杂机器学习工作流程的情况下处理、总结和搜索大量视频。探索 Databricks 公共部门解决方案,并与我们的公共部门团队联系。
在您的收件箱中获取最新文章
订阅我们的博客,即可将最新文章发送到您的收件箱。
注册
查看所有博客
slice-start id="_gatsby-scripts-1"
slice-end id="_gatsby-scripts-1"