Databricks

Accelerating LLM Inference with Prompt Caching for Open‑Source Models on Databricks

3.5内容质量
Accelerating LLM Inference with Prompt Caching for Open‑Source Models on Databricks

TL;DR · AI 摘要

该文章标题与内容严重不匹配,正文缺失核心内容,仅含导航菜单与页面结构,无技术实现细节,无法评估其技术价值。

核心要点

  • 该文章标题与内容严重不匹配,正文缺失核心内容,仅含导航菜单与页面结构,无技术实现细节,无法评估其技术价值

在 Databricks 上通过提示缓存加速开源大模型推理 | Databricks 博客

跳至主要内容

[![图片 1](blob:http://localhost/c3d26385bd032c882a09c45135533626)](https://www.databricks.com/)

[![图片 2](blob:http://localhost/c3d26385bd032c882a09c45135533626)](https://www.databricks.com/)

  • 为何选择 Databricks
  • * 探索
  • 客户案例
  • 合作伙伴
  • 产品
  • * Databricks 平台
  • 集成与数据
  • 定价
  • 开源技术
  • 解决方案
  • * 按行业划分的 Databricks 解决方案
  • 跨行业解决方案
  • 迁移与部署
  • DATA + AI 峰会 ![图片 3:Data+AI 峰会宣传图 6 月 15–18 日 | 旧金山 欢迎参加全球规模最大的数据、应用与 AI 盛会。立即注册](https://www.databricks.com/dataaisummit?itm_source=www&itm_category=home&itm_page=home&itm_location=navigation&itm_component=navigation&itm_offer=dataaisummit)
  1. 全部博客
  2. / Databricks AI

目录

目录

目录

Databricks AI 2026 年 5 月 22 日

在 Databricks 上为开源模型启用 Prompt 缓存,加速 LLM 推理

通过 Prompt 缓存实现更快、更安全的开源大语言模型(OSS LLM)推理。

作者:Pei-Lun LiaoAsfandyar QureshiRoshan RegulaBruce FontaineJames ThomasChenyang Yu

摘要

  • Prompt 缓存通过复用重复的 Prompt 前缀,使 LLM 运行更快,自动降低延迟并提升吞吐量。
  • Databricks 现已为批量处理、按 Token 计费及预置工作负载中的开源模型全面支持 Prompt 缓存,无需额外配置。
  • 在 GPT-OSS 生产环境中,Prompt 缓存使吞吐量提升了 2.5 倍,P50 延迟降低了 3 倍。

为何 Prompt 缓存至关重要

大语言模型(LLM)推理过程中常涉及大量重复的 Prompt——例如,相同的系统提示或指令提示可能反复出现在成千上万次请求中。若每次都重新处理这段相同的前缀,将造成计算资源浪费,导致延迟升高、成本增加。

Prompt 缓存通过消除这种冗余处理,带来以下优势:

  • 更低延迟:当缓存命中时,可跳过预填充(prefill)阶段。
  • 更高吞吐量:每 模型单元 可处理更多 Token。

提示词缓存(Prompt caching)是一种强大的技术,可在不牺牲模型令牌吞吐量的前提下,显著提升模型在特定领域的表现。多个查询可共享一个大型领域专用系统提示词(system prompt),从而将该共享提示词的计算成本分摊至所有相关查询中。前沿模型(如 Claude)内部使用长达数千令牌的系统提示词。此外,在我们近期发表的研究中,我们证明了自动化提示词优化可使开源模型在企业任务上超越前沿模型的性能。

功能可用性

Databricks 已为专有模型(GPT、Gemini、Claude)内置了提示词缓存功能。如今,我们已将该能力扩展至支撑我们基础模型 API(FMAPIs)的开源权重模型(open-weights models),适用于批量推理、按令牌付费(pay-per-token)以及预置吞吐量(provisioned-throughput)工作负载。该功能同样适用于所有基于基础模型构建的上层服务,例如 Agent Bricks、Genie 和 AI Functions。

目前,Databricks 已为以下开源模型(OSS models)支持提示词缓存:

  • GPT‑OSS 20B 和 120B
  • Gemma 3 12B
  • 微调版 Llama 3.1 8B(通过 PEFT 服务)
  • Llama 3.1 8B 和 Llama 3.3 70B

我们将持续将该功能推广至其他模型。安全性是 Databricks 的首要关切。提示词缓存完全隔离,仅驻留于易失性内存中,且永不持久化。重要的是,该缓存机制是隐式的:用户无需进行任何配置,系统已内置自动执行提示词缓存与复用逻辑,以提升吞吐量。

实际影响:GPT OSS 模型的批量推理

我们首先在 GPT‑OSS 模型上部署了提示词缓存,并立即在某大型生产级批量推理管道中观察到显著性能提升:

  • 单副本(per-replica)输入令牌吞吐量提升 2.5 倍
  • P50 延迟降低至原来的 1/3
  • 上述成果仅在约 30% 的缓存命中率下实现
图 4:GPT OSS 模型提示词缓存效果
图 4:GPT OSS 模型提示词缓存效果

展开

核心价值

Databricks 通过自动复用相同提示词的 KV 缓存,使您能够以更快速度、更高性价比和更强安全性运行开源大语言模型(LLM),且无需任何额外配置。无论您是在提供实时对话服务、批量处理海量文档,还是构建 AI 代理,提示词缓存都能将原本良好的推理管道提升至卓越水平。请在下一次开源模型部署中尝试该功能,见证性能指标的显著跃升。

将最新文章发送至您的邮箱

订阅我们的博客,第一时间获取最新文章。

注册订阅

*

工作邮箱

*

国家/地区 国家/地区*

点击“订阅”,即表示我已知悉将接收 Databricks 的通信,并同意 Databricks 根据其隐私政策处理我的个人数据。

订阅

查看所有博客

图 5:Databricks 徽标
图 5:Databricks 徽标

为何选择 Databricks

探索

客户案例

合作伙伴

为何选择 Databricks

探索

客户案例

合作伙伴

产品

Databricks 平台

定价

开源项目

集成与数据

产品

Databricks 平台

定价

开源项目

集成与数据

解决方案

按行业划分的 Databricks 解决方案

跨行业解决方案

数据迁移

专业服务

解决方案加速器

解决方案

按行业划分的 Databricks 解决方案

跨行业解决方案

数据迁移

专业服务

解决方案加速器

资源

文档

客户支持

社区

学习

事件

博客与播客

资源

文档

客户支持

社区

学习

事件

博客与播客

关于

公司

招聘

媒体

安全与信任

关于

公司

招聘

媒体

图片 7:Databricks 徽标
图片 7:Databricks 徽标

Databricks 公司 地址:美国加利福尼亚州旧金山 Spear 街 160 号 15 楼 邮编:94105 电话:1-866-330-0121

  • [](https://www.linkedin.com/company/databricks)
  • [](https://www.facebook.com/pages/Databricks/560203607379694)
  • [](https://twitter.com/databricks)
  • [](https://www.databricks.com/feed)
  • [](https://www.glassdoor.com/Overview/Working-at-Databricks-EI_IE954734.11,21.htm)
  • [](https://www.youtube.com/@Databricks)
图片 9
图片 9

查看招聘职位 加入 Databricks

  • [](https://www.linkedin.com/company/databricks)
  • [](https://www.facebook.com/pages/Databricks/560203607379694)
  • [](https://twitter.com/databricks)
  • [](https://www.databricks.com/feed)
  • [](https://www.glassdoor.com/Overview/Working-at-Databricks-EI_IE954734.11,21.htm)
  • [](https://www.youtube.com/@Databricks)

© Databricks 2026。保留所有权利。Apache、Apache Spark、Spark、Spark 徽标、Apache Iceberg、Iceberg 及 Apache Iceberg 徽标均为 Apache 软件基金会 的商标。

我们重视您的隐私

Databricks 使用 Cookie 及类似技术以优化网站导航、分析网站使用情况、个性化内容与广告,并进一步说明见我们的 Cookie 声明。如需禁用非必要 Cookie,请点击“全部拒绝”。您也可以通过点击“管理偏好设置”来管理 Cookie 设置。

管理偏好设置

全部拒绝 全部接受

图片 12:Databricks 公司徽标
图片 12:Databricks 公司徽标

隐私偏好中心

已尊重退出偏好信号

隐私偏好中心

  • ### 您的隐私
  • ### 必需 Cookie
  • ### 性能 Cookie
  • ### 功能 Cookie
  • ### 定向 Cookie
  • ### 其他

#### 您的隐私

当您访问任何网站时,该网站可能会在您的浏览器中存储或读取信息,通常以 Cookie 的形式实现。这些信息可能涉及您本人、您的偏好设置或您的设备,主要用于确保网站按您预期的方式运行。通常情况下,这些信息不会直接用于识别您的身份,但可以为您提供更个性化的网页体验。出于对您隐私权的尊重,您可以选择拒绝某些类型的 Cookie。点击不同类别的标题,可了解更多信息并调整我们的默认设置。不过,禁用某些类型的 Cookie 可能会影响您对网站的使用体验以及我们所能提供的服务。

#### 拒绝销售、共享及定向广告

根据您所在的地区,您可能有权选择退出个人数据的“销售”或“共享”,或拒绝将个人数据用于在线“定向广告”目的。您可以通过在此处禁用可选 Cookie 来选择退出基于 Cookie 及类似标识符的此类行为。若需基于其他标识符(如邮箱地址)选择退出,请通过我们的隐私请求中心提交申请。

更多信息

#### 必需 Cookie(严格必要)

始终启用

这些 Cookie 对网站正常运行至关重要,无法在我们的系统中关闭。它们有助于实现网站基本功能,例如设置您的隐私偏好、登录账户或填写表单。您可在浏览器中设置阻止或提醒您这些 Cookie,但部分网站功能将因此失效。

#### 性能 Cookie

  • [x] 性能 Cookie

这些 Cookie 允许我们统计访问次数及流量来源,从而测量并优化网站性能。它们帮助我们了解哪些页面最受欢迎或最不受欢迎,并观察访客在网站内的浏览路径。

#### 功能性 Cookie

  • [x] 功能性 Cookie

这些 Cookie 使网站能够提供增强的功能与个性化服务。它们可能由我们或我们已集成至页面的第三方服务提供商设置。若您拒绝这些 Cookie,则部分或全部相关服务可能无法正常运行。

#### 定向广告 Cookie

  • [x] 定向广告 Cookie

这些 Cookie 可通过我们的网站由广告合作伙伴设置,用于构建您的兴趣档案,并在其他网站向您展示相关广告。若您拒绝这些 Cookie,您将较少看到定向广告。

#### 其他(TOTHR)

  • [x] 其他(TOTHR)

Cookie 列表

同意 | 合法利益

  • [x] 复选框 标签 标签
  • [x] 复选框 标签 标签
  • [x] 复选框 标签 标签

清除

  • - [x] 复选框 标签 标签

应用 取消

确认我的选择

全部允许

图片 13:由 OneTrust 提供支持
图片 13:由 OneTrust 提供支持

图片 15图片 16

图片 17
图片 17
图片 18
图片 18