Hugging Face Blog

Up to 3.2x Faster Inference with LFM2.5-DSpark

8.5内容质量

TL;DR · AI 摘要

Hugging Face 推出 LFM2.5-DSpark 模型,推理速度提升最高达 3.2 倍,通过轻量级草案模型和并行解码机制实现。

核心要点

  • DSpark 使 LFM2.5-8B-A1B 模型在 GPU 上推理速度提升 3.18 倍
  • 采用 Markov 链头结构提升 57% 函数调用延迟
  • 模型参数量控制在 300M 级,兼容 llama.cpp 和 SGLang

结构提纲

按章节快速跳转。

  1. DSpark 技术使 LFM2.5 系列模型推理速度提升最高达 3.2 倍

  2. 通过草案模型并行解码和权重共享机制降低内存瓶颈

  3. 包含 DFlash 并行主干、Markov 链头和置信度验证器三部分

  4. 使用 15 轮训练选择最优接受率的轻量级草案模型

  5. LFM2.5-1.2B-Instruct 模型参数量为 295.7M

  6. 通过贪婪解码确保输出序列与基线模型完全一致

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • DSpark 技术架构
    • 核心机制
      • 并行解码
      • 权重共享
    • 架构组件
      • DFlash 主干
      • Markov 链头
      • 置信度验证器
    • 性能指标
      • 3.2x 速度提升
      • 57% 延迟降低

金句 / Highlights

值得收藏与分享的关键句。

#DSpark#LLM推理优化#Hugging Face#模型压缩
打开原文

通过 LFM2.5-DSpark 最多实现 3.2 倍推理加速

返回文章列表

[0

团队

]

文章

发布于 2026 年 8 月 20 日

[-1

点赞

9

[

  • +3

xx

tugot17

关注

LiquidAI

Leonie Monigatti

iamleonie

Fernando Fernandes Neto

fernandofernandes

Tarek Dakhran

tarek-liquid

nathan ranchin

nathanrchn

今天,我们发布了 LFM2.5 家族中三款模型的 DSpark 草稿模型检查点:LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B。这些模型引入了推测解码路径,在几乎不增加内存占用的情况下显著提升解码速度,且不影响输出质量:

  • 更快的推理:在 GPU 上实现高达 3.18 倍的吞吐量提升,在设备端实现高达 2.87 倍的加速。
  • 推动设备端智能推理:LFM2.5-2.6B 平均将函数调用延迟降低 57%。
  • 原生支持 llama.cpp 和 SGLang:兼容 LFM 的 DSpark 集成已开源至上游仓库。

DSpark 的工作原理

在大语言模型推理中,解码阶段传统上受内存限制。大部分延迟来源于从 DRAM 向 SRAM 流式传输权重,而非密集计算。推测解码通过使用轻量级草稿模型生成候选 token,然后让目标模型在单次前向传递中验证所有 token,从而将权重加载成本分摊到所有验证的 token 上。

多年来已提出多种推测方法,其中最具代表性的包括 EAGLE-3、DFlash 以及最新提出的 DSpark,后者结合了三个核心组件:

  • 基于目标模型上下文特征的 DFlash 风格并行主干网络,通过单次前向传递生成所有草稿 token 的隐藏状态。
  • 作为相邻 token 之间马尔可夫链建模的轻量级序列头,通过增加 token 间依赖性提高后续位置的接受率。
  • 带置信度调度的验证器,预测每个 token 的存活概率并在验证成本超过收益时剪枝低置信度后缀。

训练与架构

我们采用 DSpark 训练方案,使用更广泛的数据集混合(涵盖 SFT、聊天、代码和函数调用数据)。根据我们的消融实验,首批草稿模型采用简化注意力机制架构,包含 5 层和 9 个块。每个草稿模型在完整数据集上训练 15 个 epoch,并选择接受率最高而非损失最低的 epoch。

最终的草稿模型体积相对较小,每个模型约 3 亿参数。

组件 | LFM2.5-1.2B-Instruct | LFM2.5-8B-A1B | LFM2.5-2.6B --- | --- | --- | --- 解码器堆栈(5 层) | 241.2M | 241.2M | 241.2M 隐藏状态投影 | 21.0M | 21.0M | 21.0M 马尔可夫头 | 33.6M | 65.5M | 65.5M 归一化层 + 置信度头 | 27.5k | 27.5k | 27.5k 总计 | 295.7M | 327.7M | 327.7M

质量一致性

在贪婪解码模式下,只有当草稿 token 与目标模型分布匹配时才会被接受。若被拒绝,目标模型自身的 token 将取而代之。因此生成的序列在结构上与基线贪婪解码完全一致,基准准确率(pass@1 或精确匹配)保持不变。

CPU 和 GPU 推理加速

我们的 LFM2.5 DSpark 草稿模型原生支持 llama.cpp(实现基于官方代码库 ,我们使用实验性 metal 内核运行)和 SGLang(实现基于 DSpark 官方 SGLang 实现)

我们使用 llama.cpp 和 Metal 在搭载 FP16 GGUF 权重的 M4 Max MacBook Pro 上测量设备端吞吐量,输出令牌数最多为 256。我们使用 SGLang 在单个 H100 80 GB 显卡上以 BF16 格式测量 GPU 吞吐量。两种配置均采用 DSpark 块大小 9、批量大小 1 和温度 0。我们在五个基准数据集上对它们进行评估。

所有三个草案模型在大规模加速器(H100)和边缘部署(M4 Max MacBook)上均实现了显著的吞吐量提升。

对于 LFM2.5-2.6B 模型,MacBook 上的加速效果尤为明显,其交互水平远超大多数专有云模型提供的吞吐量(约 140 tok/s,具体取决于数据集)。

数据集

接受率(满分 10)

H100 加速倍数

M4 Max 加速倍数

MATH500

5.42

3.06x

326 → 1000 tok/s

2.25x

61 → 137 tok/s

HumanEval

4.54

2.56x

326 → 835 tok/s

2.63x

61 → 161 tok/s

MBPP

4.71

2.64x

326 → 861 tok/s

2.11x

62 → 132 tok/s

GSM8K

4.32

2.22x

312 → 693 tok/s

2.36x

60 → 143 tok/s

MT-Bench

5.07

2.87x

325 → 933 tok/s

1.99x

62 → 123 tok/s

平均值

4.81

2.67x

323 → 864 tok/s

2.27x

61 → 139 tok/s

在各种多工具场景中,DSpark 使 LFM2.5-2.6B 模型的延迟平均降低 57%。

对于 LFM2.5-1.2B-Instruct 模型,我们观察到数据集接受率存在较大差异,因此加速效果会根据底层文本分布变化高达 52%。

6.02

668 → 1712 tok/s

2.62x

140 → 366 tok/s

5.31

2.26x

664 → 1499 tok/s

136 → 389 tok/s

5.52

2.37x

667 → 1578 tok/s

2.74x

137 → 375 tok/s

4.34

1.67x

624 → 1041 tok/s

2.73x

140 → 381 tok/s

3.90

1.66x

657 → 1091 tok/s

1.72x

137 → 237 tok/s

5.02

2.10x

656 → 1384 tok/s

2.54x

138 → 350 tok/s

对于 LFM2.5-8B-A1B 模型,与两个密集模型相比接受率有所提高,但设备端平均仅提升 18%。这种差距归因于 llama.cpp 的 Metal 后端当前 MoE 实现,以及验证 k 个令牌会激活更多专家从而产生更多权重流量,这比单步解码需要更多计算。

8.27

3.18x

428 → 1362 tok/s

1.21x

93 → 112 tok/s

7.02

2.58x

426 → 1100 tok/s

1.12x

91 → 101 tok/s

6.93

426 → 1122 tok/s

1.09x

89 → 97 tok/s

4.02

1.29x

385 → 496 tok/s

1.44x

90 → 129 tok/s

8.52

3.02x

426 → 1288 tok/s

1.04x

87 → 90 tok/s

6.95

418 → 1074 tok/s

1.18x

90 → 106 tok/s

如何使用 LFM2.5-DSpark

使用 SGLang 运行 DSpark 草稿模型需要构建支持 LFM2 目标的 SGLang(PR #31041)。使用附加草稿启动目标:

code
python -m sglang.launch_server \
  --model-path LiquidAI/LFM2.5-2.6B \
  --speculative-algorithm DSPARK \
  --speculative-draft-model-path LiquidAI/LFM2.5-2.6B-DSpark \
  --speculative-draft-attention-backend flashinfer \
  --disable-radix-cache --mem-fraction-static 0.75 --port 30000

然后通过 OpenAI 兼容端点 http://localhost:30000/v1 进行查询。块大小从草稿的 config.json 中读取;基准命令是不带三个 --speculative-* 参数的相同命令。

使用 llama.cpp 运行需要相应的 llama.cpp 构建(PR#27383):

code
llama-server -m LFM2.5-2.6B-F16.gguf \
  -md LFM2.5-2.6B-DSpark-F16.gguf \
  --spec-type draft-dspark --spec-draft-n-max 10 --spec-draft-n-min 0 \
  -fa on -ngl 99

块大小从sidecar元数据中读取(n-max被限制为该值)。推测解码是精确的:目标会验证每个提议的token,因此贪婪输出等于目标本身;每个响应的计时报告draft_n / draft_n_accepted。

入门指南

DSpark草案模型检查点在Hugging Face上以Safetensors和GGUF格式提供:

  • Safetensors:LFM2.5-2.6B-DSpark、LFM2.5-1.2B-Instruct-DSpark、LFM2.5-8B-A1B-DSpark
  • GGUF:LFM2.5-2.6B-DSpark-GGUF、LFM2.5-1.2B-Instruct-DSpark-GGUF、LFM2.5-8B-A1B-DSpark-GGUF

我们迫不及待想看到你们的创作。

引用文献

引用时请使用以下参考文献或BibTeX:

Liquid AI, "LFM2.5-DSpark: 从H100到MacBook推理速度提升至3.2倍", Liquid AI Blog, 2026年8月。

code
@article{liquidAI2026dspark,
  author = {Liquid AI},
  title = {LFM2.5-DSpark: 从H100到MacBook推理速度提升至3.2倍},
  journal = {Liquid AI Blog},
  year = {2026},
  note = {www.liquid.ai/blog/lfm2.5-dspark},
}

本文提及的模型 6

本文提及的论文 3

更多该作者的文章

通过量化感知蒸馏获得的LFM2.5 Q4\_0检查点

33

2026年8月19日

用于边缘设备更好更快视觉能力的LFM2.5-VL-3B

45

2026年8月12日

社区

编辑

预览

通过拖拽文本输入框、粘贴或点击此处上传图片、音频和视频

.

轻点或粘贴此处上传图片

评论

· 注册或登录以发表评论