Up to 3.2x Faster Inference with LFM2.5-DSpark
TL;DR · AI 摘要
Hugging Face 推出 LFM2.5-DSpark 模型,推理速度提升最高达 3.2 倍,通过轻量级草案模型和并行解码机制实现。
核心要点
- DSpark 使 LFM2.5-8B-A1B 模型在 GPU 上推理速度提升 3.18 倍
- 采用 Markov 链头结构提升 57% 函数调用延迟
- 模型参数量控制在 300M 级,兼容 llama.cpp 和 SGLang
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- DSpark 技术架构
- 核心机制
- 并行解码
- 权重共享
- 架构组件
- DFlash 主干
- Markov 链头
- 置信度验证器
- 性能指标
- 3.2x 速度提升
- 57% 延迟降低
金句 / Highlights
值得收藏与分享的关键句。
DSpark 技术在 LFM2.5-2.6B 模型上实现 57% 的函数调用延迟降低
草案模型仅需 300M 参数即可实现 3.2 倍推理加速
通过置信度调度验证器可修剪低置信度后缀提升效率
通过 LFM2.5-DSpark 最多实现 3.2 倍推理加速
返回文章列表
[0
团队
]
文章
发布于 2026 年 8 月 20 日
[-1
点赞
9
[
- +3
xx
tugot17
关注
LiquidAI
Leonie Monigatti
iamleonie
Fernando Fernandes Neto
fernandofernandes
Tarek Dakhran
tarek-liquid
nathan ranchin
nathanrchn
今天,我们发布了 LFM2.5 家族中三款模型的 DSpark 草稿模型检查点:LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B。这些模型引入了推测解码路径,在几乎不增加内存占用的情况下显著提升解码速度,且不影响输出质量:
- 更快的推理:在 GPU 上实现高达 3.18 倍的吞吐量提升,在设备端实现高达 2.87 倍的加速。
- 推动设备端智能推理:LFM2.5-2.6B 平均将函数调用延迟降低 57%。
- 原生支持 llama.cpp 和 SGLang:兼容 LFM 的 DSpark 集成已开源至上游仓库。
DSpark 的工作原理
在大语言模型推理中,解码阶段传统上受内存限制。大部分延迟来源于从 DRAM 向 SRAM 流式传输权重,而非密集计算。推测解码通过使用轻量级草稿模型生成候选 token,然后让目标模型在单次前向传递中验证所有 token,从而将权重加载成本分摊到所有验证的 token 上。
多年来已提出多种推测方法,其中最具代表性的包括 EAGLE-3、DFlash 以及最新提出的 DSpark,后者结合了三个核心组件:
- 基于目标模型上下文特征的 DFlash 风格并行主干网络,通过单次前向传递生成所有草稿 token 的隐藏状态。
- 作为相邻 token 之间马尔可夫链建模的轻量级序列头,通过增加 token 间依赖性提高后续位置的接受率。
- 带置信度调度的验证器,预测每个 token 的存活概率并在验证成本超过收益时剪枝低置信度后缀。
训练与架构
我们采用 DSpark 训练方案,使用更广泛的数据集混合(涵盖 SFT、聊天、代码和函数调用数据)。根据我们的消融实验,首批草稿模型采用简化注意力机制架构,包含 5 层和 9 个块。每个草稿模型在完整数据集上训练 15 个 epoch,并选择接受率最高而非损失最低的 epoch。
最终的草稿模型体积相对较小,每个模型约 3 亿参数。
组件 | LFM2.5-1.2B-Instruct | LFM2.5-8B-A1B | LFM2.5-2.6B --- | --- | --- | --- 解码器堆栈(5 层) | 241.2M | 241.2M | 241.2M 隐藏状态投影 | 21.0M | 21.0M | 21.0M 马尔可夫头 | 33.6M | 65.5M | 65.5M 归一化层 + 置信度头 | 27.5k | 27.5k | 27.5k 总计 | 295.7M | 327.7M | 327.7M
质量一致性
在贪婪解码模式下,只有当草稿 token 与目标模型分布匹配时才会被接受。若被拒绝,目标模型自身的 token 将取而代之。因此生成的序列在结构上与基线贪婪解码完全一致,基准准确率(pass@1 或精确匹配)保持不变。
CPU 和 GPU 推理加速
我们的 LFM2.5 DSpark 草稿模型原生支持 llama.cpp(实现基于官方代码库 ,我们使用实验性 metal 内核运行)和 SGLang(实现基于 DSpark 官方 SGLang 实现)。
我们使用 llama.cpp 和 Metal 在搭载 FP16 GGUF 权重的 M4 Max MacBook Pro 上测量设备端吞吐量,输出令牌数最多为 256。我们使用 SGLang 在单个 H100 80 GB 显卡上以 BF16 格式测量 GPU 吞吐量。两种配置均采用 DSpark 块大小 9、批量大小 1 和温度 0。我们在五个基准数据集上对它们进行评估。
所有三个草案模型在大规模加速器(H100)和边缘部署(M4 Max MacBook)上均实现了显著的吞吐量提升。
对于 LFM2.5-2.6B 模型,MacBook 上的加速效果尤为明显,其交互水平远超大多数专有云模型提供的吞吐量(约 140 tok/s,具体取决于数据集)。
数据集
接受率(满分 10)
H100 加速倍数
M4 Max 加速倍数
MATH500
5.42
3.06x
326 → 1000 tok/s
2.25x
61 → 137 tok/s
HumanEval
4.54
2.56x
326 → 835 tok/s
2.63x
61 → 161 tok/s
MBPP
4.71
2.64x
326 → 861 tok/s
2.11x
62 → 132 tok/s
GSM8K
4.32
2.22x
312 → 693 tok/s
2.36x
60 → 143 tok/s
MT-Bench
5.07
2.87x
325 → 933 tok/s
1.99x
62 → 123 tok/s
平均值
4.81
2.67x
323 → 864 tok/s
2.27x
61 → 139 tok/s
在各种多工具场景中,DSpark 使 LFM2.5-2.6B 模型的延迟平均降低 57%。
对于 LFM2.5-1.2B-Instruct 模型,我们观察到数据集接受率存在较大差异,因此加速效果会根据底层文本分布变化高达 52%。
6.02
668 → 1712 tok/s
2.62x
140 → 366 tok/s
5.31
2.26x
664 → 1499 tok/s
136 → 389 tok/s
5.52
2.37x
667 → 1578 tok/s
2.74x
137 → 375 tok/s
4.34
1.67x
624 → 1041 tok/s
2.73x
140 → 381 tok/s
3.90
1.66x
657 → 1091 tok/s
1.72x
137 → 237 tok/s
5.02
2.10x
656 → 1384 tok/s
2.54x
138 → 350 tok/s
对于 LFM2.5-8B-A1B 模型,与两个密集模型相比接受率有所提高,但设备端平均仅提升 18%。这种差距归因于 llama.cpp 的 Metal 后端当前 MoE 实现,以及验证 k 个令牌会激活更多专家从而产生更多权重流量,这比单步解码需要更多计算。
8.27
3.18x
428 → 1362 tok/s
1.21x
93 → 112 tok/s
7.02
2.58x
426 → 1100 tok/s
1.12x
91 → 101 tok/s
6.93
426 → 1122 tok/s
1.09x
89 → 97 tok/s
4.02
1.29x
385 → 496 tok/s
1.44x
90 → 129 tok/s
8.52
3.02x
426 → 1288 tok/s
1.04x
87 → 90 tok/s
6.95
418 → 1074 tok/s
1.18x
90 → 106 tok/s
如何使用 LFM2.5-DSpark
使用 SGLang 运行 DSpark 草稿模型需要构建支持 LFM2 目标的 SGLang(PR #31041)。使用附加草稿启动目标:
python -m sglang.launch_server \
--model-path LiquidAI/LFM2.5-2.6B \
--speculative-algorithm DSPARK \
--speculative-draft-model-path LiquidAI/LFM2.5-2.6B-DSpark \
--speculative-draft-attention-backend flashinfer \
--disable-radix-cache --mem-fraction-static 0.75 --port 30000然后通过 OpenAI 兼容端点 http://localhost:30000/v1 进行查询。块大小从草稿的 config.json 中读取;基准命令是不带三个 --speculative-* 参数的相同命令。
使用 llama.cpp 运行需要相应的 llama.cpp 构建(PR#27383):
llama-server -m LFM2.5-2.6B-F16.gguf \
-md LFM2.5-2.6B-DSpark-F16.gguf \
--spec-type draft-dspark --spec-draft-n-max 10 --spec-draft-n-min 0 \
-fa on -ngl 99块大小从sidecar元数据中读取(n-max被限制为该值)。推测解码是精确的:目标会验证每个提议的token,因此贪婪输出等于目标本身;每个响应的计时报告draft_n / draft_n_accepted。
入门指南
DSpark草案模型检查点在Hugging Face上以Safetensors和GGUF格式提供:
- Safetensors:LFM2.5-2.6B-DSpark、LFM2.5-1.2B-Instruct-DSpark、LFM2.5-8B-A1B-DSpark
- GGUF:LFM2.5-2.6B-DSpark-GGUF、LFM2.5-1.2B-Instruct-DSpark-GGUF、LFM2.5-8B-A1B-DSpark-GGUF
我们迫不及待想看到你们的创作。
引用文献
引用时请使用以下参考文献或BibTeX:
Liquid AI, "LFM2.5-DSpark: 从H100到MacBook推理速度提升至3.2倍", Liquid AI Blog, 2026年8月。
@article{liquidAI2026dspark,
author = {Liquid AI},
title = {LFM2.5-DSpark: 从H100到MacBook推理速度提升至3.2倍},
journal = {Liquid AI Blog},
year = {2026},
note = {www.liquid.ai/blog/lfm2.5-dspark},
}本文提及的模型 6
本文提及的论文 3
更多该作者的文章
通过量化感知蒸馏获得的LFM2.5 Q4\_0检查点
33
2026年8月19日
用于边缘设备更好更快视觉能力的LFM2.5-VL-3B
45
2026年8月12日
社区
编辑
预览
通过拖拽文本输入框、粘贴或点击此处上传图片、音频和视频
.
轻点或粘贴此处上传图片
评论
· 注册或登录以发表评论