Up to 3.2x Faster Inference with LFM2.5-DSpark
Hugging Face Blog1431 字 (约 6 分钟)
85
Hugging Face 推出 LFM2.5-DSpark 模型,推理速度提升最高达 3.2 倍,通过轻量级草案模型和并行解码机制实现。
入选理由:DSpark 使 LFM2.5-8B-A1B 模型在 GPU 上推理速度提升 3.18 倍
FeaturedArticle#DSpark#LLM推理优化#Hugging Face#模型压缩英文