Hugging Face 发布 LFM2.5 系列 DSpark 草稿模型,推理速度最高提升 3.18 倍。
Hugging Face 发布了 LFM2.5 系列三款模型的 DSpark 草稿模型检查点。通过投机解码,这些模型在不改变输出质量的前提下,实现了 GPU 吞吐最高 3.18 倍的提升,端侧推理速度最高提升 2.87 倍。
草稿模型参数量约为 300M,LFM2.5-2.6B 的函数调用延迟平均降低 57%。相关模型已开源,并支持 llama.cpp 和 SGLang。
Hugging Face 发布 LFM2.5 系列 DSpark 草稿模型,推理速度最高提升 3.18 倍。
Hugging Face 发布了 LFM2.5 系列三款模型的 DSpark 草稿模型检查点。通过投机解码,这些模型在不改变输出质量的前提下,实现了 GPU 吞吐最高 3.18 倍的提升,端侧推理速度最高提升 2.87 倍。
草稿模型参数量约为 300M,LFM2.5-2.6B 的函数调用延迟平均降低 57%。相关模型已开源,并支持 llama.cpp 和 SGLang。
该草稿模型可帮助 FDE 在企业 AI 交付中优化 Agent 推理性能,降低函数调用延迟和算力成本。开源且支持 llama.cpp 与 SGLang,便于集成到客户现有技术栈,提升端侧与 GPU 场景下的部署灵活性。FDE 掌握投机解码与草稿模型能力,有助于增强企业级 Agent 项目的交付效率与竞争力。