Liquid AI与Hugging Face发布DSpark草稿模型,推理速度最高提升3.18倍
Liquid AI与Hugging Face发布了LFM2.5-1.2B-Instruct、LFM2.5-2.6B和LFM2.5-8B-A1B的DSpark草稿模型检查点。该方法基于投机解码,在贪心解码下不改变输出质量,据称可使GPU整体吞吐量最高提升3.18倍,端侧设备最高提升2.87倍。在端侧智能体场景中,LFM2.5-2.6B的函数调用延迟平均降低57%。使用M4 Max MacBook Pro测试时,输出速度最高达到每秒139个token。相关检查点已以Safetensors和GGUF格式开源,并支持SGLang和llama.cpp。
本文来源:AIbase,仅供学习参考,版权归原作者所有。