离散扩散让大语言模型在保持质量的同时实现无损加速
研究人员推出了Uno,这是一种将自回归语言模型与扩散方法结合的架构,可并行生成多个词元。自回归权重仍使用标准的下一词元预测目标进行训练,轻量级扩散权重则负责并行生成。据研究人员介绍,扩散蒸馏只会带来极低的额外训练成本,也不需要像投机解码那样使用独立的草稿模型。在评测中,Uno在不降低基础自回归模型质量的情况下,最高实现约3倍的生成速度提升。研究报告称,8B版本在智能体工具使用、编程和长上下文推理基准上均超过了26B的DiffusionGemma和商业模型Mercury 2。研究团队已公开代码和模型检查点。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。