ALoDLM:采用自适应循环计算的扩散语言模型
扩散语言模型能够并行生成多个词元,但其质量往往落后于规模相近的自回归模型。ALoDLM通过按词元调整的潜在状态循环计算来缩小差距:为更难预测的词元分配更多计算,并将已确定的词元作为上下文反馈。该模型在17亿和80亿参数规模下训练,在11项基准测试的平均得分上超过了受测扩散模型及相应的自回归基线,同时保留并行解码能力。在评估的模型中,它展现出较好的质量与效率平衡。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。