通过扩展与蒸馏文本嵌入改进扩散模型
这项研究探讨哪种文本嵌入最适合作为连续扩散语言模型的潜在空间。在同一模型系列中扩大规模能够提升生成效果,但 T5Gemma-2 的嵌入会把合理替代词的表示分隔得过远。研究人员将 T5Gemma-2 解码得到的概率蒸馏到学生编码器中,使替代表示彼此靠近,形成更适合扩散的潜在空间。在 OpenWebText 上,该中型扩散模型在熵值与真实文本相当时,生成困惑度达到 17.8,并在这一指标上超过 GPT-2-M。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。