扩散模型的策略内自蒸馏
DiffusionOPSD是一种策略内自蒸馏方法,用于根据人类偏好和特定任务奖励调整扩散模型。该方法将图像级奖励梯度转换为去噪过程中间预测的明确训练目标。在SD 3.5-M和Z-Image-Turbo上的实验中,它在20个奖励匹配设置中的19个取得了最佳最终留出分数。与最强竞争方法相比,性能最高提升44%;相较DiffusionNFT,GPU使用时间在SD 3.5-M上减少40%,在Z-Image-Turbo上减少63%。研究还区分了目标构建带来的收益与有限训练后实际实现的收益。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。