Abra:扩展图像扩散模型训练规模
一项系统性研究利用 Abra(一系列受控的流匹配 Transformer),分析文本生成图像扩散模型的扩展规律。研究使用 10^19 至 10^22 FLOPs 的计算量训练模型,覆盖三个数量级。结果显示,扩散模型与语言模型一样,能够以可预测的方式扩展,但要实现最优训练,需要更多数据:每个参数约需 200 个图像 token,约为语言模型 Chinchilla 计算最优建议的十倍。与语言模型不同,扩散模型对过度训练相对稳健,因此实践中应优先增加数据,而不是单纯扩大模型规模。研究还发现,生成质量指标、最佳无分类器引导设置、表示质量以及训练曲线的形状,也都呈现出可预测的扩展规律。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。