扩展大语言模型预训练中的领域数据重复使用
随着大语言模型规模扩大,为维持适当的 token 与参数比例(TPP),训练 token 预算也必须增加。然而,高质量领域数据比通用网络数据更难扩充。本研究考察了重复使用现有领域数据,能否在避免过拟合的同时,抵消其在训练数据混合中的占比下降。对于固定领域和 TPP,最佳重复次数会随着模型规模扩大而小幅增加。在不同领域之间,最终验证损失越低,通常越能从更多重复中受益;而独有领域数据的数量与最佳重复次数之间的关联较弱。研究结果表明,在相同 TPP 下通过较小代理模型调优得到的重复设置,可以为更大模型提供实用的估计。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。