原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2608.14071
立即前往原文

扩展大语言模型预训练中的领域数据重复使用

随着大语言模型规模扩大,为维持适当的 token 与参数比例(TPP),训练 token 预算也必须增加。然而,高质量领域数据比通用网络数据更难扩充。本研究考察了重复使用现有领域数据,能否在避免过拟合的同时,抵消其在训练数据混合中的占比下降。对于固定领域和 TPP,最佳重复次数会随着模型规模扩大而小幅增加。在不同领域之间,最终验证损失越低,通常越能从更多重复中受益;而独有领域数据的数量与最佳重复次数之间的关联较弱。研究结果表明,在相同 TPP 下通过较小代理模型调优得到的重复设置,可以为更大模型提供实用的估计。
行业资讯 AI模型 研究 2026-08-17 11:31:16 297 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。