用于强化微调的动态重要样本挖掘
强化微调(RFT)越来越多地用于提升大型模型的推理能力,但其效果很大程度上取决于训练数据的选择。现有多数数据中心型RFT方法采用静态或启发式样本选择,忽略了样本价值会随着策略学习过程发生变化。Dynamic Important Example Mining(DIEM)提出了一种在RFT过程中自适应利用数据的框架。该方法通过梯度对齐估计每个样本对策略改进的边际贡献,并在保持梯度幅度的同时重新调整批次权重,以稳定优化过程。作者称,DIEM在多个推理基准测试中持续优于多种静态和动态基线方法。相关代码计划在GitHub上发布。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。