原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2608.29252
立即前往原文

用于强化微调的动态重要样本挖掘

强化微调(RFT)越来越多地用于提升大型模型的推理能力,但其效果很大程度上取决于训练数据的选择。现有多数数据中心型RFT方法采用静态或启发式样本选择,忽略了样本价值会随着策略学习过程发生变化。Dynamic Important Example Mining(DIEM)提出了一种在RFT过程中自适应利用数据的框架。该方法通过梯度对齐估计每个样本对策略改进的边际贡献,并在保持梯度幅度的同时重新调整批次权重,以稳定优化过程。作者称,DIEM在多个推理基准测试中持续优于多种静态和动态基线方法。相关代码计划在GitHub上发布。
行业资讯 研究 开源 2026-09-01 13:01:01 859 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。