并非所有提示词都相同:面向多模态强化学习后训练的探索引导式提示词支架
一项研究提出了一种方法,在多模态大语言模型的强化学习后训练过程中动态调整训练提示词的分布。探索潜力评分(EPS)利用在线策略回滚统计数据,估计提示词能够提供的学习价值。该方法不直接丢弃低价值提示词,而是让教师模型在保留原始任务意图的前提下进行改写,从而产生更有信息量的训练信号。与GRPO结合后,该方法在Geo3K和MMK12上均超过基线,域内相对提升最高达9.7%,在MathVision和MMMU-Pro上分别提升11.5%和11.1%。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。