原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.15051
立即前往原文

并非所有提示词都相同:面向多模态强化学习后训练的探索引导式提示词支架

一项研究提出了一种方法,在多模态大语言模型的强化学习后训练过程中动态调整训练提示词的分布。探索潜力评分(EPS)利用在线策略回滚统计数据,估计提示词能够提供的学习价值。该方法不直接丢弃低价值提示词,而是让教师模型在保留原始任务意图的前提下进行改写,从而产生更有信息量的训练信号。与GRPO结合后,该方法在Geo3K和MMK12上均超过基线,域内相对提升最高达9.7%,在MathVision和MMMU-Pro上分别提升11.5%和11.1%。
行业资讯 AI模型 研究 2026-09-15 11:01:21 600 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。