将标注作为 Rollout:面向视频 MLLM 的高效可扩展强化学习
该论文提出 OraRL,一种用于视频理解多模态大语言模型强化学习后训练的方法。它不仅利用标注对 rollout 进行评分,还将标注作为直接的正向优化目标。研究发现,高奖励的 oracle rollout 会抬高群组基线,导致原本正向的策略优势反转;OraRL 通过解耦优势估计器缓解这一问题。作者称,基于符号平衡的剪枝使每步耗时仅为监督微调的 2.2 倍,低于带思维链生成的 GRPO 的 4.9 倍。OraRL 可从 0.8B 扩展到 9B 参数规模,并在多项视频和空间智能基准测试中取得提升。Video-ORA-9B 在不使用思维链的情况下,也将解码时间大幅缩短。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。