原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2608.20492
立即前往原文

将标注作为 Rollout:面向视频 MLLM 的高效可扩展强化学习

该论文提出 OraRL,一种用于视频理解多模态大语言模型强化学习后训练的方法。它不仅利用标注对 rollout 进行评分,还将标注作为直接的正向优化目标。研究发现,高奖励的 oracle rollout 会抬高群组基线,导致原本正向的策略优势反转;OraRL 通过解耦优势估计器缓解这一问题。作者称,基于符号平衡的剪枝使每步耗时仅为监督微调的 2.2 倍,低于带思维链生成的 GRPO 的 4.9 倍。OraRL 可从 0.8B 扩展到 9B 参数规模,并在多项视频和空间智能基准测试中取得提升。Video-ORA-9B 在不使用思维链的情况下,也将解码时间大幅缩短。
行业资讯 应用 AI模型 研究 2026-08-26 13:30:58 146 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。