AI 新闻中心

AI 新闻中心 过去7天分析了 960 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

InterEvolve:面向人形机器人移动与操作的测试时奖励程序进化

InterEvolve研究人形机器人如何在不重新训练的情况下,利用已有技能完成训练期间未接触过的移动与操作任务。具备物体感知能力的行为模型和LLM代理利用执行反馈及经过验证的程序,迭代改进奖励程序;数值优化器则调整其参数。在仿真中,该方法为多种任务和长时序动作组合生成了相应行为。部分进化出的技能还借助机载第一人称视角感知,在Unitree G1上实现了自主运行。

让稀疏奖励发挥作用:面向多奖励强化学习的密度感知奖励聚合

多奖励强化学习旨在训练大型语言模型同时满足多个行为目标。研究发现,即使采用针对各项奖励分别归一化的方法,不同目标之间的学习信号仍可能不均衡。论文指出,某项奖励的优势能量与其在多少比例的 rollout 组中产生非零相对信号有关。作者提出 DARA,根据每个批次中各奖励的活跃程度调整权重,让较少出现的奖励获得更大权重,同时不改变策略优化目标。在工具调用和数学推理实验中,与 GDPO 相比,DARA

通过跨执行框架适配实现检索增强型技能优化

这项研究提出检索增强型技能优化(RASO),用于改进可复用的 AI 智能体自然语言指令。RASO 从外部现有技能库中检索相关知识,并根据目标任务和智能体执行框架进行适配。初始化阶段无需运行智能体,即可构建以知识为基础的技能;随后利用执行反馈和额外检索到的知识对技能进行迭代优化。在四项智能体基准测试和两个模型上的实验中,RASO 均优于未采用检索增强初始化与更新的基线方法。