AI 新闻中心

AI 新闻中心 过去30天分析了 4734 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

PivotOPD让多轮智能体学会从关键错误中恢复

PivotOPD是一种用于训练语言智能体的在策略蒸馏方法,旨在帮助模型避免关键错误,并从错误造成的状态中恢复。在三个Qwen3模型上的实验显示,超过一半的失败轨迹包含一个发生较早的行动,该行动会使智能体偏离任务目标。研究人员发现,许多此类失败只需在关键错误后的几轮中提供引导即可恢复。在ALFWorld、WebShop和基于搜索的问答测试中,PivotOPD在Qwen3-1.7B和Qwen3-8B上

LoopVL:循环式视觉智能

LoopVL研究了能否将Loop Transformer有效扩展到视觉语言模型。该模型结合Module-Loop与Model-Loop计算,通过共享模块迭代更新统一的视觉语言状态。LoopVL从零开始训练,经历语言预训练、多模态训练和后训练。在多模态理解和视觉推理基准测试中,其表现优于多个规模相近或更大的非循环模型。研究人员还观察到,随着循环迭代,视觉注意力会发生显著变化。