Second Thought:LLM智能体行动与观察期间的并行推理
采用ReAct范式的LLM智能体会在推理、行动和观察之间交替进行,但在等待环境响应时,推理会暂停。Second Thought利用这段空闲时间,在每次Thought阶段结束后立即并行启动四个辅助推理分支,并在下一次环境观察到达时合并结果。在三个智能体基准和三个推理模型上,该方法在全部九个模型与基准组合中都降低了平均交互轮数。在其中六个组合中,主线程的顺序解码量最多减少43%,第七个组合基本不变。P
AI 新闻中心 过去一年分析了 1373 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
采用ReAct范式的LLM智能体会在推理、行动和观察之间交替进行,但在等待环境响应时,推理会暂停。Second Thought利用这段空闲时间,在每次Thought阶段结束后立即并行启动四个辅助推理分支,并在下一次环境观察到达时合并结果。在三个智能体基准和三个推理模型上,该方法在全部九个模型与基准组合中都降低了平均交互轮数。在其中六个组合中,主线程的顺序解码量最多减少43%,第七个组合基本不变。P
该研究提出潜在在线策略自蒸馏(LOPD),旨在帮助 AI 智能体将经验直接融入自身策略。LOPD 不依赖设计者预先制定的特权信息,而是端到端学习这类上下文:系统检索相关经验,并将其组合为连续潜在 token,用于调节自教师模型。学生模型根据任务和交互历史生成轨迹,并在每个访问过的前缀位置获得密集的 token 级监督。研究还引入特权边际目标,以提升训练稳定性。在智能体工具使用和代码生成实验中,LO
MobileMem 是一个用于研究设备端 AI 智能体长期记忆的基准和框架。它基于为期一年的移动体验数据,并通过知识驱动的合成流程,从用户与应用的交互会话中构建连贯且具有时间一致性的长期轨迹。该基准涵盖文本和多模态场景,评估多跳推理与时间推理、知识更新以及隐式偏好推断。MobileMem 不仅关注对孤立事实的检索,还评估智能体能否记住过去、理解现在,并随着时间推移适应用户。
PRM-as-a-Judge 1.5是一套用于精细评估机器人操作流程的工具包。它将执行视频转换为密集的进度曲线,并提供衡量失败过程进展、性能下滑后恢复能力以及成功执行质量的多项指标。项目还推出RoboPulse++,用于测试流程奖励模型的可靠性。该套件包含基准测试、指标实现和可视化工具,支持对具身模型进行透明且可复现的评估。
法国研究团队称,他们将取自已故成年人的活性脑组织接入了由电极、麦克风和机械手组成的闭环系统。这些被称为 OPAB 的脑组织外植体接受训练,将三个音符与三根机械手指的动作建立关联。在 16 个样本中,平均模仿准确率从第一天的 31.2% 提升至训练三天后的 58.5%。其中 62.5% 的样本至少学会了两个音符,部分关联在 17 天后仍然保留。研究人员认为,这种能力源于脑组织内部神经连接的变化,而不
该研究提出GAS,一种面向多模态大语言模型的训练框架,将视觉生成重新定义为表征学习的辅助监督。GAS在解耦的Mixture-of-Transformers架构中采用下一嵌入预测,通过生成任务增强共享视觉路径,同时避免生成梯度直接干扰上层理解模块。训练完成后,生成分支会被移除,因此推理阶段无需额外计算。实验表明,GAS能够提升多模态理解能力,其中在视觉感知和空间理解方面的收益最为稳定。
CPI-Bench是一项用于评估AI图像编辑模型的新基准,重点测试模型在真实应用场景中的表现。它包含三个子集:覆盖多种编辑任务并首次纳入多图像编辑评估的CPI-General-Bench,聚焦高频用户场景的CPI-Practical-Bench,以及评估高难度推理式编辑能力的CPI-Intelligent-Bench。对主流图像编辑模型的评估表明,该基准能够更有效地区分模型在通用编辑、实际部署和高
HumanTracker是一项用于评估人形机器人动作跟踪能力的基准,旨在让评估结果更符合人类对视频的感知。传统运动学指标通常计算逐帧姿态差异的平均值,却难以捕捉支撑不稳定、脚部滑动和落地时机错误等关键物理问题。该基准收集了来自多名专业表演者的约153小时光学动作轨迹,分为四类动作,并配有文本标签以支持细致诊断。研究人员还提出了HumanScore指标,该指标使用由1.2万组动作对、共2.4万个动作
随着大语言模型规模扩大,为维持适当的 token 与参数比例(TPP),训练 token 预算也必须增加。然而,高质量领域数据比通用网络数据更难扩充。本研究考察了重复使用现有领域数据,能否在避免过拟合的同时,抵消其在训练数据混合中的占比下降。对于固定领域和 TPP,最佳重复次数会随着模型规模扩大而小幅增加。在不同领域之间,最终验证损失越低,通常越能从更多重复中受益;而独有领域数据的数量与最佳重复次
研究提出了主张级可靠性评估(Claim-Level Reliability Assessment,CLR),这是一种无需额外训练、旨在更高效利用推理时计算资源的方法。CLR不再生成更多完整解答,而是从推理轨迹中提取对决策至关重要的主张,并针对性地检查其中是否存在决定性错误。该方法利用了一个不对称性:构建正确解答需要一条完全无误的推理路径,而反驳错误主张只需找到一个决定性缺陷。在四个大语言模型和四个
这项研究提出了 RA-Bench,这是一个用于检测描绘现实危机事件的人工智能生成视频的基准数据集。数据集共包含17,886段视频:来自10类社会风险的1,830段真实参考视频,以及由4个开源和5个闭源生成器制作的16,056段生成视频。研究评估了7种传统检测器、10个零样本多模态模型,以及2个专门针对人工智能生成视频检测进行微调的模型。结果显示,三类检测器都无法在整个基准上实现稳定泛化。生成质量、
Dion3是Muon优化器的改进版本,旨在降低Newton-Schulz正交化步骤带来的计算和通信开销。其Gram Newton-Schulz算法减少了FLOP成本,优化后的CuteDSL内核利用对称性提升速度,批量合并策略则降低分布式训练中的通信开销。此外,新的更新规则每一步只对动量矩阵的一部分行进行正交化。作者称,Dion3在损失表现上可达到或优于Muon,同时将优化器单步耗时最多缩短6倍。该
一项研究通过36项长期人工智能研发任务,评估了7个前沿模型。该框架不仅考察最终得分,还分析解决方案构思、执行、反馈控制,以及代理在任务内和任务间复用经验的能力。结果表明,当前代理更像工程优化器,而不是完全自主的研究人员。它们能够制定并实施实用方案,但不同运行结果之间的性能差异较大。表现最好的方案通常是对已有技术进行调整或组合,真正的方法论创新仍然少见。研究还发现,流程瓶颈、经验复用方式以及运行环境
Marionette是一种面向交互式游戏的世界模型。它不直接生成像素或潜在表示,而是预测一个包含多实体关节骨架、根部轨迹和旋转的276维显式三维世界状态。无参数渲染器根据该状态计算几何结构和遮挡,带控制条件的视频扩散模型则生成逼真的RGB画面。这种分离式设计提升了可控性和长时一致性。向预测状态加入地形碰撞器和距离上限后,角色陷入地面的情况减少了66%,角色彼此漂移过远的问题也得到抑制。研究人员表示
研究人员推出 Mobius-v0,这是一种将存储知识向量的全局共享记忆模块,与负责迭代执行组合推理的多个推理器分离的架构。研究团队称,从头训练的 7B 模型仅使用 7B Transformer 基线模型 62.6% 的训练数据,就达到了相近的下游任务成绩。基于 Qwen3.5-35B 持续预训练的 Intern-S2-Mobius,据称在保持相近性能的同时,实现了接近 4 倍的端到端推理速度。