D-RAC是一种面向检索增强生成(RAG)系统的文档摄取方法,可处理PDF、办公文档、演示文稿和扫描件。该方法首先将输入文档标准化为PDF,再通过一次多模态大语言模型处理,将页面转换为适合检索的Markdown,同时保留标题层级,并将表格改写为可独立理解的文字陈述。随后,系统基于可寻址的标识符进行确定性分块,无需重新生成源文本。在包含236份文档、795页内容的基准数据集上,D-RAC在72分钟内
研究人员提出了 CARE(Corrective Atomic Robotic Execution)框架,旨在提升机器人“视觉-语言-动作”(VLA)策略的可靠性。现有的 VLA 策略在偏离标准轨迹时容易失效。CARE 通过学习执行过程中的失败经验,建模失败后的偏差分布,并合成具有代表性的失败状态与校正示范。在推理阶段,CARE 结合阶段式规划与物理 3D 监控,在保留任务进度的同时触发动态微调或重
OmniEdu 是一系列面向 K-12 学习与教学的开放基础模型。其指令微调语料包含 69,999 个样本,围绕四项能力构建:学科能力、课程结构理解、学习困难诊断推理,以及教学支持与脚手架。研究团队微调了 4B、9B 和 27B 模型,并评估其课程理解、K-12 解题、教学辅导和通用能力。OmniEdu-27B 在 K12-Bench 上取得 63.12% 的 Exact Match 和 76.6
该研究分析了稀疏策略内蒸馏,即只对学生模型生成轨迹中的少量令牌提供教师模型监督。作者提出信息效率比(IER),同时衡量令牌的有用性和梯度估计的可靠性。通过候选集近似,可以在保留采样反向 KL 训练目标的同时选择令牌。在数学和医学推理任务中,加入 IER 后,现有令牌选择方法在多种设置下得到改进。当令牌预算为 0.1% 至 1% 时,稀疏训练在部分情况下达到了或超过未进行令牌选择的完整策略内蒸馏。代
onPanda是一款用于高效标注大语言模型和智能体对齐数据的交互式工具。标注者在模型回答中找到第一个不恰当的令牌,从模型候选项中选择替代内容或直接输入正确文本,然后从修正后的前缀继续生成。一项小规模对照研究显示,与手动事后编辑相比,该方法可将标注时间中位数缩短52%。由于最终回答中的大多数令牌仍由模型生成,所得数据在很大程度上保留模型的采样分布,适合构建在线策略监督微调和偏好数据。记录的纠正还提供
Harness-Zero旨在将专用代理Harness带来的性能提升迁移到模型权重中。引导代理会在固定目标Harness的动作空间内纠正学生模型的回答,并据此生成微调数据。部署时可以移除专用Harness。在知识工作、工具使用和科学任务实验中,该方法将任务成功率宏平均从23.3%提升至44.3%,甚至超过保留专用Harness时的41.7%。此外,在三个领域的28种Harness诱导行为模式中,平均
阿里巴巴在云栖大会上公布了千问大模型系列的最新进展。据公司介绍,基于新一代架构的 Qwen4 已进入训练阶段,未来 Qwen4.5、Qwen5 等版本将扩展至 5—10 万亿参数。阿里还宣布,下一代视频生成模型将于 11 月发布,重点提升视频时长、可控性,以及人物、场景、镜头和完整叙事的一致性。阿里称,Qwen3.8-Max 能自主搭建部分训练流程、构造数据、设计实验并定位缺陷,在没有人类直接参与
小米发布开源 MiMo-V2.6 系列,包含多模态模型 Pro 和 Flash。据小米介绍,MiMo-V2.6-Pro 在金属有机框架(MOF)材料研究中协助检索文献、提出候选方案并分析模拟结果,探索用于吸附 PFAS 的材料设计;研发周期据称从约一个月缩短至两三天。北京大学研究员窦锦虎评价其达到训练有素的博士研究人员水平。小米还称,该模型协助使用 Lean 4 完成了 Li–Yorke 经典论文
研究人员提出 Grounded Action Models(GAM),一种将物体三维定位明确融入机器人基础模型的方法。语言、点和框提示会被转换为统一的以物体为中心的表示,其中包含面向目标的视觉特征和可度量的物体几何信息,再由多流 Transformer 与机器人状态历史结合,预测动作片段。GAM 在 RoboTwin 2.0 的 50 项任务中取得 55.3% 的平均成功率,在 LIBERO-PR
研究人员推出 VideoGen-Agent,这是一种通过多任务智能体强化学习训练、能够协调外部视频生成工具的多模态智能体。该系统在多轮交互中使用增强、生成和验证工具,以应对专业知识、特定身份保持、物理一致性、场景构图和事件顺序等问题。在包含600个提示的全新 VABench 基准测试中,VideoGen-Agent 将基础文本生成视频模型的得分从56.5提升至75.6。升级生成工具后,无需额外训练
Jev-Mem 是一种面向长期运行 AI 智能体的记忆架构。它将快速、轻量的控制与较慢且成本更高的审慎推理分开。System One 控制器负责记忆分类和关系组织、查询路由、检索预算分配、图遍历、候选评分以及自适应停止检索。System Two 仅在需要复杂推理和答案合成时启用。在 LoCoMo 基准测试中,Jev-Mem 的 LLM-as-a-Judge 得分为 0.777,相比最强基线相对提升
GameHorizon Suite是一套用于评估电子游戏中AI模型能力的数据集和基准。它衡量视觉理解、指令分解、目标规划,以及跨越短期和长期时间尺度的精确动作控制。该套件包括自动化标注流程、由100名资深玩家在21款AAA游戏中收集的5,000小时游戏记录,以及在时间上对齐的视频、玩家动作和多时间尺度指令。基准同时支持可复现的离线测试和逐步在线评估。研究团队对47个模型进行了超过100万次模型调用
研究人员提出一种方法,在部署时无需进行高成本的未来模拟,就能将世界模型对物理场景的理解迁移到紧凑型视觉-语言-动作(VLA)策略中。训练期间,系统使用冻结的世界模型处理训练帧并缓存其特征,再将特征对齐作为额外训练目标。训练完成后移除教师模型,因此部署策略的运行成本与基线模型相同:在消费级 RTX 5090 上,每次决策耗时 32 毫秒,占用 1.86GB 内存。一个拥有 8 亿参数的学生模型在 L
HuRo研究将人类活动视频机器人化后,能否作为视觉—语言—动作(VLA)模型预训练的可扩展监督数据。研究团队开发了一套流程,将不同来源的人类视频转换为与机器人对齐的观测数据和动作轨迹,并推断缺失的中间信号。由此构建的数据集包含约63万条机器人化片段,以及来自五个人类视频来源的1.42亿个处理帧。在四项真实世界操作任务中,增加机器人化预训练数据后,整体完成率从51.5%提升至80.3%;在空间和视觉
WorldCrafter是一种用于交互式探索动态环境的视频世界模型。它学习了一种可由摄像机查询的隐式3D感知记忆,以便在长时间跨度和不同视角之间保留历史观测。记忆编码器和姿态条件读取模块会在视频生成前,将历史多视角信息压缩为面向目标视角的专用标记,无需显式的深度对应关系。结合近期时序上下文和少步蒸馏,WorldCrafter能够根据单张输入图像或文本提示,以流式方式探索场景。针对静态和动态场景的实