Co-RL:多智能体强化学习中的多样化模型群体涌现无监督推理
该研究提出 Co-RL,一种协作式强化学习框架,由多个相互独立的模型根据彼此的输出生成奖励信号。模型不共享参数,因此可以减少对成本高昂的真实标签的依赖。研究人员表示,增加模型系列、模型规模以及改写训练样本的多样性,有助于降低相关错误和自我强化反馈循环,从而缓解训练崩溃。在七项纯文本基准测试和四项多模态基准测试中,Co-RL 使语言模型平均提升 3.0% 至 8.6%,使视觉语言模型提升 2.3%
AI 新闻中心 过去7天分析了 921 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
该研究提出 Co-RL,一种协作式强化学习框架,由多个相互独立的模型根据彼此的输出生成奖励信号。模型不共享参数,因此可以减少对成本高昂的真实标签的依赖。研究人员表示,增加模型系列、模型规模以及改写训练样本的多样性,有助于降低相关错误和自我强化反馈循环,从而缓解训练崩溃。在七项纯文本基准测试和四项多模态基准测试中,Co-RL 使语言模型平均提升 3.0% 至 8.6%,使视觉语言模型提升 2.3%
LeadShine Technology战略投资总监Nangle Zheng表示,中国已将人形机器人的开发周期从数年缩短至仅数月。他在彭博社节目《The China Show》中与David Ingles和Yvonne Man讨论了中国的机器人供应链。
一项研究提出将 Top-K 提示作为单步逆合成的训练和推理方法,使系统能够生成多条合理的反应路径,而不是只给出一个答案。研究人员构建了 CREED-CCV-2+USPTO-XL 数据集,其中包含约 4,560 万条经过验证的反应,并据此训练化学语言模型 C3LM。模型将微调与基于 ChemCensor 的奖励及面向新颖性的奖励相结合。研究作者称,该模型在分布外基准 URSA-expert-2026
该研究分析了在采用JEPA风格潜在世界模型的模型预测控制中,目标潜在表示的欧氏距离能否可靠反映实际任务进展。作者提出Plan-Real Spearman和CEM-Stage Spearman,用于衡量候选动作序列的潜在排序与真实排序在搜索前及交叉熵方法搜索逐渐集中时的一致性。研究指出,编码器失真、终端滚动预测误差和候选方案之间的差距是影响对齐效果的关键因素。DA-LeWM在LeWM基础上加入逆向动
京东物流完成首批一线员工转型机器人维修工程师的培训,参与者包括快递员、仓管员和质检员。来自中国各地的员工学习了机器人产业、设备构造和标准化维修流程,并使用头部机器人企业提供的样机进行实操。完成培训和岗位认证的员工已开始担任新职务。京东物流称,其机器人售后服务涵盖维修、故障诊断、换电补能、测试鉴定、保养和设备回收等环节。公司表示,未来五年将创造超过10万个机器人维修工程师岗位,并建设更多技术培训认证
Zetta是一套面向具身AI代理的闭环控制与学习系统。在冻结基础策略模型的同时,它能够在线演化运行时批评器和恢复技能。三个具有不同时间尺度的循环分别负责在动作频率上进行执行控制、在每次 rollout 层面提出批评与恢复方案,并在通过验证后更新技能。结合将代理逻辑与异构执行资源解耦的Z-Infra,研究团队报告称,Zetta在LIBERO-Pro和RoboCasa上的成功率分别达到90.8%和93
SoftVTBench 是一个用于评估可变形物体操作的数据集和基准,重点衡量物理交互质量。它包含 4,000 次专家示范和 50 多个物体,包括体积可变形物体及外观匹配的刚性对照物。每个回合同步记录多视角 RGB 图像、双指触觉图像和标记点运动、本体感知、语言及夹爪动作,并提供仅供评估使用的有限元状态作为独立的物理真实值。该基准提出“形变感知成功率”,只有在完成任务且最大形变保持在容差范围内时才算
宇树科技创始人王兴兴表示,人形机器人要实现大规模普及,当前最大的障碍已不再主要是运动硬件,而是大模型与真实机器人之间的对齐。她将具身智能的“ChatGPT时刻”定义为:机器人身处80%的陌生场景时,仅凭语音或文字指令,就能独立完成约80%的任务。王兴兴预计,这一拐点最快可能在2到3年内到来,较慢则需要5到10年。相关判断属于行业预测,目前并不构成技术突破已经实现的证据。
中国机器人公司宇树科技(Unitree Robotics)创始人表示,人形机器人有望在未来十年内进入大众市场。制造商首先需要解决目前限制其实际用途的技术和应用问题。
SemComp-Bench提出了一项面向结果的视频生成评测基准。只有同时实现预期结果,并保持与参考图像相关的任务语义对应,生成结果才算成功。其数据集SemComp-Data覆盖六个领域,包含参考图像、详细和简短指令,以及以结果为中心的视频片段。一个四阶段数据整理流程将原始视频转换为标准化样本。评测使用视觉语言模型回答结构化二元问题,并分别报告结果达成度和生成可靠性分数。对多种代表性视频生成模型的实
苹果已回应 OpenAI 要求驳回相关诉讼的动议。苹果此前起诉两名前员工、OpenAI 和 io Products,指控他们不当获取苹果商业秘密。OpenAI 称,苹果未明确证明相关信息属于受法律保护的商业秘密,也未充分指控盗用行为或证明损失,并认为苹果自身的数据管理和员工离职流程存在问题。苹果对此予以反驳,称诉状已经清楚列出具体机密信息和相关行为,足以支持案件继续审理。苹果指控,前员工 Chan
Meta 据报道正在准备推出视频生成模型 Muse Video,目前已邀请部分合作伙伴参与 Beta 测试。公开样片显示,该模型单次最多可生成 10 秒视频,在细节呈现、场景与物体关系理解以及时间连续性方面展现出一定潜力。不过,Meta 承认模型仍存在音画同步不足,以及高速运动物理准确性不够等问题。现有短片样本尚不足以证明其在长时长叙事、角色持续一致性或复杂动作场景中的稳定表现。
微软发布了 Visual Studio Code 1.134,重点新增并排聊天、提示时间线、聊天中查找和 HTML 文件预览四项功能。开发者可以将聊天窗口和子智能体对话按水平或垂直方式并排放置,以便比较结果或同时监控工作进度。返回会话或重新加载窗口时,VS Code 会自动恢复聊天分组布局和焦点。智能体窗口中的提示时间线可以帮助用户快速定位此前的提示。现在,用户还可以使用 Ctrl+F,在聊天视图
FM-Bench评估语言模型代理能否在行动后果不断累积的长期环境中持续做出有效决策。每个代理使用26种工具和约340至400个决策节点,管理一支足球俱乐部20个游戏内赛季。它需要组建阵容、交易球员、谈判合同、投资设施和青训、安排首发,并向有权解雇它的董事会负责。最终分数由确定性引擎计算,不使用LLM裁判或人工评分。在针对15个前沿模型的单人赛和共享世界Arena测试中,所有模型都完成了整个周期。C
SemaPLC 是一个用于生成可编程逻辑控制器(PLC)代码的代理框架。它整合传统工具,只有在外部检查确认规格、编译结果以及实时运行环境中的行为后,才会判定任务完成。在涵盖 117 个独立程序组织单元任务、涉及 7 个模型的测试中,SemaPLC 的严格验证通过率平均达到 72.6%。在另一项包含 65 个项目上下文任务的测试中,生成的逻辑必须在现有项目内完成编译并运行;SemaPLC 在集成编译