AI 新闻中心

AI 新闻中心 过去24小时分析了 216 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

Raven:面向可组合智能体智能的“框架之框架”

Raven 是一个开源多智能体生态系统,旨在针对特定模型和领域自动构建并迭代模块化框架。主控智能体负责拆解目标、将子任务分配给专用智能体、协调任务依赖并整合结果。主控档案库和 EverOS 用于跨任务保存经验,Skill Forge 则将经验转化为可复用流程。作者提出了智能体组合能够扩大可靠任务覆盖范围的理论条件,并报告称,Raven 在复杂的长周期任务上优于现有智能体系统。

ROSS:通过选择性监督从自生成的 rollout 中重新学习

语言模型后训练中产生的历史 rollout 可能保留有用行为,但也可能包含错误和冗余步骤。ROSS 将完整的历史轨迹保留为上下文,只对选定的模型生成续写部分计算训练损失。在数学、代码生成、指令遵循和软件工程评测中,该方法提升了已有检查点的表现。以 Qwen3.6-35B-A3B 为例,六项 MOPD 基准的平均分从 58.40% 提高到 62.20%,SWE-bench Verified 从 64

Marathoner:执行超长周期任务的自主 AI

论文介绍了 Marathoner,这是一种旨在长时间执行任务的自主智能体模型。其训练流程利用 GitHub 上的大型代码变更请求合成高难度任务,再将多个任务串联成更具挑战性的序列。随后,模型通过筛选后的执行轨迹进行微调,并在沙盒环境中执行任务以接受强化学习训练。作者称,在五项长周期任务基准测试中,Marathoner 的表现持续优于基础模型,部分比较中也超过了强大的专有模型。据称,它在困难任务上可

CrossBFM 蒸馏出适用于多种人形机器人的共享潜在行为空间

CrossBFM 在多种人形机器人之间迁移共享的潜在行为空间。该方法利用不同机器人身体之间的逐帧动作对应关系,在不到一小时的 GPU 时间内蒸馏出这一空间,随后通过传统 PPO 训练由潜在表示驱动的全身控制器。三种人形机器人的测试显示,该方法可迁移到动作跟踪、目标姿势到达和奖励优化任务。在未参与训练、形态相似的机器人上,动作跟踪性能达到已知机器人表现的最高 89%。研究还在真实机器人上验证了整套流

HybridCUA:训练计算机操作智能体结合使用 GUI 与 CLI

HybridCUA研究计算机操作智能体如何结合图形用户界面(GUI)与命令行界面(CLI)。研究团队构建了包含5,000条GUI与CLI交替操作轨迹,以及3,000项经过验证的强化学习任务的数据集。经过监督微调和强化学习后,HybridCUA-9B在OSWorld上的准确率达到53.6%,比基础模型高14.8个百分点;在WindowsAgentArena上的表现也提升了4个百分点。

豪威推出常开型视觉 AI 协处理器 OAX7700,停车监控功耗仅为现有方案的 3%

豪威(OmniVision)近日推出搭载 NPU 的常开型视觉 AI 协处理器 OAX7700。据称,基于该芯片构建的停车监控系统,功耗仅为现有方案的 3%。芯片支持人体检测、人和物体识别及距离测算等边缘 AI 功能。常开模式下,车载摄像头以极低功耗持续监测周边环境,检测到事件后切换至正常工作模式,并录制事件发生前 5 至 10 秒的视频,交由电子控制单元分析;必要时可触发报警。目前该芯片已出样,

豆包新增机票、火车票预订及打车导航服务

AI 助手豆包现已支持多种出行服务。用户可通过自然语言在对话中预订机票和火车票、叫车,并进行路线规划和实时导航,无需在多个应用之间切换。此次升级扩展了豆包原有的酒店和餐饮预订功能。相关服务由豆包与航班管家、高铁管家、曹操出行、百度地图等合作伙伴共同提供。

哈萨克斯坦总统支持优必选在阿拉木图建设机器人制造工厂

哈萨克斯坦总统托卡耶夫表示支持优必选在阿拉木图建设机器人设备制造工厂,产品将主要面向教育和服务领域。这将成为优必选在中国境外的首个生产基地。双方还讨论了在 Amalty City 项目,以及采矿、石油天然气和大型物流设施中部署机器人,并探讨与哈萨克斯坦技术类高校和学院建立系统性合作机制、设立联合能力中心。优必选今年上半年实现营收 12.69 亿元,同比增长 104.2%;归母净亏损为 3.11 亿

法拉第未来:目标年底前投运机器人工厂

法拉第未来在匹兹堡举行的 IROS 期间公布“Built in USA”计划第二阶段方案,拟加快 Next Futurist 和 Next Aegis 系列机器人的开发,为机器人产品申请 FCC 有条件批准,并推进供应链、合规认证和制造产能建设。公司目标是在今年年底前启动机器人工厂,并于 2027 年第一季度实现首款新 EAI 机器人产品下线。此外,FFAI 已与 AIxC(拟更名为 FFR)签署

OpenAI 推出 Codex 专用插件,可用自然语言制作 Game Boy 风格游戏

OpenAI 在开发者活动中宣布推出 Game Studio,将其 AI 智能体工具 Codex 接入 ModRetro 的复古掌机 Chromatic。用户可以用自然语言描述游戏需求,由 Codex 协助生成程序代码。插件内置 Chromatic 模拟器,开发者可先在电脑上测试,再将游戏串流到实体设备。完成后的游戏可写入专用卡带或空白卡带,并在掌机上运行。

LEGO-Anything:用于三维场景重建的编程智能体

LEGO-Anything 是一个图像到代码框架,编程智能体会迭代编写、执行、检查和修改 Blender 代码,从单张图像生成可编辑的场景程序。新的 LEGO-Bench 评估生成场景的有效性、可见表面几何结构和渲染外观。在受测智能体中,GPT-6-astra 的综合表现最佳,但在准确恢复场景几何与外观方面仍存在明显差距。无需训练的 LEGO-Plugin 使全部六个模型的综合相对得分最高提升 6

LIFT:通过策略内自蒸馏实现大视角变化下的未来布局控制视频生成

LIFT 是一种可控的图像到视频生成框架,将相机控制与未来布局控制结合起来。用户可以指定未来视角中应出现的内容及其位置,尤其是最终帧的场景布局。现有方法通常只能控制相机运动轨迹,而文本提示对未来内容和空间布局只能提供粗略指导。LIFT 采用策略内自蒸馏,将使用逐帧密集布局训练的教师模型能力迁移到仅以最终帧布局为条件的学生模型中。研究人员还构建了 LIFT-Vista 数据集,其中包含大幅视角变化以

WorldLine:面向机器人操作的动作驱动视觉模拟

WorldLine是一种用于机器人学习的视觉模拟器,可在实际执行前预测动作结果。该系统利用超过1万小时的无动作机器人视频学习操作动力学,并通过来自十多种机器人形态的超过2000小时动作轨迹进行动作对齐。基于图像空间的动作表示为不同机器人提供了统一控制接口。在留出数据和分布外场景中,WorldLine使失败轨迹的机器人掩码IoU较最强基线提高0.1626,并以74%的平均准确率预测轨迹是否成功。在未

EVO-WAM:通过视频—动作验证改进世界动作模型

EVO-WAM无需收集额外的专家示范,也无需在外部环境中执行候选动作,即可将世界动作模型适配到新的机器人任务。该方法利用视觉语言模型筛选能够完成任务的视频片段,并通过逆向动力学模型验证视频与对应动作是否一致。在RoboTwin 2.0的七项未见任务中,Cosmos3的平均成功率从26.9%提高到68.0%,DreamZero则从28.5%提高到46.4%。在真实世界的三项未见长时程复合任务中,Co