AI 新闻中心

AI 新闻中心 过去30天分析了 4727 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

Marathoner:执行超长周期任务的自主 AI

论文介绍了 Marathoner,这是一种旨在长时间执行任务的自主智能体模型。其训练流程利用 GitHub 上的大型代码变更请求合成高难度任务,再将多个任务串联成更具挑战性的序列。随后,模型通过筛选后的执行轨迹进行微调,并在沙盒环境中执行任务以接受强化学习训练。作者称,在五项长周期任务基准测试中,Marathoner 的表现持续优于基础模型,部分比较中也超过了强大的专有模型。据称,它在困难任务上可

CrossBFM 蒸馏出适用于多种人形机器人的共享潜在行为空间

CrossBFM 在多种人形机器人之间迁移共享的潜在行为空间。该方法利用不同机器人身体之间的逐帧动作对应关系,在不到一小时的 GPU 时间内蒸馏出这一空间,随后通过传统 PPO 训练由潜在表示驱动的全身控制器。三种人形机器人的测试显示,该方法可迁移到动作跟踪、目标姿势到达和奖励优化任务。在未参与训练、形态相似的机器人上,动作跟踪性能达到已知机器人表现的最高 89%。研究还在真实机器人上验证了整套流

HybridCUA:训练计算机操作智能体结合使用 GUI 与 CLI

HybridCUA研究计算机操作智能体如何结合图形用户界面(GUI)与命令行界面(CLI)。研究团队构建了包含5,000条GUI与CLI交替操作轨迹,以及3,000项经过验证的强化学习任务的数据集。经过监督微调和强化学习后,HybridCUA-9B在OSWorld上的准确率达到53.6%,比基础模型高14.8个百分点;在WindowsAgentArena上的表现也提升了4个百分点。

豪威推出常开型视觉 AI 协处理器 OAX7700,停车监控功耗仅为现有方案的 3%

豪威(OmniVision)近日推出搭载 NPU 的常开型视觉 AI 协处理器 OAX7700。据称,基于该芯片构建的停车监控系统,功耗仅为现有方案的 3%。芯片支持人体检测、人和物体识别及距离测算等边缘 AI 功能。常开模式下,车载摄像头以极低功耗持续监测周边环境,检测到事件后切换至正常工作模式,并录制事件发生前 5 至 10 秒的视频,交由电子控制单元分析;必要时可触发报警。目前该芯片已出样,

豆包新增机票、火车票预订及打车导航服务

AI 助手豆包现已支持多种出行服务。用户可通过自然语言在对话中预订机票和火车票、叫车,并进行路线规划和实时导航,无需在多个应用之间切换。此次升级扩展了豆包原有的酒店和餐饮预订功能。相关服务由豆包与航班管家、高铁管家、曹操出行、百度地图等合作伙伴共同提供。

哈萨克斯坦总统支持优必选在阿拉木图建设机器人制造工厂

哈萨克斯坦总统托卡耶夫表示支持优必选在阿拉木图建设机器人设备制造工厂,产品将主要面向教育和服务领域。这将成为优必选在中国境外的首个生产基地。双方还讨论了在 Amalty City 项目,以及采矿、石油天然气和大型物流设施中部署机器人,并探讨与哈萨克斯坦技术类高校和学院建立系统性合作机制、设立联合能力中心。优必选今年上半年实现营收 12.69 亿元,同比增长 104.2%;归母净亏损为 3.11 亿

法拉第未来:目标年底前投运机器人工厂

法拉第未来在匹兹堡举行的 IROS 期间公布“Built in USA”计划第二阶段方案,拟加快 Next Futurist 和 Next Aegis 系列机器人的开发,为机器人产品申请 FCC 有条件批准,并推进供应链、合规认证和制造产能建设。公司目标是在今年年底前启动机器人工厂,并于 2027 年第一季度实现首款新 EAI 机器人产品下线。此外,FFAI 已与 AIxC(拟更名为 FFR)签署

OpenAI 推出 Codex 专用插件,可用自然语言制作 Game Boy 风格游戏

OpenAI 在开发者活动中宣布推出 Game Studio,将其 AI 智能体工具 Codex 接入 ModRetro 的复古掌机 Chromatic。用户可以用自然语言描述游戏需求,由 Codex 协助生成程序代码。插件内置 Chromatic 模拟器,开发者可先在电脑上测试,再将游戏串流到实体设备。完成后的游戏可写入专用卡带或空白卡带,并在掌机上运行。

LEGO-Anything:用于三维场景重建的编程智能体

LEGO-Anything 是一个图像到代码框架,编程智能体会迭代编写、执行、检查和修改 Blender 代码,从单张图像生成可编辑的场景程序。新的 LEGO-Bench 评估生成场景的有效性、可见表面几何结构和渲染外观。在受测智能体中,GPT-6-astra 的综合表现最佳,但在准确恢复场景几何与外观方面仍存在明显差距。无需训练的 LEGO-Plugin 使全部六个模型的综合相对得分最高提升 6

LIFT:通过策略内自蒸馏实现大视角变化下的未来布局控制视频生成

LIFT 是一种可控的图像到视频生成框架,将相机控制与未来布局控制结合起来。用户可以指定未来视角中应出现的内容及其位置,尤其是最终帧的场景布局。现有方法通常只能控制相机运动轨迹,而文本提示对未来内容和空间布局只能提供粗略指导。LIFT 采用策略内自蒸馏,将使用逐帧密集布局训练的教师模型能力迁移到仅以最终帧布局为条件的学生模型中。研究人员还构建了 LIFT-Vista 数据集,其中包含大幅视角变化以

WorldLine:面向机器人操作的动作驱动视觉模拟

WorldLine是一种用于机器人学习的视觉模拟器,可在实际执行前预测动作结果。该系统利用超过1万小时的无动作机器人视频学习操作动力学,并通过来自十多种机器人形态的超过2000小时动作轨迹进行动作对齐。基于图像空间的动作表示为不同机器人提供了统一控制接口。在留出数据和分布外场景中,WorldLine使失败轨迹的机器人掩码IoU较最强基线提高0.1626,并以74%的平均准确率预测轨迹是否成功。在未

EVO-WAM:通过视频—动作验证改进世界动作模型

EVO-WAM无需收集额外的专家示范,也无需在外部环境中执行候选动作,即可将世界动作模型适配到新的机器人任务。该方法利用视觉语言模型筛选能够完成任务的视频片段,并通过逆向动力学模型验证视频与对应动作是否一致。在RoboTwin 2.0的七项未见任务中,Cosmos3的平均成功率从26.9%提高到68.0%,DreamZero则从28.5%提高到46.4%。在真实世界的三项未见长时程复合任务中,Co

LongLive-Plug:面向视频生成的一次性通用蒸馏

LongLive-Plug 是一种蒸馏框架,可在基础模型上以 LoRA 适配器的形式训练可复用能力,包括少步采样、可控的无分类器引导,以及自回归长视频生成中的误差校正。研究人员称,该方法无需额外训练即可部署到 54 个下游模型,覆盖三类骨干模型系列和八种任务类别。

EasyPPO:稳定 Critic 是关键

这项研究发现,Critic 的两种失效模式可能导致大语言模型的 PPO 训练不稳定:在 Actor 和 Critic 训练中都排除被截断的 rollout,以及不同提示词之间的回报噪声分布不均。EasyPPO 通过仅对 Actor 筛除过长 rollout、按噪声水平加权 Critic 回归损失,并缩小 Critic 的小批量规模来应对这些问题。在编程、数学推理和多轮搜索测试中,EasyPPO 在

报告称微软 Copilot 外包人员可完整查看用户照片和 AI 提示词

据 404 Media 报道,数百名受雇于微软的合同工能够查看用户上传的照片、发送给 Copilot 的原始提示词,以及 AI 生成的编辑结果。这些人员据称负责评估 AI 生成内容的质量,而不是传统意义上的内容审核。一名合同工表示,照片中的人脸没有经过模糊处理,部分提示词涉及性内容,且存在疑似未经同意的素材。微软隐私常见问题称,图片用于 AI 训练前会对人脸等信息进行模糊处理,但这一说明是否完全适