RRSI:智能体框架的正则化递归自我改进
RRSI是一种自动改进基于大语言模型的智能体系统的方法,涵盖提示词、控制流程、工具、记忆和上下文管理。该方法旨在缓解过拟合问题,即系统在用于优化的任务上取得明显提升,却难以迁移到未见过的基准测试。RRSI限制每个候选方案可合并的修改数量,鼓励探索尚未尝试的改进路径,并通过批评器和剪枝器过滤特定于基准、成本过高或已失去作用的修改。在涵盖编程、智能体工作空间和工程设计的八项基准测试中,RRSI在优化数
AI 新闻中心 过去7天分析了 224 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
RRSI是一种自动改进基于大语言模型的智能体系统的方法,涵盖提示词、控制流程、工具、记忆和上下文管理。该方法旨在缓解过拟合问题,即系统在用于优化的任务上取得明显提升,却难以迁移到未见过的基准测试。RRSI限制每个候选方案可合并的修改数量,鼓励探索尚未尝试的改进路径,并通过批评器和剪枝器过滤特定于基准、成本过高或已失去作用的修改。在涵盖编程、智能体工作空间和工程设计的八项基准测试中,RRSI在优化数
上海人工智能实验室与上海交通大学LUMIA Lab提出了下一概念预测(Next Concept Prediction,NCP),试图替代传统的逐词元预测预训练方式。其89亿参数模型NCP-ArchPreview使用Dolma-3语料库中的5.73万亿个词元训练。技术报告称,该模型仅使用51.3%的词元预算,就达到了OLMo-3-7B最终预训练损失水平,等效收敛速度提升1.95倍。团队还报告了下游任
该研究探讨视觉语言模型(VLM)能否将数字世界中的能力迁移到实体机器人控制。RoboDawn为智能体式VLM提供了一组精简的离散指令,用于平移、旋转和夹爪操作。模型以闭环方式运行:观察机器人的视觉状态,推理并执行下一步动作,再根据执行结果调整后续决策。通过少量上下文示例,模型可以同时学习接口使用方法和任务解决策略。在RoboTwin 2.0 C2R上,成功率从零样本条件下的53.2%提升至单示例条
一项可解释性研究探讨了最先进的视频扩散模型为何在具备出色视觉质量的同时,仍经常生成不符合物理规律的运动。研究发现,运动轨迹在早期去噪阶段形成,并由一组特定的注意力头驱动。分析还表明,旋转位置编码(RoPE)会导致空间注意力过度衰减,使早期候选区域过早锁定在不合理的位置,抑制相邻帧中的合理运动轨迹。研究人员提出一种轻量级架构改动,根据不同去噪步骤调整RoPE频率,从而帮助模型探索更合适的候选区域。无
该研究提出了一种改进人工智能智能体的方法,用于处理仓库级软件工程任务。由于将不同任务类别混合进行强化学习,可能导致部分类别进步、其他类别退步,研究人员首先训练各类别专家模型。Refresh-Repair-Expand迭代流程结合长期智能体强化学习、利用已验证的成功轨迹进行监督微调,以及自适应任务重选。随后,基于标签路由的多教师在线策略蒸馏将这些专家整合为一个可部署模型,只保留相对于参考策略的改进方
据《日经亚洲》报道,日本计划最早于2027年在国际空间站举办人工智能机器人竞赛。活动由今年7月成立、总部位于东京的太空AI机器人协会主办。参赛团队将先在地面空间站模拟设施中测试AI模型,晋级队伍可能在国际空间站的日本“希望号”实验舱参加决赛。参赛者需要开发用于控制球形机器人无人机Int-Ball2的“物理AI”模型。Int-Ball2专为低重力环境设计,可在空间站内拍摄照片和视频,协助宇航员完成相
小米发布了包含 Pro 和 Flash 两个版本的开源权重模型系列 MiMo-V2.6。小米称,MiMo-V2.6-Pro 在 Artificial Analysis Intelligence Index v4.3.2 中获得 46 分,超过 Kimi K3 和 GLM-5.3,但仍落后于顶级闭源模型。小米将性能提升归因于强化学习算力扩展。该系列支持文本、图像、视频和音频等多模态输入,可用于软件工
OpenAI表示,自动化研究可能有助于改善人工智能系统的对齐,但完全自主的递归式自我改进目前尚不可行。公司认为,只有在能够安全开展的前提下,才应推进这类工作。OpenAI重申,其使命是确保通用人工智能能够惠及全人类。
OpenAI表示,正在与一个由数学家组成的独立咨询团队合作,以负责任的方式分享数学领域的人工智能进展。该公司于8月28日开始训练一个新的内部模型,并称该模型除其他成果外,还解决了纳维-斯托克斯千禧年难题。不过,报道没有提供对这一重大主张的独立验证。
研究人员提出 PARTS,通过强化学习专门改进机器人基础策略容易失败的关键子任务。系统无需重新收集完整任务示范,而是在保留预训练策略常规动作的同时,重点训练任务瓶颈。学习得到的选择器和成功验证器会触发残差修正并提供局部奖励,因此即使完整任务成功样本稀少,也能继续学习。在双臂 YAM 任务中,完整任务成功率从32%提升至61%;在单臂 Franka 任务中,则从50%提升至95%。每项任务平均只需数
OpenAI正与一个独立的数学与人工智能顾问组合作。该小组将协助指导对人工智能领域新兴成果的审查和传播。
一份最新报告警告,人工智能数据中心的扩张到2050年可能产生大量电子垃圾,总量或相当于绕地球六圈。报告还估计,其中相当一部分电子垃圾可能未被统计,并分析了每个数据中心园区可能使用的硬件和基础设施规模。
该研究评估大语言模型能否在用户无需手动选择数据表、转换数据或建立连接关系的情况下,端到端回答商业智能问题。研究人员基于真实BI项目和仪表板问题构建了BI-Bench。结果显示,即使是最先进的大语言模型,准确率也低于50%。BI-Agent将流程拆分为搜索、连接和转换等子任务,并协调专用数据管理工具。与普通大语言模型相比,该系统的准确率最高提升40个百分点;经过进一步训练的BI-Agent则实现了最
《Nature》发表的一篇新论文介绍了 RetroChimera,这是一种旨在加速化学合成规划的预测模型。微软研究院表示,该系统可帮助研究人员更高效地评估更多定制分子的合成路线。这类分子可应用于医学、材料和农业领域,但生产过程通常缓慢且成本高昂。
Designer-RSI是一种用于持续适应专业图形设计任务的AI智能体框架。一个冻结的前沿模型通过230多个工具操作设计软件,外部程序记忆则从用户经验中收集并改进可复用的设计流程。回放门控机制只接受能够修复失败、同时不损害既有成功结果的变更。在包含1406份真实用户需求和1869条自动评估轨迹的五轮实验中,技能库从76项扩展至139项。使用Claude Sonnet 4时,GenEval2执行成功