InterEvolve:面向人形机器人移动与操作的测试时奖励程序进化
InterEvolve研究人形机器人如何在不重新训练的情况下,利用已有技能完成训练期间未接触过的移动与操作任务。具备物体感知能力的行为模型和LLM代理利用执行反馈及经过验证的程序,迭代改进奖励程序;数值优化器则调整其参数。在仿真中,该方法为多种任务和长时序动作组合生成了相应行为。部分进化出的技能还借助机载第一人称视角感知,在Unitree G1上实现了自主运行。
AI 新闻中心 过去7天分析了 960 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
InterEvolve研究人形机器人如何在不重新训练的情况下,利用已有技能完成训练期间未接触过的移动与操作任务。具备物体感知能力的行为模型和LLM代理利用执行反馈及经过验证的程序,迭代改进奖励程序;数值优化器则调整其参数。在仿真中,该方法为多种任务和长时序动作组合生成了相应行为。部分进化出的技能还借助机载第一人称视角感知,在Unitree G1上实现了自主运行。
马萨诸塞大学一位教授认为,与其让生成式 AI 替自己完成工作,不如让它挑战自己的成果。请 AI 批评想法和草稿,可能产生有益的摩擦,促使人们更深入地审视内容。
美国基础设施联盟由工会以及有影响力的科技和投资公司合作成立,旨在推动数据中心项目。该联盟的首要任务之一,是反对美国各州阻止人工智能数据中心建设的行动。
美国陆军正筹建新的自主系统司令部,并计划任命一名采购主管,优先推动相关技术的采购。此举是在国防部长皮特·赫格塞思宣布“Meridian”和“Agincourt”机器人战争项目后展开的。相关系统的具体能力、时间表和预算目前尚未完全披露。
Meta 表示,将解雇今年 6 月从人工智能安全初创公司 Virtue AI 招聘的员工。公司称,双方工作方式存在冲突是解雇原因。
近五分之一的招聘从业者表示,确认面试对象是人还是人工智能已成为一项主要挑战。招聘流程引发的不满日益普遍,每周有超过120万名招聘人员和求职者浏览 Reddit 社区 r/recruitinghell。
TypeSafe CEO Diogo Almeida称,约四分之一的《财富》500强企业在使用Jev模型。他将Jev描述为“新一类AI”,并表示该模型约在一周前达到每日处理约一万亿个token。报道没有提供对这些说法的独立验证。
人工智能基础设施公司 Nscale 聘请 Meta 资深高管贾斯汀·奥索夫斯基担任首席运营官。据一位知情人士透露,此次任命旨在支持公司在计划中的首次公开募股(IPO)前快速扩张。
多奖励强化学习旨在训练大型语言模型同时满足多个行为目标。研究发现,即使采用针对各项奖励分别归一化的方法,不同目标之间的学习信号仍可能不均衡。论文指出,某项奖励的优势能量与其在多少比例的 rollout 组中产生非零相对信号有关。作者提出 DARA,根据每个批次中各奖励的活跃程度调整权重,让较少出现的奖励获得更大权重,同时不改变策略优化目标。在工具调用和数学推理实验中,与 GDPO 相比,DARA
问世仅三周的人工智能模型 Jev 正在硅谷圈引发有关大语言模型替代方案的讨论,并已出现仿效者。
Tavus将Griffin称为“首个Human Interaction Model”。该公司表示,与Griffin实时交谈的人中,有48%认为对方是真人。现有信息未说明测试方法的具体细节。
这项研究提出检索增强型技能优化(RASO),用于改进可复用的 AI 智能体自然语言指令。RASO 从外部现有技能库中检索相关知识,并根据目标任务和智能体执行框架进行适配。初始化阶段无需运行智能体,即可构建以知识为基础的技能;随后利用执行反馈和额外检索到的知识对技能进行迭代优化。在四项智能体基准测试和两个模型上的实验中,RASO 均优于未采用检索增强初始化与更新的基线方法。
AI代理可能会自动将闲置资金转入利率更高的账户,这可能给银行的流动性带来压力。
Meta利用针对实验活动的税收抵免节省了数十亿美元。争议焦点在于,AI数据中心是否符合实验性研究的条件,还是属于公司的常规运营。
苹果表示,将为 macOS 的“完全磁盘访问”权限增加新的控制措施。该公司警告,能力日益增强的 AI 智能体使其广泛访问用户文件、消息、邮件和浏览历史的风险上升。