学习尚未掌握的内容,而非已经掌握的内容:用于多奖励策略优化的饱和感知优势重加权
该研究提出 SA-MRPO,用于具有多个奖励目标的语言模型后训练。不同于采用固定权重的方法,SA-MRPO 分别标准化各个奖励目标,并根据目标的饱和程度,动态降低已经基本达成目标的贡献。这使优化资源转向更困难、仍有提升空间的目标。在数学推理、自适应推理和编程基准测试中,SA-MRPO 在多种设置下优于 GDPO:AIME24 提升最高达 5%,自适应推理平均提升 3.8%,AMC23 最高提升 9
AI 新闻中心 过去一年分析了 1727 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
该研究提出 SA-MRPO,用于具有多个奖励目标的语言模型后训练。不同于采用固定权重的方法,SA-MRPO 分别标准化各个奖励目标,并根据目标的饱和程度,动态降低已经基本达成目标的贡献。这使优化资源转向更困难、仍有提升空间的目标。在数学推理、自适应推理和编程基准测试中,SA-MRPO 在多种设置下优于 GDPO:AIME24 提升最高达 5%,自适应推理平均提升 3.8%,AMC23 最高提升 9
HiFi-BRep是一种用于生成计算机辅助设计(CAD)边界表示(B-Rep)的深度学习框架。它针对现有方法中的潜在空间填充噪声、特征污染、序列生成误差累积,以及训练与推理不匹配等问题进行改进。拓扑感知编码器通过可学习查询构建更高保真的潜在表示,单阶段解码器则并行预测几何与拓扑,并将可微分的流形约束纳入训练目标。作者报告的实验显示,该方法在结构有效性和几何保真度方面均优于现有先进方法。代码和模型已
由哈佛大学和麻省理工学院牵头、OpenAI 与 Google DeepMind 等机构参与的团队推出了 MatrAIx 系统,用于通过最多 83 亿个 AI 智能体模拟人类行为。该系统从 1,290 个维度对不同背景和生活方式的人群进行建模。智能体可以填写问卷、与客服聊天、浏览网页和操作应用。包含 400 次测试的对照研究显示,智能体在 91.5% 的情况下表现出正确特质,或在无关时正确抑制该特质
共生知行发布了一段双足人形机器人驾驶卡丁车的演示。公司称,机器人可用右脚控制油门,并在驶出弯道前结合视觉时机判断、精准油门控制和快速转向。该公司由浙江大学与西湖大学联合培养的博士生创立,专注于具身智能的端到端动作生成。其“直接感知—控制模型”取消了中间运动表征,将视觉、语言、身体状态、动作历史和执行反馈直接映射为可执行的关节与手部目标。此次卡丁车驾驶属于技术概念验证,尚不能证明人形机器人已经具备可
DeepSeek、Qwen和Moonshot等中国AI模型比美国领先平台成本更低、适应性更强。研究还表明,这些模型的性能如今已接近美国同类产品。文章分析了这一进展是如何实现的,以及它可能对美国AI企业产生的影响。
一项针对开放权重语言模型的研究,探讨潜在信息如何转化为模型能够报告的形式。研究人员使用雅可比透镜,在共享相同上下文的基准任务上进行测试,未发现预测中的独立“闸门”机制。相反,注意力机制会在模型中等深度的区域聚集信息,使变量能够在查询位置被读取。这种效果取决于任务需求,并在两种不同架构中出现在相近的相对深度。研究定位了变量变得可读的位置,但没有揭示信息传输的完整路径。研究还指出,探针测得的可见性并不
一项研究分析了在自动检查流程中由一个语言模型充当验证器、另一个或同一个模型负责修复时,先前的上下文是否会改变检查结果。在字节完全一致的任务中,预先加入一次审计与修复过程后,所有15种模型与措辞组合的误报率都下降了2.8至11.5个百分点。对于其中一个模型,审计曾报告错误的过程会进一步减少误报。信号检测分析表明,变化来自判定阈值移动,而不是辨别能力下降。人工检查50个误报后发现,82%确实是错误警报
路透社报道,Google人工智能部门过去几个月经历了剧烈的内部动荡。联合创始人谢尔盖·布林据称介入Gemini模型训练,推动加快开发并尝试递归式自我改进。下一代Gemini旗舰模型据报因在编程等关键领域落后竞争对手而推迟两个月发布。8月5日,Google DeepMind宣布由科雷·卡武库丘奥格鲁接替德米斯·哈萨比斯担任负责人;哈萨比斯转任主席,运营职责减少。在布林支持下,卡武库丘奥格鲁预计将获得
HarnessEval-W 是一套面向世界模型的智能体评估流程。它不再只输出单一分数,而是将每个评估问题拆解为可测量的子问题,并为各个子问题配置具有专属上下文和诊断工具的专业子智能体。上级智能体会验证收集到的证据并生成最终结论,从而形成透明的证据树。该方法在 18 个代表性世界模型的 330 个评估案例上进行了测试,判断结果与人类偏好高度一致,同时能够细致诊断物理规律、因果关系和世界状态演变方面的
VideoGAIA是一项用于评估多模态大语言模型代理式视频理解能力的新基准。不同于传统的单轮视频问答,它要求模型进行多轮交互、调用外部工具、收集补充信息,并整合多模态证据。该基准包含271项覆盖复杂真实场景的任务,每项任务均由三名人类专家独立验证。虽然领先模型在现有视频基准上的准确率已接近90%,但所有参与VideoGAIA评测的模型准确率都低于60%。这项基准旨在推动对新一代AI助手进行更严格的
PACE-Bench 是一个基于模拟器的基准测试,用于评估自我进化 AI 智能体能否在物理环境变化后调整代码驱动的设计。该基准涵盖六个物理领域,共包含 144 组源环境到目标环境的适应任务。一个在源环境中有效的设计会在经过变异的目标环境中失效,智能体必须在有限尝试次数内利用诊断沙盒反馈完成修改。对十种方法的比较显示,该基准仍远未饱和。Reflexion 搭配 Qwen3-14B 仅解决了全部任务的
UI-Mate是一款用于自动化复杂数字任务的基础GUI智能体,将基于环境的训练体系与多模态示范的上下文学习相结合。该体系可在大规模并行环境中自动完成任务生成、环境构建、执行、筛选、监督微调和在线强化学习。研究团队还推出了OSWorkerBench,涵盖41个应用中的100项长流程办公任务,并区分了针对相同目标的自我示范和针对相关任务的人类变体示范。UI-Mate-27B在OSWorld-Verif
一项新研究将矩阵乘法指数ω的已知最佳上界从2.371339改进至低于2.371177。研究人员重新表述了核心优化问题,使其能够在更广泛的条件下求解,并利用近期机器学习进展设计了新的优化算法,随后通过AlphaEvolve进一步改进。该成果建立在组合损失分析之上,这是激光法的一种改进方法,用于研究矩阵乘法的计算复杂度。
本文研究大规模像素空间文本到图像扩散模型的训练方法。作者发现,直接在像素空间进行预训练的收敛速度明显慢于潜在空间训练。因此,他们提出先在潜在空间高效学习生成先验,再在后训练阶段切换到像素空间的策略。研究系统分析了权重初始化、数据组成、预测目标、解码器架构和噪声调度等关键设计。结果表明,该方法生成的像素空间模型能够达到或超过潜在空间模型的性能,同时将端到端推理速度提升约3.18至4.75倍。
ClawGym II 提出了一套框架,用于通过复杂且不透明的智能体框架,对通用 AI 智能体进行稳定、可扩展的强化学习优化。该系统利用沙盒隔离任务环境并支持并行执行,通过服务代理捕获模型调用,再以前缀树重建多轮轨迹,同时适配 PPO 和 GRPO。使用 Qwen3-30A3B 时,ClawGym-Bench 的 Pass@1 在 OpenClaw 和 Claude Code 上分别提升 9.98