MetaRubric:为基于评分标准的强化学习学习奖励
基于评分标准的强化学习按单项要求评估开放式回答,但评审有时会在回答缺少所需信息时仍然给分。研究团队将这一问题称为“空洞给分”,它甚至可能反转回答在 GRPO 中的优势。MetaRubric 只在回答提供充分证据时才给分,并利用当前策略生成的回答及反事实任务变体调整评分标准。在多个基础模型上,与使用静态评审的 GRPO 相比,MetaRubric 将 PubMedQA 准确率提高了 6.00 至 2
AI 新闻中心 过去30天分析了 4721 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
基于评分标准的强化学习按单项要求评估开放式回答,但评审有时会在回答缺少所需信息时仍然给分。研究团队将这一问题称为“空洞给分”,它甚至可能反转回答在 GRPO 中的优势。MetaRubric 只在回答提供充分证据时才给分,并利用当前策略生成的回答及反事实任务变体调整评分标准。在多个基础模型上,与使用静态评审的 GRPO 相比,MetaRubric 将 PubMedQA 准确率提高了 6.00 至 2
一项研究在三个领域测试了 12 种智能体模型,考察产品、酒店或论文的来源如何影响选择。模型始终偏好某些来源,并回避另一些来源。在约三分之二的比较中,如果更符合要求的选项来自不受偏好的来源,模型反而会选择来自偏好来源、少满足一项要求的选项。隐藏来源信息会削弱这种影响;将选项标记为来自偏好来源则会提高其入选率。研究认为,这种偏好可能源于训练过程中形成的捷径,以及信息缺失引发的先入之见。补充缺失信息,或
瑞典轴承制造商SKF发布了一则广告,以AI生成已于1990年去世的演员葛丽泰·嘉宝的形象。图像制作使用了字节跳动的Seedream 5 Pro和谷歌的Nano Banana Pro;动作生成则使用Seedance和快手的可灵AI等工具。声音根据获得授权的历史录音重现,并由演员协助调整语速和语调。SKF表示,生成形象时没有使用档案照片或历史影像。该项目与嘉宝遗产管理方及家属合作完成。广告评价褒贬不一
Axios 报道称,Reflection 等多家西方企业计划于本月发布开放权重 AI 模型。此类模型支持本地部署,对微调和推理数据安全要求严格的行业具有重要优势。据称,Reflection 的模型初期预计不及美国最先进的闭源模型,但有望与中国顶尖开放权重模型竞争。Reflection 拒绝置评,目前正寻求扩充服务所需的算力。
DRAM制造商南亚科技宣布,将投资在屏东科学园区设立3D晶圆封装测试厂。新厂将导入硅通孔(TSV)、晶圆堆叠等技术,建设晶圆级封装与测试的一体化制造能力,以满足AI应用带动的高性能、高带宽内存需求。报道推测,新厂可能瞄准类HBM内存解决方案,但尚未确认是否获得AI芯片订单。
据报道,Anthropic 前研究员雅各布·考克斯恩应纽约市议会议长朱莉·梅宁的邀请,将出席一场有关人工智能的听证会作证。市议员目前正在审议一揽子法案,拟为这项技术制定保障措施。考克斯恩上月离开 Anthropic,并警告称,人工智能可能在本十年末前导致人类灭绝。他还指责前雇主 Anthropic 和 OpenAI 将人们的生命置于危险之中。
Change.org表示,将投入1亿美元自有资金,以AI重建其核心请愿平台。该组织还推出了面向请愿发起人的AI助手测试版。Change.org最初由风险投资支持,并于2021年进行了重组。
零样本文本转语音(TTS)可根据一段简短录音复现未见过的说话者,但通常会将说话者身份与口音混为一体。DEFINE 使用不同的音频示例分别指定说话者身份和目标口音,并可在推理时通过单一权重调节口音强度,无需重新训练。该方法基于 F5-TTS,采用参数高效的 LoRA 适配;推理时无需口音标签,也无需合成后的波形转换。在已见口音上,增强引导使口音检测器准确率从 6.5% 提升至 19.6%。对于已见及
Diptych是一套用于比较音乐录音的AI辅助系统。用户可以选择比较整首曲目,或独立选定片段进行比较,并查看结构化音频特征以及针对特定比较范围的AI解读。在一项包含12名音乐家的研究中,该系统帮助参与者发现了更多差异;其中10项发现有9项获得专家至少部分支持。参与者认为系统易于使用,并表示对可能的后续步骤更加清晰。研究结果表明,用于创意比较的AI工具应允许用户定义比较范围,提供可检查的证据和可执行
OctLLM是一种多模态语言模型,将3D几何表示为显式的八叉树占用标记序列,而不是压缩为潜在码本索引或坐标文本。其稀疏八叉树表示在保留空间和深度信息的同时缩短序列。为增加3D能力,模型采用独立的可训练分支,并冻结预训练的语言和视觉路径,因此所需训练参数远少于完整微调。研究人员称,与ShapeLLM-Omni相比,OctLLM将图像到3D的FID降低17.4%,并将基于渲染结果的描述生成提升28.7
EditHero 是一个用于评估长程部件级 3D 编辑的基准。它通过自然语言指令以及几何和纹理目标图像,测试一系列连续修改。确定性装配引擎会在每次编辑后生成精确目标,所有编辑序列也经过人工审核。研究显示,非代理方法经常无法完成指定修改,还会改变本应保持不变的区域。基于 LLM 和 VLM 的智能体通常更能遵循指令,也更好地保留未编辑部分,但每次编辑需要数分钟。研究人员计划发布该引擎和编辑序列,以支
Skill2Real是一种在仿真环境中学习机器人技能,并在无需针对具体任务微调的情况下迁移至真实机器人的框架。Proposer-Verifier-Governor循环利用仿真中的特权信息诊断结果并验证更新。系统先学习基础操作技能,再学习将这些技能组合起来完成更高层级的任务。在LIBERO-90上训练的冻结技能,在四项真实世界操作任务中的平均完成率达到78.75%。在未用于训练的LIBERO-Pro
一项研究提出递归式自我改写(RSR)方法,将模型在专用任务环境中获得的成功解法转化为适用于通用环境的训练轨迹。规划器提取操作流程并生成手册,评审器检查验证器或解答信息泄漏并指导修订,执行器则在全新的沙箱中测试合格手册。在约3,000项经过筛选的终端任务中,三种环境合计解决759项,比记录中表现最好的单一环境多34.3%。RSR将2,001条成功的源轨迹扩展为11,094条改写轨迹。使用这些数据进行
World Embedding Benchmark包含8,000个受控仿真案例,覆盖流体与固体力学、动力学、光学和电磁学等80个类别。它通过文本—视频检索、物理属性回归以及视频—描述配对分类任务评估视频嵌入。预训练全模态模型的检索表现较弱,同类别配对分类接近随机水平;但轻量探针能够从冻结的视频嵌入中提取有用的物理信息。使用物理领域专用的视频—文本对继续进行对比训练,可改善检索和分类,却会降低定量物
据德国媒体《多瑙库里尔报》报道,英国具身智能初创企业 Wayve 据称从多家竞争者中胜出,被选为大众汽车集团提供自动驾驶技术。Wayve 将开发自动驾驶 AI 软件,大众旗下软件公司 CARIAD 则负责将软件与大众和博世共同开发的硬件进行系统集成。据称,超过 10 家技术供应商参加了在德国南部一座主要城市举行的方案演示。Wayve 凭借技术能力和财务表现给大众留下了深刻印象。目前大众尚未正式确认