动态 Harness 搜索:通过预测为每个查询构建多智能体系统
智能体 harness 定义了解决任务所需的角色、指令、工具和通信结构。由于只有执行后才能观察其效果,过去针对每个查询调整 harness 通常需要运行多个方案或进行昂贵的人工设计。研究人员推出 SHIFT,利用搜索结果训练本地大语言模型构建 harness,并根据准确率和执行成本预测其效用。对于每个查询,系统通过蒙特卡洛树搜索构建 harness,无需实际运行多个备选方案。在六个基准测试的 9,
AI 新闻中心 过去30天分析了 4731 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
智能体 harness 定义了解决任务所需的角色、指令、工具和通信结构。由于只有执行后才能观察其效果,过去针对每个查询调整 harness 通常需要运行多个方案或进行昂贵的人工设计。研究人员推出 SHIFT,利用搜索结果训练本地大语言模型构建 harness,并根据准确率和执行成本预测其效用。对于每个查询,系统通过蒙特卡洛树搜索构建 harness,无需实际运行多个备选方案。在六个基准测试的 9,
OmniConfess是一种无需训练的全模态幻觉缓解方法。它固定一个候选回答,并在受控调整各输入通道证据的同时,逐Token重新评分,从而生成结构化结果,揭示回答各部分依赖哪些文本、图像、音频或视频证据。该方法利用这些信息保留有依据的内容,并修正由无关或矛盾证据驱动的判断。研究团队还构建了OmniHalluBench,包含来自六个数据集的3,540个样例,覆盖文本、图像、音频和视频场景,以及判断和
一项研究使用过去四年发布的十种生成模型,评估了二十种深度伪造检测器。检测准确率从接近 99.5% 降至 76%;加入针对性扰动后,所有基线检测器的准确率都低于 2%。研究人员提出一种经过校准的替代方法,用于评估内容的真实性是否可能被合理质疑:如果已知生成模型能够忠实地重现内容,那么其合成来源就具有合理可能性。该方法可校准至误将生成内容认证为真实的比例不超过 1%。使用受攻击样本校准更严格的阈值后,
一项研究发现,在迭代去噪过程中,可以将扩散语言模型引导至偏向特定人口群体的回答。攻击者使用比例-积分(PI)控制器跟踪目标答案的概率,并动态调整引导向量。在BBQ的模糊问题上,LLaDA-8B-Instruct对目标群体的偏好提高了1.8至16.7个百分点;在SocialStigmaQA上,污名化回答的比例从17.6%升至58.1%。研究指出,生成过程中的内部激活可能成为攻击途径,因此偏见审计还应
RealtimeWAM是一种世界动作模型(WAM),旨在通过单步生成动作和异步推理提升效率,针对动作反复去噪以及视频专家与动作专家之间的等待两项瓶颈。Teacher-Anchored Consistency Distillation在局部一致性训练之外,引入冻结教师模型多步推演的最终输出,以提升单步动作生成的准确性。Cross-Expert Wavefront Pipelining通过共享视频KV
华为高管余承东表示,公司正在考虑未来逐步将 HarmonyOS 推向国际市场,但目前仍是初步计划。据余承东介绍,已有超过 9000 万台设备运行 HarmonyOS 6 或 7,预计年底前将达到 1 亿台。华为称,其生态系统拥有超过 45 万款应用和服务,以及 1100 万名注册开发者。他还表示,华为自 2019 年以来在中国以外的智能手机业务受到重大影响,但可穿戴设备和 TWS 耳机在多个市场表
据彭博社报道,希捷与东芝正在竞购 TDK 的硬盘磁头业务,交易金额最高可能达数十亿美元。不过,谈判仍处于初期阶段,交易也可能告吹。TDK 是全球唯一独立生产硬盘磁记录磁头的厂商,向两家竞购方及西部数据供货。AI 数据中心对低成本、大容量存储的需求增长,提升了这一零部件的战略重要性。若交易达成,还需接受反垄断审查。
视觉-语言-动作(VLA)模型可统一控制机器人操作,但推理成本较高,机器人可能在每次策略调用之间暂停。延长动作块能够减少中断,但若动作块跨越操作子技能的转换,执行可靠性就会下降。RACE(Reliable Action-Chunk Extension)预测转换时机,并据此引导动作生成。在仿真中,RACE 的表现优于相同动作块长度下的微调方法;动作块长度增加至两倍时,它超过近期对比模型,增加至四倍时
据彭博社报道,中国人工智能企业月之暗面已完成可能上市前的最后一轮私募融资,估值约500亿美元,并计划于明年第一季度在香港进行首次公开募股,最高募资规模或达50亿美元。消息称,公司已开始接触投资者,并以保密方式向港交所提交上市申请。不过,相关计划仍处于协商阶段,时间表可能发生变化,消息尚未得到官方确认。监管机构据报已针对月之暗面和深度求索展开数据安全调查,这可能影响公司估值和上市进度。月之暗面今年7
据报道,希捷科技控股与东芝正在竞购TDK的硬盘磁头业务。两家公司希望跟上人工智能数据中心存储设备的需求。
扩散语言模型能够并行生成多个词元,但其质量往往落后于规模相近的自回归模型。ALoDLM通过按词元调整的潜在状态循环计算来缩小差距:为更难预测的词元分配更多计算,并将已确定的词元作为上下文反馈。该模型在17亿和80亿参数规模下训练,在11项基准测试的平均得分上超过了受测扩散模型及相应的自回归基线,同时保留并行解码能力。在评估的模型中,它展现出较好的质量与效率平衡。
一项研究考察了回答开头的特定 token 如何影响基础模型后续的推理。在数学和编程测试中,固定某些线索可使模型表现达到足以与经过强化学习训练的模型相比的水平。研究人员还发现,强化学习会让这些线索更容易出现;通过干预训练数据,可以将任意词语变成有效的推理线索,也可以消除已有线索的作用。不同线索还会引发不同的拒绝或配合行为。
这项研究探讨如何利用状态趋近固定点的特性,降低循环语言模型的训练和运行成本。该方法支持截断反向传播、在几乎不损失准确率的情况下共享终端 KV 缓存,并加快强化学习更新。蒸馏后的学生模型预填充速度最高提升至 1.79 倍。研究还改进了深度先验和输入注入:通过预测反馈学习的先验以及正交注入,使 1 亿至 16 亿参数模型的困惑度均有所下降。在 16 亿参数规模下,KV 缓存缩小至三分之一,仍达到使用完
据彭博社援引消息人士报道,Moonshot AI已完成最后一轮私募融资,估值约为500亿美元。这家人工智能公司计划于2027年第一季度在香港首次公开募股,目标募资最高达50亿美元。
CANOPY 是一种用于多模态检索增强生成的检索后证据压缩框架。它将检索到的文本、表格、图像和视频表示为层级结构,并根据各区域与查询的相关性,选择不同详细程度的内容。当现有证据不足时,评估模块还可以请求有针对性的后续检索。在包含3,300万条异构数据的语料库上进行的五项问答基准测试中,CANOPY 的平均回答准确率高于所评估的检索基线。在未路由的 Qwen3-VL-8B-Instruct 设置中,