AI 新闻中心

AI 新闻中心 过去24小时分析了 254 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

通过交错式强化学习,让统一模型学会原生反思

UMM-Reflection训练统一多模态模型检查图像、发现错误,并通过多轮迭代自行修正生成结果。不同于监督微调,或只优化图像生成器及模型单一部分的强化学习,该方法评估完整的反思轨迹,并同时更新反思文本和图像修订。在BAGEL上,相比监督微调,GenEval提升了12.05分。在训练中未使用的WISE(+10.97)、OneIG-Bench(+3.48)和T2I-CompBench++(+4.63

DroneWAM:面向无人机视觉导航的高效世界动作模型

DroneWAM是一种面向无人机视觉导航的高效世界动作模型。它采用基于JEPA的架构,直接在表征空间中预测未来状态,避免生成完整未来图像所需的计算成本。预训练Resampler将编码器的密集特征压缩为更少的潜在标记,自适应 rollout 则根据当前场景调整预测深度。研究人员还构建了模拟数据集DroneNav-6D,包含同步RGB观测、6自由度飞行轨迹、控制指令和随机风力扰动。在比较方法中,Dro

确定性 PRM 引导为何在离散扩散推理中表现较差

一项针对离散扩散语言模型的研究发现,在相同的前向传递计算预算下,确定性过程奖励模型(PRM)引导不如更简单的方法:独立采样候选答案,再用结果奖励模型(ORM)重新排序。在 GSM8K 上,使用 8 个候选答案的 PRM 引导准确率为 65.18%,而 ORM 重新排序达到 75.13%;候选数增至 32 个时,差距扩大到 12.69 个百分点。研究人员指出两个问题:PRM 在去噪过程中的信号会减弱

Draft-KV:学习语言模型之间有用的潜在通信

潜在通信在语言模型之间传递内部状态,而非解码后的文本。但接收模型准确率提高,并不能单独证明它利用了消息内容。在五组方法与数据集的实验中,将消息替换为来自无关问题的消息,准确率变化最多为0.60个百分点。Draft-KV改为传递发送模型针对当前问题起草答案时形成的键值状态。两个模型均保持冻结,只训练包含105万个参数的接口。以Qwen3-8B为发送模型时,冻结的Qwen2.5-0.5B-Instru

RenderRank:使用压缩视觉 Token 对文本重新排序

RenderRank 是一种重排序模型,将文档作为图像处理,使用压缩视觉表示取代传统的文本 Token 序列。模型先让相关性评分与基于文本的教师模型对齐,再优化同一查询下正例和负例文档之间的相对评分。在 11 个 BEIR 数据集上,RenderRank 减少了 16.5% 至 35.5% 的输入 Token,平均 NDCG@10 为 55.96。在长文档数据集上,其平均 NDCG@10 达到 8

衡量同质 LLM 辩论中的崩溃与纠正

这项研究提出了一套可审计的方法,用于记录同质 LLM 群体辩论中的有害崩溃和有效纠正。在 6,925 场使用 MMLU-Pro 题目的辩论中,研究发现了 253 次崩溃。一种先排除一个模型、再依据探测结果冻结辩论的方法避免了 29 次崩溃,但在等权重条件下也损失了 108 次纠正。研究结果表明,仅以防止崩溃为标准评估干预措施,可能得出错误结论。研究团队还发布了可重放的方案、审计工具和用于重建实验的

谷歌就欧盟要求开放安卓系统、提供搜索数据提起上诉

谷歌已向欧盟普通法院提起诉讼,反对欧盟委员会依据《数字市场法》采取的相关措施。欧盟要求谷歌向竞争性 AI 服务商开放安卓系统,允许用户通过语音启动自选的 AI 助手,并在 2027 年 1 月前向第三方搜索引擎提供与谷歌搜索相当的部分搜索数据访问权限。谷歌认为,分享敏感的搜索查询可能对用户隐私和安全造成不可逆的损害。目前,该程序尚未进入正式的违规调查阶段。

Duplex-MPE:全双工对话中的多方交互基准

Duplex-MPE是一项评估语音助手参与多人对话能力的基准,涵盖三到四名人类发言者。它测试助手何时应回答、保持沉默或停止说话。该基准包含2,000个场景,输入为连续对话音频,不提供转录文本或预先划分的发言边界。四项指标分别评估新回应的启动、回答准确性、适当保持沉默,以及人类解决请求时停止发言的能力。在测试的五个开放权重语音系统中,MiniCPM-o 4.5在三项能力上表现最佳。其他系统虽然更频繁

SkillDRE 通过执行前与运行时反馈演化智能体技能

SkillDRE 是一个用于自动演化 AI 智能体恶意技能包的框架。它将执行前的扫描器引导优化,与在防御机制下根据执行结果进行的运行时改进结合起来。每次修改都会重新扫描并执行,从而形成跨阶段闭环。在 SkillsBench 上对四个受害模型进行评估时,SkillDRE 的平均攻击成功率达到 45.28%,比最强基线高 40.3%。最终提交的技能未被 SkillScan 检出,同时基本保持了良性任务

DepthBench 衡量残差连接如何提升计算深度

该研究提出了 DepthBench,这是一个用于评估 Transformer 模型计算深度的受控基准。研究人员在保持模型规模和预训练方案不变的情况下,系统调整了 10 种代表性架构的宽度与深度比例。标准 Pre-LN 以及大多数基于归一化或缩放的变体,从增加深度中获得的收益有限;当模型变得更深更窄时,性能甚至可能下降。相比之下,HC 和 Full AttnRes 即使在极端深层配置下也能持续提升性

“英语(美国)”如何成为默认选项?研究揭示大语言模型对美式英语的结构性偏向

一项研究探讨大语言模型为何偏好美式英语而非英式英语。研究人员比较了1,813组英美英语表达,并分析训练数据、分词器、预测成本及生成文本。在受审查的6个预训练语料库和21个后训练数据集中,美式英语均占优势。分词器通常能更紧凑地表示美式英语,模型对其预测成本也更低。即使使用中性的英语提示,生成内容仍以美式英语为默认。研究指出,这种结构性语言偏向可能导致语言同质化,并加剧全球人工智能部署中的不平等。

PLDR-LLM 的训练与推理动力学:行映射坍缩、重整化与预测性约化

这部专著提出了描述幂律解码器表征语言模型(PLDR-LLM)训练与推理的框架,并将以行为中心化的学习映射变化分解为参数贡献、相互作用和数值观测误差。分析还考虑了优化器状态、数据顺序及预测性约化所需的其他条件。实验表明,结果会受到观测方式和优化器的影响,且未能支持所测试的自治行状态模型。研究支持有限条件下的预测和特定状态的算子约化,但并未确立普适的临界类别。