AI 新闻中心

AI 新闻中心 过去30天分析了 4731 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

仅凭路由漂移,无法判定合并后的 MoE 大语言模型是否失效

一项针对 DeepSeekMoE、OLMoE 和 Qwen3-MoE 的研究分析了模型合并后专家路由的变化。研究人员发现,大多数专家重新分配源于输入变化,而非路由器参数改变。与原始路由的差异也难以预测恢复原路由是否能提高下一个 token 的似然度。因此,研究将路由失效定义为:在其他参数保持不变时,可通过特定路由干预挽回的任务损失。团队还发布了分析工具包和 Selective Router Rep

WaveFront Decoding:面向循环语言模型的并行自推测解码

WaveFront Decoding(WFD)是一种无需训练的推理加速方法,适用于反复调用同一权重共享模块的循环语言模型。该方法利用中间输出生成草稿预测,并批量处理不同位置和递归深度的 token 状态,使草稿生成与验证能够并行进行,而非分阶段执行。在 Spec-Bench 的六类任务中,与自回归解码相比,WFD 在 Ouro-2.6B 上实现了 2.42 倍加速,在 Huginn-3.5B 上实

VGGT-Diff:融合视觉几何与扩散模型,从稀疏视角合成新视图

VGGT-Diff是一种多视图扩散模型,可根据少量输入图像生成新的观察视角。该方法将VGGT-Ω提取的视觉几何特征输入预训练视频扩散模型,结合基于几何的重建能力与扩散模型的生成先验。具备置信度感知能力的视觉几何路由器会将3D点对齐到目标视角,同时保留前后表面的信息。沿可靠3D轨迹约束残差一致性,可进一步提升多视图结果的稳定性。实验表明,该方法在不同难度的视角插值和外推任务中取得了有竞争力或领先的表

意外的成功与反复的失败:面向大模型推理探索的熵引导信用分配

研究人员提出了熵优势策略优化(EAPO),用于改进大语言模型基于可验证奖励的强化学习。EAPO利用策略熵,对成功和失败回答中的不同 token 进行非对称的信用分配:成功回答中的不确定决策会获得更强的强化,而失败回答中的自信决策会受到更强的惩罚。对于不确定的失败,方法会减轻惩罚,以保留模型探索其他解法的机会。该方法无需额外的辅助模型、采样或特权信息,直接利用现有 rollout 信号生成 toke

Skill2Env:从技能合成面向能力的环境,服务通用智能体

Skill2Env 是一个用于自动构建可执行任务和环境的框架,旨在支持 AI 智能体的后训练。它以可复用的技能为起点,根据智能体所需能力和难度模式生成任务蓝图,内容包括目标、挑战、环境事实、信息边界和验收标准。这些蓝图用于协同构建任务指令、执行基础设施、工作空间以及基于评分标准的评估器。其迭代式任务强化方法利用执行证据识别难度不足的任务,并进一步修改设计。研究人员使用 1,500 条高分轨迹进行监

利用扰动公共文档进行合成训练,提升模型从上下文中学习的能力

研究人员提出了一套流程:先对公共文档进行轻微改写,再生成依赖文档内容的问题、评分标准和答案,并筛除实际上不需要源文档上下文的样本。该流程无需人工标注,便从3,500份文档中生成了约1万个训练样本。监督微调使Qwen3.6-35B-A3B学生模型在CL-bench上的得分从13.7%提升至22.8%;随后进行基于评分标准的强化学习后,得分达到24.6%。在该基准测试中,其表现接近参数量超过一万亿的模

PyroAdapt:适应空间异质性与时间分布变化的野火预测方法

PyroAdapt是一种“预训练—检索—排序”框架,用于让预训练模型适应野火预测中的目标条件变化。该方法检索具有相似条件的历史地点,并通过风险排序对模型进行微调。在加州666个网格单元上的实验中,日均平均精确率从21.62%提升至最高24.57%,前5%高风险区域的召回率则从18.70%提升至最高22.79%。在每天固定检测34个网格单元的预算下,该方法额外识别出344个阳性网格日。约塞米蒂地区的

微软纳德拉:AI行业“有点飘了”,呼吁回归用户需求

微软首席执行官萨蒂亚·纳德拉在采访中表示,AI行业过于关注技术和前沿概念,忽视了用户的实际需求。人们想知道AI能否带来切实利益、能否由自己掌控,以及能否从中获得经济收益。他认为,行业要赢得消费者和社区的信任,就必须重视现实价值,而不是为了技术本身而庆祝技术。

Rolling-WAM:具有滚动想象能力的世界动作模型

Rolling-WAM是一种面向机器人操作的方法,将动作生成与未来视觉预测相结合。传统方法在每次重新规划时,都需要从头对整个视频—动作预测范围进行完整去噪;该方法则把计算分摊到连续的重新规划周期中。滑动窗口会保留处于不同噪声水平的视频—动作片段:即将执行的片段被完全去噪,较远的未来片段则持续进行部分精炼。在LIBERO、RoboTwin以及真实的Unitree G1人形机器人上的评估表明,该方法具

RoboFoundry:通过“系统即策略”演进实现具身智能体自学习

RoboFoundry是一种通过经过验证的整体系统更新来改进具身智能体的框架,而非单独优化各个组件。它分析执行经验,更新上下文与记忆系统以及层级技能,并将改进迁移到不同机器人上。作者称,该方法在EmbodiedBench上达到领先水平,较GPT-5.5提升27.8%。在RoboMemArena的长时记忆评测中,它至少领先基线方法39%;在LIBERO-PRO上,根据扰动类型,其表现比Cap-Age

自我进化的编程智能体:从数字程序到物理世界智能

该研究提出“Physical Coding”,将机器人任务的状态和流程表示为代码,使智能体能够依据反馈规划、验证并修正行动。HexaAnything整合了感知、规划和控制工具,包括VLA和WAM策略。在RoboCasa365上,它在未见过的复合任务和总体成功率方面超过XR-1 VLA;利用执行轨迹训练的HexaModel也在所有数据划分上优于基础模型。该智能体还在模拟环境和双臂机器人上自主完成了物

AI 写作特征减少:Claude Opus 5.5 破折号使用量下降约 95%、分号下降 73%

Arena 对 Text Arena 高推理回答的分析显示,与 Claude Opus 5 相比,Claude Opus 5.5 明显减少了破折号和分号的使用。破折号从每 1,000 个单词 15.2 个降至 0.8 个,分号从 6.10 个降至 1.64 个。平均句长也从 12.14 个单词缩短至 10.03 个。与此同时,平均回答长度从 453 个单词增加至 481 个。Arena 表示,分析