AI 新闻中心

AI 新闻中心 过去7天分析了 1091 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

REALM:面向具身反应式倾听的由粗到细生成框架

REALM 是一套为具身对话代理生成音频驱动面部动作的框架。它将听者的动作历史与说话者音频相结合,并考虑说话线索与听者反应之间的时间延迟。粗阶段解码器预测主要动作轨迹,随后通过音频条件随机调整细化面部表情,同时保留整体姿态。在 ViCo 和 L2L 数据集上的评估中,REALM 在多项动作质量指标上优于受测基线。研究团队还将系统部署到 Ameca 人形机器人上,并通过用户感知研究评估生成的行为。

AdaGuard:支持用户自定义策略的自适应防护模型

AdaGuard是一系列防护模型,可根据推理时提供的策略评估智能体的行为轨迹。研究团队推出了AdaptiveSafety数据集,包含10,939条训练样本和1,000条测试样本,覆盖包含1至100条规则的策略。数据集结合了策略和行为变化的反事实案例、解释信息以及完整的违规规则列表。强化学习方法SafePO用于提升违规识别能力,并平衡解释推理与最终判定。AdaGuard提供0.6B、4B和8B参数规

BaRe-Mem:提升智能体咨询稳健性与适应性的贝叶斯可靠性记忆

在多智能体系统中,不可靠的建议可能让结果变差。BaRe-Mem 根据中央模型的内部信念表征和历史交互,估计提供建议的智能体是否可靠。这些估计用于调节建议的影响,并帮助系统决定是咨询其他智能体还是自主推理。在九个基准和六种中央模型上的测试中,面对误导性建议时,BaRe-Mem 比辩论和多数投票方法更稳健。在难度较高的任务中,无论测试的误导信息程度如何,其表现都优于自主推理。在 MuSiQue 基准上

面向交互式世界的精准编辑与灵活引用

EditWorld是一种用于精准编辑和灵活引用交互式世界的视频世界模型。现有视频世界模型主要侧重导航和探索,而EditWorld能够在自回归生成过程中流式处理编辑指令和参考图像。该模型采用Gated Causal Attention处理随时间变化的编辑条件,并通过Sparse Context机制限制长程推理中的历史上下文。研究团队还构建了专门的数据合成与标注流程,并提出用于系统评估流式世界编辑能力

利用自适应循环 Transformer 改进测试时扩展

这项研究探讨了重复利用网络层的 Transformer,能否在输出变长时更有效地提升推理表现。研究团队提出 TaH2,将额外迭代分配给能够从中受益的 token,而不是对所有 token 执行相同次数的循环。在难度较高的 AIME 基准测试中,与无循环基线模型相比,TaH2 的测试时解码计算量每翻倍所带来的准确率增益提高了 53%。在计算量相同的条件下,其最高准确率也高出约 3.4 个百分点。代码

LG Innotek 将部署车辆,为自动驾驶传感系统开发收集数据

LG Innotek 将与自动驾驶软件公司 Applied Intuition 合作,在韩国运营传感数据采集车队。车队将以首尔、仁川和京畿道为中心,到 2028 年计划部署 20 辆数据采集及软件开发车辆,并在美国、欧洲和日本投放车辆。车辆将搭载 LG Innotek 的摄像头、雷达和激光雷达。公司计划将采集的数据与数字孪生环境结合,用于提升传感器性能并验证系统有效性,重点关注传感器融合和极端工况

IDC:2026年上半年全球人形机器人出货量同比增长432.1%

IDC最新报告显示,2026年上半年全球人形机器人出货量接近2.5万台,同比增长432.1%。中国出货量超过1.9万台,占全球市场约77.9%,全球市场规模超过7.4亿美元。人形机器人的应用正从科研、教育和展示逐步扩展至工业制造、物流、零售等商业场景。与此同时,小型、低成本产品开始通过电商渠道面向个人消费者销售,主要提供教育和陪伴功能。IDC预计,到2030年全球人形机器人出货量将超过75万台,较

影石据报正在研发主打拍摄的智能眼镜,前框可更换并或搭载通义千问

据中国媒体援引知情人士消息,影石创新正在研发一款面向内容创作者、主打免手持拍照和视频拍摄的智能眼镜。产品可能采用可更换前框设计,主要功能集中在镜腿部分。AI 功能或将搭载阿里巴巴通义千问大模型。影石还计划进一步探索将生成模型直接部署在设备端,以减少对云端服务的依赖。公司此前获得的一项专利描述了分体式电池设计:电池佩戴在身体其他部位,再通过电线为眼镜供电,从而减轻头部负重。该产品目前尚未正式发布,相

仅凭路由漂移,无法判定合并后的 MoE 大语言模型是否失效

一项针对 DeepSeekMoE、OLMoE 和 Qwen3-MoE 的研究分析了模型合并后专家路由的变化。研究人员发现,大多数专家重新分配源于输入变化,而非路由器参数改变。与原始路由的差异也难以预测恢复原路由是否能提高下一个 token 的似然度。因此,研究将路由失效定义为:在其他参数保持不变时,可通过特定路由干预挽回的任务损失。团队还发布了分析工具包和 Selective Router Rep

WaveFront Decoding:面向循环语言模型的并行自推测解码

WaveFront Decoding(WFD)是一种无需训练的推理加速方法,适用于反复调用同一权重共享模块的循环语言模型。该方法利用中间输出生成草稿预测,并批量处理不同位置和递归深度的 token 状态,使草稿生成与验证能够并行进行,而非分阶段执行。在 Spec-Bench 的六类任务中,与自回归解码相比,WFD 在 Ouro-2.6B 上实现了 2.42 倍加速,在 Huginn-3.5B 上实

VGGT-Diff:融合视觉几何与扩散模型,从稀疏视角合成新视图

VGGT-Diff是一种多视图扩散模型,可根据少量输入图像生成新的观察视角。该方法将VGGT-Ω提取的视觉几何特征输入预训练视频扩散模型,结合基于几何的重建能力与扩散模型的生成先验。具备置信度感知能力的视觉几何路由器会将3D点对齐到目标视角,同时保留前后表面的信息。沿可靠3D轨迹约束残差一致性,可进一步提升多视图结果的稳定性。实验表明,该方法在不同难度的视角插值和外推任务中取得了有竞争力或领先的表

意外的成功与反复的失败:面向大模型推理探索的熵引导信用分配

研究人员提出了熵优势策略优化(EAPO),用于改进大语言模型基于可验证奖励的强化学习。EAPO利用策略熵,对成功和失败回答中的不同 token 进行非对称的信用分配:成功回答中的不确定决策会获得更强的强化,而失败回答中的自信决策会受到更强的惩罚。对于不确定的失败,方法会减轻惩罚,以保留模型探索其他解法的机会。该方法无需额外的辅助模型、采样或特权信息,直接利用现有 rollout 信号生成 toke

Skill2Env:从技能合成面向能力的环境,服务通用智能体

Skill2Env 是一个用于自动构建可执行任务和环境的框架,旨在支持 AI 智能体的后训练。它以可复用的技能为起点,根据智能体所需能力和难度模式生成任务蓝图,内容包括目标、挑战、环境事实、信息边界和验收标准。这些蓝图用于协同构建任务指令、执行基础设施、工作空间以及基于评分标准的评估器。其迭代式任务强化方法利用执行证据识别难度不足的任务,并进一步修改设计。研究人员使用 1,500 条高分轨迹进行监

利用扰动公共文档进行合成训练,提升模型从上下文中学习的能力

研究人员提出了一套流程:先对公共文档进行轻微改写,再生成依赖文档内容的问题、评分标准和答案,并筛除实际上不需要源文档上下文的样本。该流程无需人工标注,便从3,500份文档中生成了约1万个训练样本。监督微调使Qwen3.6-35B-A3B学生模型在CL-bench上的得分从13.7%提升至22.8%;随后进行基于评分标准的强化学习后,得分达到24.6%。在该基准测试中,其表现接近参数量超过一万亿的模