AI 新闻中心

AI 新闻中心 过去24小时分析了 216 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

高通加码物理人工智能,拟收购机器人软件企业 PickNik Robotics

高通已就收购机器人软件企业 PickNik Robotics 达成协议。PickNik 长期维护 MoveIt,这是全球应用广泛的开源机器人框架之一。高通表示,将继续保持 MoveIt 开源,并由社区制定发展路线图;同时简化其与 Dragonwing 机器人平台的集成,并继续支持 MoveIt 在第三方硬件上的应用。

特斯拉 FSD 在欧洲遭质疑:被指频繁超速、违规超车

比利时道路安全倡议组织 Johanna.be 表示,在为期三天、约 400 公里的测试中,特斯拉 FSD 多次超速,并试图在禁止超车的道路上超越骑行者。该组织称,在布鲁塞尔周边测试的大多数限速 30 公里/小时路段,系统平均时速达到 44 公里,还经常错误显示为限速 50 公里/小时。Johanna.be 肯定系统在行人和骑行者周围表现谨慎,但认为这无法抵消记录到的交通违规。该组织已将报告提交给弗

报道称 Claude 发现类 CRISPR 全新 DNA 酶系统

报道称,Anthropic 新成立的分子生物学实验室使用 950 个 AI Agent 连续运行 21 小时,从噬菌体 DNA 中识别出此前未有记录的酶系统 ART(阵列相关逆转录酶)。据称,该系统具有切割、复制和插入 DNA 的能力。报道表示,AI 完成了文献检索、序列比对和候选筛选,随后研究人员通过实验确认了该系统。文章将其称为可能改变生命科学研究的成果,但没有详细证实更广泛的说法,因此这些内

RewardVerse:面向视频奖励模型的准则引导策略优化

RewardVerse旨在缓解视频奖励模型的评分不稳定问题。当模型将主观的视频质量直接映射为单一分数时,评分尺度可能随提示而漂移。该框架先生成适应具体查询的动态评估准则,再据此进行评分。两阶段训练算法RGPO先用不断演进的种子准则预热评分器,随后联合优化准则生成器和评分器。研究团队称,在16维EvalVerse基准和外部数据集上的实验显示,该方法能够减轻评分尺度漂移,并在单项评估和成对评估中取得较

SpeakerMem-R1:面向多人对话的双轨记忆系统

SpeakerMem-R1 是一款面向群体对话的长期记忆系统。它并行存储标注说话者的原文消息,以及按个人和群体组织的结构化信息,并在回答问题时整合实体、事件和时间线索。研究团队报告,该系统在 GroupMemBench、SocialMemBench 和 EverMemBench 上的二元准确率分别为 47.9%、69.2% 和 61.9%;在公开的 EverMemBench 榜单上达到 62.33

MemBodied:面向视觉-语言-动作模型的循环关联记忆

视觉-语言-动作模型为通用机器人控制提供了有力基础,但大多数策略不会保留先前观测中的信息。MemBodied提出固定容量的情景记忆,由记录交互的关联状态和代表初始场景的紧凑参照组成。在五项需要记忆的RMBench任务中,其平均成功率是无记忆策略的7.81倍、基础循环记忆的2.98倍。与最强的记忆增强基线相比,表现高出1.3倍,新增参数量则少了10倍。在LIBERO-Long上,MemBodied达

Hy Image 3.5 Preview 登陆 WorkRally,影视创作者可免费试用两周

腾讯混元发布 Hy Image 3.5 Preview,视频平台 WorkRally 即日起向创作者免费开放两周。该模型支持文生图和图生图,最多可上传 5 张参考图,最高输出 2K 分辨率。腾讯称,数百名专业创作者参与的盲测显示,模型表现较 Hy Image 3.0 提升约 30%。WorkRally 将其接入概念设计、剧集分镜和影视物料等工作流程,并针对专业影视制作进行定制调优。腾讯云 API

PACT:从信用分配到评论器对齐

这项研究通过完整性、前缀一致性和中立性三项条件,形式化定义了语言模型后训练中的 token 级信用分配。研究人员据此分析现有训练信号,并提出 Policy Aligned Critic Training(PACT)。PACT 先更新 actor,再通过重要性采样校正,使 critic 训练与更新后的策略保持一致。在四项智能体数学推理基准测试中,PACT 的平均准确率为 72.87%,比 GRPO

InternW0:面向高效现实交互的基础物理世界模型

上海人工智能实验室推出 InternW0,这是一种将未来视觉动态预测与连续机器人控制相结合的物理世界模型。视频组件提供较长时间跨度的预测上下文,轻量级动作组件则能更频繁地响应新观测。模型使用约 7,200 小时的异构机器人和第一人称视角数据训练,其中包括 275 小时的 EgoLab 数据集。评估涵盖仿真和真实任务,包括 15 阶段的金属有机框架合成流程,以及考虑接触与受力的五阶段移液任务。介绍内

可验证的隐藏动态:从已求解机制生成智能体强化学习环境

VHD-Play先求解数学模型,再将其决策过程呈现为有状态的工具,以构建智能体训练环境。因此,环境动态与轨迹评分基准来自同一模型。该流程以每个仅需几美分的成本生成了3,300个环境。使用这些环境训练Qwen3.6-35B-A3B后,其在涵盖五类环境的诊断测试中的平均智能体得分从0.204升至0.815。研究人员还报告称,模型在未见过的机制和外部基准测试上也有所提升。对比结果表明,可学习差距的大部分

Hunyuan-A13B 技术报告

报告介绍了采用混合专家架构的开源语言模型 Hunyuan-A13B。模型总参数量为 800 亿,但推理时仅激活 130 亿个参数。模型使用经过严格筛选、并加强 STEM 数据整理的 20 万亿 token 语料进行预训练,随后通过监督微调和大规模强化学习进一步提升能力。其双模式思维链框架会根据任务复杂度调整推理深度。报告称,该模型在数学、科学、编程等评测中表现具有竞争力。开发团队公开模型,以支持开

WhatWorkedBench:评估 AI 智能体的实验理解能力

WhatWorkedBench 用于衡量 AI 研究智能体预测组件变化对实验结果影响的准确度。智能体检查代码、选择测量项,并预测不同配置的得分;参考影响通过在 CPU 上穷举运行所有配置得出。该基准涵盖来自 30 个数据源的 36 项任务,以及八类工作流。在评估中,对智能体观测结果拟合高斯过程提高了影响恢复能力;将行为相同的配置编码为等价项也提升了准确度。WhatWorkedBench 旨在支持实

过去塑造未来:自回归视频生成中的记忆

这篇综述系统梳理了自回归视频生成中的记忆机制。由于上下文窗口、存储空间和计算资源有限,实体身份、动态状态以及干预造成的因果变化等重要信息,可能在仍然相关时就离开当前上下文。文章从记忆表征、功能、操作、学习和评估五个方面归纳相关研究,并指出若干待解决问题:构建可组合且节省资源的架构、可靠地更新状态、通过闭环生成进行学习,以及制定标准化评估方法。