AI 新闻中心

AI 新闻中心 过去30天分析了 911 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

HappyWorld-Bench评估世界模型的可靠性

HappyWorld-Bench是一套用于评估世界模型的综合基准。它不仅衡量生成世界的视觉质量,还测试模型在探索、交互和修改过程中的一致性与响应能力。该框架围绕六项能力,覆盖视频、空间和具身世界模型三个评测方向。研究评估了14个视频模型、9个空间系统和8个具身模型候选,并结合自动化行为指标、人工A/B比较和Elo评分。结果显示,三类模型都存在明显的可靠性缺口:视频模型在长时间生成和重新访问时一致性

StudentBench:AI辅导与真人辅导带来相当的GRE学习进步

一项针对2,383名参与者的研究使用StudentBench比较了GRE备考中的AI辅导和真人辅导。研究人员称,两者带来的学习进步在统计上相当;在七个GRE领域中,有五个领域的最佳AI辅导平均表现超过真人辅导。一款AI辅导工具以显著更低的成本取得了相近效果:每提升一个百分点,AI成本为0.0052美元,真人辅导为4.81美元。StudentBench还收录了超过17.5万条学生与AI的对话,并向公

EmbodiedSWE:面向长时程灵巧机器人任务的编程智能体

这项研究探讨编程智能体能否通过解决复杂、耗时的机器人任务,为通用机器人策略的训练提供可扩展的监督数据。研究团队推出模拟基准 EMBODIEDSWE-BENCH,涵盖接触密集型操作、可变形物体,以及最长达 30 分钟的连续交互。前沿编程智能体能够解决复杂任务,并将已有方案迁移到不同任务和机器人形态上,但需要大量迭代交互,且方案通常针对单个任务实例。EMBODIEDSWE-GEN 将单个智能体方案扩展

即时记忆:学习为LLM智能体按任务自适应整理记忆

这项研究提出JitMem,一种面向LLM智能体的记忆系统:先完整保留过去的交互轨迹,待新任务到来时再整理出所需信息,从而避免在未知未来查询出现前就决定该记住什么。在ALFWorld、WebShop和τ^2-bench测试中,JitMem优于无记忆智能体,以及在写入时整理记忆的启发式和学习式方法。与最强基线相比,成功率分别提高16.2、16.3和3.9个百分点。即使未经训练的记忆整理器也表现出竞争力

报道称 Claude 发现类 CRISPR 全新 DNA 酶系统

报道称,Anthropic 新成立的分子生物学实验室使用 950 个 AI Agent 连续运行 21 小时,从噬菌体 DNA 中识别出此前未有记录的酶系统 ART(阵列相关逆转录酶)。据称,该系统具有切割、复制和插入 DNA 的能力。报道表示,AI 完成了文献检索、序列比对和候选筛选,随后研究人员通过实验确认了该系统。文章将其称为可能改变生命科学研究的成果,但没有详细证实更广泛的说法,因此这些内

RewardVerse:面向视频奖励模型的准则引导策略优化

RewardVerse旨在缓解视频奖励模型的评分不稳定问题。当模型将主观的视频质量直接映射为单一分数时,评分尺度可能随提示而漂移。该框架先生成适应具体查询的动态评估准则,再据此进行评分。两阶段训练算法RGPO先用不断演进的种子准则预热评分器,随后联合优化准则生成器和评分器。研究团队称,在16维EvalVerse基准和外部数据集上的实验显示,该方法能够减轻评分尺度漂移,并在单项评估和成对评估中取得较

SpeakerMem-R1:面向多人对话的双轨记忆系统

SpeakerMem-R1 是一款面向群体对话的长期记忆系统。它并行存储标注说话者的原文消息,以及按个人和群体组织的结构化信息,并在回答问题时整合实体、事件和时间线索。研究团队报告,该系统在 GroupMemBench、SocialMemBench 和 EverMemBench 上的二元准确率分别为 47.9%、69.2% 和 61.9%;在公开的 EverMemBench 榜单上达到 62.33

MemBodied:面向视觉-语言-动作模型的循环关联记忆

视觉-语言-动作模型为通用机器人控制提供了有力基础,但大多数策略不会保留先前观测中的信息。MemBodied提出固定容量的情景记忆,由记录交互的关联状态和代表初始场景的紧凑参照组成。在五项需要记忆的RMBench任务中,其平均成功率是无记忆策略的7.81倍、基础循环记忆的2.98倍。与最强的记忆增强基线相比,表现高出1.3倍,新增参数量则少了10倍。在LIBERO-Long上,MemBodied达

PACT:从信用分配到评论器对齐

这项研究通过完整性、前缀一致性和中立性三项条件,形式化定义了语言模型后训练中的 token 级信用分配。研究人员据此分析现有训练信号,并提出 Policy Aligned Critic Training(PACT)。PACT 先更新 actor,再通过重要性采样校正,使 critic 训练与更新后的策略保持一致。在四项智能体数学推理基准测试中,PACT 的平均准确率为 72.87%,比 GRPO

InternW0:面向高效现实交互的基础物理世界模型

上海人工智能实验室推出 InternW0,这是一种将未来视觉动态预测与连续机器人控制相结合的物理世界模型。视频组件提供较长时间跨度的预测上下文,轻量级动作组件则能更频繁地响应新观测。模型使用约 7,200 小时的异构机器人和第一人称视角数据训练,其中包括 275 小时的 EgoLab 数据集。评估涵盖仿真和真实任务,包括 15 阶段的金属有机框架合成流程,以及考虑接触与受力的五阶段移液任务。介绍内

可验证的隐藏动态:从已求解机制生成智能体强化学习环境

VHD-Play先求解数学模型,再将其决策过程呈现为有状态的工具,以构建智能体训练环境。因此,环境动态与轨迹评分基准来自同一模型。该流程以每个仅需几美分的成本生成了3,300个环境。使用这些环境训练Qwen3.6-35B-A3B后,其在涵盖五类环境的诊断测试中的平均智能体得分从0.204升至0.815。研究人员还报告称,模型在未见过的机制和外部基准测试上也有所提升。对比结果表明,可学习差距的大部分

Hunyuan-A13B 技术报告

报告介绍了采用混合专家架构的开源语言模型 Hunyuan-A13B。模型总参数量为 800 亿,但推理时仅激活 130 亿个参数。模型使用经过严格筛选、并加强 STEM 数据整理的 20 万亿 token 语料进行预训练,随后通过监督微调和大规模强化学习进一步提升能力。其双模式思维链框架会根据任务复杂度调整推理深度。报告称,该模型在数学、科学、编程等评测中表现具有竞争力。开发团队公开模型,以支持开

WhatWorkedBench:评估 AI 智能体的实验理解能力

WhatWorkedBench 用于衡量 AI 研究智能体预测组件变化对实验结果影响的准确度。智能体检查代码、选择测量项,并预测不同配置的得分;参考影响通过在 CPU 上穷举运行所有配置得出。该基准涵盖来自 30 个数据源的 36 项任务,以及八类工作流。在评估中,对智能体观测结果拟合高斯过程提高了影响恢复能力;将行为相同的配置编码为等价项也提升了准确度。WhatWorkedBench 旨在支持实