AI 新闻中心

AI 新闻中心 过去7天分析了 260 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

即时记忆:学习为LLM智能体按任务自适应整理记忆

这项研究提出JitMem,一种面向LLM智能体的记忆系统:先完整保留过去的交互轨迹,待新任务到来时再整理出所需信息,从而避免在未知未来查询出现前就决定该记住什么。在ALFWorld、WebShop和τ^2-bench测试中,JitMem优于无记忆智能体,以及在写入时整理记忆的启发式和学习式方法。与最强基线相比,成功率分别提高16.2、16.3和3.9个百分点。即使未经训练的记忆整理器也表现出竞争力

RewardVerse:面向视频奖励模型的准则引导策略优化

RewardVerse旨在缓解视频奖励模型的评分不稳定问题。当模型将主观的视频质量直接映射为单一分数时,评分尺度可能随提示而漂移。该框架先生成适应具体查询的动态评估准则,再据此进行评分。两阶段训练算法RGPO先用不断演进的种子准则预热评分器,随后联合优化准则生成器和评分器。研究团队称,在16维EvalVerse基准和外部数据集上的实验显示,该方法能够减轻评分尺度漂移,并在单项评估和成对评估中取得较

SpeakerMem-R1:面向多人对话的双轨记忆系统

SpeakerMem-R1 是一款面向群体对话的长期记忆系统。它并行存储标注说话者的原文消息,以及按个人和群体组织的结构化信息,并在回答问题时整合实体、事件和时间线索。研究团队报告,该系统在 GroupMemBench、SocialMemBench 和 EverMemBench 上的二元准确率分别为 47.9%、69.2% 和 61.9%;在公开的 EverMemBench 榜单上达到 62.33

MemBodied:面向视觉-语言-动作模型的循环关联记忆

视觉-语言-动作模型为通用机器人控制提供了有力基础,但大多数策略不会保留先前观测中的信息。MemBodied提出固定容量的情景记忆,由记录交互的关联状态和代表初始场景的紧凑参照组成。在五项需要记忆的RMBench任务中,其平均成功率是无记忆策略的7.81倍、基础循环记忆的2.98倍。与最强的记忆增强基线相比,表现高出1.3倍,新增参数量则少了10倍。在LIBERO-Long上,MemBodied达

Hy Image 3.5 Preview 登陆 WorkRally,影视创作者可免费试用两周

腾讯混元发布 Hy Image 3.5 Preview,视频平台 WorkRally 即日起向创作者免费开放两周。该模型支持文生图和图生图,最多可上传 5 张参考图,最高输出 2K 分辨率。腾讯称,数百名专业创作者参与的盲测显示,模型表现较 Hy Image 3.0 提升约 30%。WorkRally 将其接入概念设计、剧集分镜和影视物料等工作流程,并针对专业影视制作进行定制调优。腾讯云 API

PACT:从信用分配到评论器对齐

这项研究通过完整性、前缀一致性和中立性三项条件,形式化定义了语言模型后训练中的 token 级信用分配。研究人员据此分析现有训练信号,并提出 Policy Aligned Critic Training(PACT)。PACT 先更新 actor,再通过重要性采样校正,使 critic 训练与更新后的策略保持一致。在四项智能体数学推理基准测试中,PACT 的平均准确率为 72.87%,比 GRPO

InternW0:面向高效现实交互的基础物理世界模型

上海人工智能实验室推出 InternW0,这是一种将未来视觉动态预测与连续机器人控制相结合的物理世界模型。视频组件提供较长时间跨度的预测上下文,轻量级动作组件则能更频繁地响应新观测。模型使用约 7,200 小时的异构机器人和第一人称视角数据训练,其中包括 275 小时的 EgoLab 数据集。评估涵盖仿真和真实任务,包括 15 阶段的金属有机框架合成流程,以及考虑接触与受力的五阶段移液任务。介绍内

可验证的隐藏动态:从已求解机制生成智能体强化学习环境

VHD-Play先求解数学模型,再将其决策过程呈现为有状态的工具,以构建智能体训练环境。因此,环境动态与轨迹评分基准来自同一模型。该流程以每个仅需几美分的成本生成了3,300个环境。使用这些环境训练Qwen3.6-35B-A3B后,其在涵盖五类环境的诊断测试中的平均智能体得分从0.204升至0.815。研究人员还报告称,模型在未见过的机制和外部基准测试上也有所提升。对比结果表明,可学习差距的大部分

Hunyuan-A13B 技术报告

报告介绍了采用混合专家架构的开源语言模型 Hunyuan-A13B。模型总参数量为 800 亿,但推理时仅激活 130 亿个参数。模型使用经过严格筛选、并加强 STEM 数据整理的 20 万亿 token 语料进行预训练,随后通过监督微调和大规模强化学习进一步提升能力。其双模式思维链框架会根据任务复杂度调整推理深度。报告称,该模型在数学、科学、编程等评测中表现具有竞争力。开发团队公开模型,以支持开

近千个 Claude 智能体发现新型酶系统,基因编辑类股下跌

Anthropic称,Claude从大量DNA序列数据中识别出一种尚未被完整描述的系统,由逆转录酶、邻近基因和非编码重复序列组成,并命名为ART,主要存在于噬菌体中。约950个智能体进行了持续21小时的搜索,消耗约2.1亿个token,随后由研究人员分析并验证发现。该系统的主要功能仍不清楚,也没有证据表明它能像CRISPR一样实现可编程DNA编辑。重复搜索也未能稳定找到关键重复序列。这项发现展现了