AI 新闻中心

AI 新闻中心 过去30天分析了 912 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

基础模型协同架构推动实体智能体实现长时程导航

NavMCP将负责高层推理的视觉语言模型与负责闭环执行语义子目标的导航基础模型结合起来。意图、观测和记忆三个通道使系统能够决定需要寻找哪些证据,将导航过程转化为有依据的轨迹信息,并在多次调用之间保存发现、否定性证据和未解决目标。该方法无需重新训练任一模型,就能把孤立的导航回合转变为持续的具身交互。NavMCP在HM-EQA、MT-HM3D和EXPRESS-Bench上取得当前最佳结果,在HM-EQ

Qwen3.8-Next 架构设计:评估、效率与训练稳定性

该研究介绍了 Qwen3.8-Flash-Next,这是一个拥有 1250 亿参数的稀疏混合专家模型,每个 token 仅激活 60 亿参数。在 14 项预训练基准测试中,该模型有 8 项超过前代 397B-A17B,其余测试最多落后 2.6 分;同时,激活参数和训练 token 数降至三分之一,训练 FLOPs 约为九分之一。其架构结合了 Gated DeltaNet、全局注意力、Qwen Sp

PaperBanana-Interact:通过多轮人类反馈改进科学图表

PaperBanana-Interact研究如何利用多轮人类反馈迭代改进科学图表。研究人员发布了MTPaperBananaBench基准,其中包含292张图像和3,518项经过标注的用户需求,并构建了用于大规模评测的用户模拟器。对现有多轮系统的评估发现了两种常见失败模式:随着轮次增加,图表质量逐步下降的“质量漂移”;以及后续修改丢失此前已实现功能的“遗忘”。PaperBanana-Interact

CogEvol:面向高效可靠的学习环境生成

CogEvol是一系列专为学习环境生成设计的模型,可将课程简介一次性转换为完整的学习内容,包括结构化JSON幻灯片和自包含的交互式HTML页面。开发团队称,该系统基于22万次生产请求开发,生成一页幻灯片的中位时间为17秒,生成交互式页面为59秒。CogEvol-27B在幻灯片质量评测中得分83.7,在包含500个案例的交互式HTML基准测试中得分63.7。CogEvol-4B已依据Apache 2

Lucida:解析、生成并放置物体,实现可组合的真实场景到仿真建模

Lucida是一种将真实室内环境重建为完整、可编辑三维物体资产的方法,面向机器人仿真和具身智能。系统首先构建场景图,为每个物体保留多视角证据;随后根据这些证据生成完整资产,并通过GizmoAct完成物体放置。视觉语言模型以闭环GUI交互的方式控制放置过程,并自行判断对齐是否达到要求。根据论文作者报告,Lucida在R2S-Scene上的mAP较Boxer提升69%;在CA-1M上,ADD-SB@0

MNIST-PRO:MNIST以面向AI智能体的部分可观测世界形式回归

MNIST-PRO是一项用于研究AI智能体如何在部分可观测环境中构建和更新感知状态的基准测试。它将手写数字识别转换为基于连续视觉片段的搜索任务,并限制对先前观察结果的回看能力。研究使用四种记忆表示评估了10个多模态模型:原始视觉历史、文本状态、结构化网格地图和整合视觉画布。模型在完全可观测条件下表现良好,但部分可观测性暴露出明显的性能差距。研究发现三项主要瓶颈:整合零散视觉信息、持续探索直到观察完

BLARM:通过融合潜在刚性运动基元从视频生成3D物体动画

BLARM是一种由视频驱动静态3D网格动画的前馈方法。给定单目视频和物体网格,系统能够生成时间上连贯的动画网格,无需显式骨架、笼状模型、蒙皮权重或绑定标注。该方法使用一组随时间变化的学习型刚性运动组件,以及将顶点分配给组件的时间不变权重来表示运动。几何特征和视频特征通过分解式时空注意力进行融合。训练过程结合轨迹重建、熵正则化和运动感知对比学习,旨在通过低维变形空间生成准确、稳定且具有一定可解释性的

CAST:面向可靠长程工具调用代理的批评感知监督

CAST 是一种训练框架,可将任务结果转换为动作级的结构化理由,用于解释代理的操作是否有效。这些批评信息随后被用于训练和优化执行长期、交互式工具调用任务的大语言模型代理。在动态工具调用基准测试中,使用 CAST 微调 Qwen3 系列模型后,代理的可靠性得到提升。在零售任务上,CAST 的 pass^4 表现比 GPT-OSS-120B 高出超过 10 个百分点;在跨领域的远程医疗场景中,表现又提

先学会评估再改进:面向自主科研智能体的自动评估规则生成

AutoSciRub 是一个面向自主科研智能体的框架,能够在研究开始前生成针对具体任务的可执行评估规则。它将定义不充分的研究指令拆解为原子化科学目标,并结合相关文献和可用数据,制定具体且可验证的标准。评估规则可指导实验与分析;逐项验证则能发现未满足的要求,并针对性地改进研究报告及其支撑成果。在 ResearchClawBench 和 AstaBench E2E Discovery 测试中,Auto

让大型推理模型突破人类监督持续扩展

本文研究在人类监督逐步退出学习闭环后,大型推理模型(LRM)如何继续提升。对于数学和编程等结果可自动验证的任务,利用可验证奖励的强化学习已经显著改善了推理能力;但在开放式任务和智能体任务中,可靠奖励更难获得。研究分析了两个相互关联的方向:从逐个实例的人类判断转向可复用的验证器和无需人工反馈的奖励,以及从人工策划的任务和环境转向模型自行生成的课程、构建的环境和自主协同进化。L0至L4的五级框架用于标

用于大语言模型情感检测的跨语言功能向量

本研究探讨功能向量能否跨语言引导大语言模型完成任务。研究人员从上下文示例中提取潜在任务方向,并将其应用于多语言、多标签情感识别。由源语言提取的功能向量在其他语言中也能显著提升性能,包括推理时不提供示例的零样本设置。结果表明,功能向量捕捉的可能是与语言无关但与任务相关的信号,而不只是特定语言的词汇模式。研究还发现,每个模型用于构建有效功能向量的最佳注意力头范围相对稳定,并且在不同语言之间保持一致。该

PaperGym:利用科学评分标准训练研究计划生成模型

PaperGym 是一个将科学论文转化为完整训练环境的框架,用于训练生成研究计划的 AI。它根据论文的研究目标和背景生成问题,再从方法和实验中提取评估标准,从而减少模型仅靠改写内容获得奖励的情况。标准泄漏率降至 3.7%,而现有数据集为 11.90% 至 34.10%。在 Qwen3 模型上训练后,五项基准测试的平均成绩最高提升 5.6 分。研究团队还发布了包含 2 万个样本的 PaperGym-

On-Policy 蒸馏真的在蒸馏吗?从噪声教师到自我改进

一项研究分析了 On-Policy 蒸馏(OPD)提升语言模型性能的原因。研究人员发现,教师模型提供的逐 token 监督信号存在大量噪声,而且教师模型规模越大,噪声比例越高。然而,即使移除这些噪声信号,学生模型仍能达到相近的性能。研究表明,性能提升主要来自对低对数概率 token 的学习。因此,使用单一固定的负优势值,也能取得与教师信号相近的效果。基于这一发现,研究团队提出了无需教师模型的 On

大模型没有独门秘笈:腾讯混元4如何借助开源生态与顶尖人才实现逆袭

腾讯在四个月内完成大语言模型与多模态团队重组,并推出混元4。该模型据称拥有7700亿参数,支持最长达100万Token的上下文。分析认为,混元4融合了DeepSeek的稀疏注意力机制DSA、智谱IndexCache的跨层索引复用方案,以及更简化的恒等超连接设计。来自竞争对手公司的资深研究人员加入,也推动了相关研发。文章指出,随着论文、代码和实验结果加速公开,以及顶尖工程师持续流动,大模型领域技术优

DeepSeek 首个视觉实验模型正式开源,拥有 3050 亿参数

DeepSeek 已通过 MIT 许可证开源 V4 系列首个实验性多模态模型 DeepSeek-V4-Flash-Vision-Exp。该模型基于 V4-Flash 架构,深度整合视觉模块,支持图像理解与分析。模型总参数量达到 3050 亿。根据官方评测,其在纯文本智能体任务上的表现与 V4-Flash 相当,在多模态测试中展现出接近行业顶尖水平的竞争力。模型还支持调用外部工具,独立完成复杂的智能