StreamArena:迈向持续、交互式和长时程的智能体流式视频理解
StreamArena是一项用于评估多模态智能体长期处理连续视频流能力的基准测试。数据集包含243段完整视频,平均时长为88.8分钟,以及3646组经过严格标注的开放式问答。评估内容包括实时感知、历史事件回溯、主动交互和多模态工具使用。结果表明,仅保留最近帧的方法无法找回较早事件;将过去观测转换为文本会丢失视觉证据;反复压缩视觉记忆则难以长期保留细节。研究还提出了StreamMind双层架构,将对
AI 新闻中心 过去一年分析了 1723 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
StreamArena是一项用于评估多模态智能体长期处理连续视频流能力的基准测试。数据集包含243段完整视频,平均时长为88.8分钟,以及3646组经过严格标注的开放式问答。评估内容包括实时感知、历史事件回溯、主动交互和多模态工具使用。结果表明,仅保留最近帧的方法无法找回较早事件;将过去观测转换为文本会丢失视觉证据;反复压缩视觉记忆则难以长期保留细节。研究还提出了StreamMind双层架构,将对
研究人员提出 SMRC-SD,通过更有选择性的特权蒸馏改进多轮智能体。该方法不再在每个回合无条件使用成功参考轨迹提供的指导,而是先检查智能体当前的执行状态是否得到参考轨迹支持。只有状态匹配时才进行蒸馏,并根据智能体实际到达的状态构建教师上下文。使用 Qwen3-1.7B 时,ALFWorld 的任务成功率从 0.746 提升至 0.865,WebShop 从 0.574 提升至 0.693。消融实
研究人员提出了 UA-NWM,这是一种用于无人机根据目标图像前往指定位置的高效潜在世界模型。现有方法通常仅依赖一个或少数几个未来状态预测来评估候选轨迹,在具有较大未来状态不确定性的大规模户外环境中存在局限。UA-NWM 将可能的未来表示为不确定性子空间,并把预测与目标之间的差异分解为可由不确定性解释和无法解释的部分。系统仅使用无法解释的残差进行轨迹评分,因此无需生成多个未来样本,也能实现更稳健的路
YOLO-PEFT 是一个面向 YOLO 及其他实时检测器的结构感知型参数高效微调框架。它根据算子有效性、检测器语义、图接口和部署约束等明确条件规划适配器位置,并在训练前拒绝不合适的配置。在 VOC07+12 评测中,规划器选择的 RS-LoRA 在 YOLO11s 和 YOLO12s 上分别达到 0.7138 和 0.7307 的 mAP50-95,高于全量微调的 0.6428 和 0.6662
Artificial Analysis 的文生视频模型排名显示,前十名中有九个来自中国人工智能实验室。这些模型正逐步获得全球用户采用,可能使中国在构建所谓“世界模型”方面取得优势。不过,围绕中国人工智能雄心的讨论仍主要集中在 Moonshot 的 Kimi K3 等新型大语言模型上。
AudioRubrics 是一个用于提升音频推理能力的强化学习框架。它从每个原始波形中生成基于音频证据的评估规则,并根据模型自身的输出持续重新生成和调整规则权重。与只监督最终答案或依赖固定人工标准的方法相比,这种设计能够针对模型当前的弱点提供自适应的训练信号。该方法旨在处理从感知到多步推理等不同类型的问题。研究人员在三个音频推理基准上进行评估,报告称其显著优于多种开源和基于训练的基线方法。分析还显
一项研究考察了人格条件化的大型语言模型智能体在经历11种重大生活事件后,性格特征如何变化。研究以“大五人格”作为心理测量基准,将智能体的变化轨迹与人类人格纵向研究证据进行比较,并通过新基准BFI-Adapt评估了14个模型。结果显示,智能体会产生可测量、稳定且受事件影响的特征变化,但变化幅度通常小于人类研究中的效应量。性别和文化区域提示的调节作用较小,而不同人格设定之间的差异比人类样本低三到四倍。
宇树科技已启动首次公开募股申购,有望成为中国第一家上市的人形机器人企业。公司发行价确定为每股150.80元,上市后市值约609.93亿元。大疆曾于2018年以约1012.86万元取得宇树约17%的股份,一度成为其最大外部股东,但在2019年减资后退出。若大疆一直持有这笔股份,其当前市值可能达到数十亿元。宇树计划将募资重点投入智能机器人模型、机器人本体、新产品及制造基地建设。公司2025年营收为16
研究人员提出了 C4,这是一套受认知科学启发的评估框架,用于测试多模态大语言模型(MLLM)能否从不明显但有意义的概念关系中还原被编码的含义。该框架利用中文成语构建跨概念创造力任务,提供明确的连接路径、可调节的难度和精确答案。C4-Eval 包含 184 个合成题目和 37 个由人类创作的案例,在五种任务设置下形成 884 个主要答案恢复案例。对十个 MLLM 的评估显示,表现最好的闭源模型准确率
一项研究分析了监督微调(SFT)和强化学习(RL)在提升大语言模型多任务推理能力时为何表现不同。初步实验显示,SFT在多阶段训练中会造成严重的任务冲突,而RL能够让不同任务更稳定地共存。在参数层面,RL会针对不同任务产生稀疏且近似正交的更新。研究人员认为,这源于两种方法在梯度干扰上的差异:SFT中的干扰受梯度绝对大小限制,而RL中的干扰受优势归一化和在线策略优化引起的梯度方差限制。基于这一发现,研
公开基准数据不可避免地会进入预训练语料,模型一旦记住这些数据,评测分数就可能被高估。该研究指出,现有的 G-AP 指标存在缺陷:它依赖二元的对错结果,而且先求平均再计算差值,会让过度抑制与抑制不足相互抵消。研究提出 SA-PPG,通过采样估计每道题的解题概率,逐题与干净模型进行比较,并按干净模型的解题概率分组汇总。RailCap 则在生成过程中判断可能存在的污染;当采样结果回到贪心生成轨迹时,限制
英伟达发布了 NemotronLabs VoiceChat 11B,这是一款面向实时语音对话的开源端到端模型。不同于传统上将自动语音识别、大语言模型和语音合成串联起来的架构,VoiceChat 11B通过统一网络直接完成流式语音理解与生成。据英伟达介绍,该模型的轮次切换延迟最低可达448毫秒,并支持全双工交互,用户可以在对话过程中插话。模型还支持对话期间调用工具,并通过独立输出通道在处理外部API
阿里 AI 应用创作平台 Meoo(秒悟)推出面向团队和企业用户的团队版,并接入 Qwen-3.8-Max 模型。新版本增加统一身份管理、积分共享池、权限体系和团队技能市场,支持企业集中管理应用、技能与云资源。用户无需编程基础,只需通过自然语言描述需求,即可生成应用、网站、H5 页面或微信小程序并直接部署。平台还新增自定义域名部署、可记录用户偏好和业务术语的个性化记忆,以及支持通过 Qoder、C
研究人员提出了 DualIFM,一种专为视网膜眼底图像设计、从架构层面实现可解释性的基础模型。其 BagNet 主干网络采用小感受野,可生成忠实反映模型决策依据的证据图。预训练阶段加入的二维投影层能够直接可视化表示空间,从而发现具有临床意义的聚类以及潜在的虚假相关。DualIFM 使用超过 80 万张未标注眼底照片进行训练,在参数量仅为 RETFound 十六分之一的情况下,取得了相近的性能,并能
Capek 0.5是一款面向机器人的视觉语言模型,以完整的执行流程为核心组织具身智能体的能力,涵盖空间推理、时间理解、动作指导和状态验证。研究人员首先使用带有可验证奖励的强化学习,分别训练各项能力的专家模型,随后通过权重空间合并和策略空间蒸馏,将其整合为单一模型。Capek 0.5提供2B和35B-A3B两种规模,并通过包括新基准Capek-StateBench在内的综合测试、能力保留实验,以及模