AI 新闻中心

AI 新闻中心 过去一年分析了 1380 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

DiagEvo:通过分层错误记忆实现诊断引导的自我进化

DiagEvo是一种语言模型自我进化方法,能够从求解器自身的失败历史中分析反复出现的错误原因。分层记忆按技能节点组织这些原因,并将其标记为“活跃”或“已掌握”。系统据此生成针对特定错误的题目,同时保留自由探索机制。双重置信度过滤器只有在最常见答案具有明显票数优势时,才保留中等难度题目。使用4B诊断模型时,DiagEvo在Qwen3-4B、Qwen3-8B和OctoThinker-8B上的九项基准测

SMELT:计算量匹配的循环式 MoE Transformer 扩展定律

一项研究在混合专家(MoE)架构中评估循环式 Transformer。这类模型通过重复执行共享层块来增加有效深度,但研究在比较时匹配了每个 token 的计算量、非嵌入参数总数和 KV 缓存。研究人员提出 SMELT,让中间一半的层重复执行两次。在最大达到 540 亿个非嵌入参数的四种模型规模上,SMELT 随计算量增加呈现更快的损失下降,并在计算最优前沿节省 6.8% 至 18.0% 的训练 F

Harness-of-Harness:通过持续改进实现多日自主软件开发

该论文提出 Harness-of-Harness(HoH),一个面向大语言模型编程代理的框架。HoH 将现有代理运行环境组织为反复执行的规划、编码和测试循环,在修复问题与扩展能力之间取得平衡,并将开发拆分为可验证的小步骤,分离实现阶段测试与独立评估,同时保留带版本记录的项目历史。研究人员报告称,在 GameCraft-Bench、FrontierSWE 和 ProgramBench 上,经过三次迭

OPPO 联合多所高校推出端侧 AI 记忆评测基准 MobileMem

OPPO 联合 OpenKG,以及浙江大学、同济大学、东南大学等高校的研究团队,推出端侧 AI 记忆评测基准 MobileMem。该项目旨在建立统一标准,让不同技术方案能够进行测试、比较和改进。技术白皮书已经公开,数据集和相关工具预计将陆续开源。OPPO 认为,端侧记忆是 AI 助手持续理解用户、记住其习惯和偏好,并在合适时机提供帮助的重要基础。目前公告没有公布具体评测结果,也未提供经验证的性能提

Qwen-Drive-1.0:迈向自动驾驶视觉语言基础模型的初步探索

Qwen-Drive-1.0是一款面向自动驾驶的视觉语言模型,将三维感知、视觉问答和运动规划统一到同一框架中。外部鸟瞰视角(BEV)感知头负责三维目标检测、语义占用预测和BEV地图分割,并为三维场景结构提供可检查的接口。规划模块基于共享的视觉语言模型表示生成车辆未来轨迹。分阶段训练方案结合驾驶监督数据与通用视觉语言数据,在培养驾驶能力的同时,尽量保留广泛的视觉理解和指令遵循能力。多种开放环、伪闭环

E-Commerce Bench 评估大语言模型智能体执行长期自主商业运营的能力

E-Commerce Bench 是一个开源基准,用于评估大语言模型智能体在动态年度商业模拟中的表现。智能体需要同时运营多家网店,开展市场调研,与供应商谈判,优化销售策略,处理订单和退货,并管理现金流。模拟环境包括促销活动、自然灾害和供应链冲击。研究团队从七个维度评估了18个前沿模型,结果显示没有任何模型在所有领域都占据优势。GPT-5.6 Sol 将10万初始资金增至1,431,425,期末资产

ZimaBlue通过可扩展视频预训练推进通用世界动作模型

ZimaBlue是一种利用大规模第一视角视频训练机器人世界动作模型的框架。其三阶段训练流程首先从人类和机器人视频中学习因果具身视觉动态,随后通过统一的动作表示将这些表征与异构机器人轨迹结合,最后针对目标机器人进行专门化。异步Slow-Fast架构将高容量Slow世界模型与轻量Fast分支结合,可在NVIDIA RTX 4090上以30 Hz进行动作预测。在真实机器人零样本评估中,相比仅使用目标机器

H3-World:将语言理解转化为交互式世界控制

H3-World是一种高效框架,可将拥有330亿参数的MiniMax-H3视频生成模型转化为交互式世界模型。该系统无需引入专用动作模块,即可通过自然语言指令更精确地控制角色行为和摄像机运动,并实现时间层面的控制。系统将每个动作表示为角色指令与摄像机指令的结构化组合,并与对应时间段的视频潜在表示对齐。时间注意力路由会将每条指令限制在指定时间区间内,从而减少不同动作之间的控制干扰。使用8,000个游戏

评估多模态大语言模型作为无人机控制的视觉语言行动智能体

该研究评估多模态大语言模型直接进入无人机控制回路后的表现。研究提出DroneCATS-Agent架构和DroneCATS基准,测试四项能力:接近可见目标、跟踪移动目标、搜索初始视野之外的区域,以及指挥多架无人机。模型无需微调,也不依赖预先定义的函数调用模式。结果显示,即使是简单的具身任务,目前模型仍远未达到可靠水平。小型开源模型有时比前沿模型更稳定地飞入目标范围,但经常过早宣布到达,或始终不宣布到

StudentSim:训练基于大语言模型的学生模拟器

StudentSim是一套为AI导师构建个性化学生模拟器的训练框架。它先利用多名学生的数据进行联合训练,再针对每名学生进行专门化,使模拟器能够复现特定学生的回答,并模拟其在导师指导下的变化。配套的StudentSimEval评估协议涵盖60名学生,测试领域包括国际象棋、英语作为第二语言的写作和数学。在三个领域中,StudentSim在行为保真度和指导响应能力上都超过了GPT-5.4。在国际象棋概念

消息人士:OpenAI 的 Astra 模型采用“recurrent depth”,提升成本与性能但使推理更难监控

据《The Information》报道,OpenAI 即将推出的 Astra 模型采用了名为“recurrent depth”的技术,可能提升成本效率和性能。但这种方法也会让模型的推理过程更难检查和监控。OpenAI 表示,Astra 在编程以及操作电脑应用程序等方面的能力将有所增强。

Hi-Q:面向多跳问答的层次化证据引导查询细化

Hi-Q是一种面向多跳问答的证据条件化层次化查询细化框架。系统首先判断检索到的证据是否支持当前查询单元;如果无法解决,则通过保持依赖关系的算子进一步展开,并验证语义覆盖范围。由此生成的查询树,其结构由语料库中的支持信号决定,而不是由固定的分解模板或预先构建的图决定。在三个采用全语料库检索的基准测试中,Hi-Q平均取得52.3 EM和64.0 F1,分别比IRCoT高15.1 EM和18.2 F1。

ReFlowSET:基于表征对齐的潜在流匹配实现SAR到EO图像转换

ReFlowSET是一种条件潜在流匹配方法,用于将合成孔径雷达(SAR)观测数据转换为电光(EO)图像。与通常依赖自然图像预训练自编码器的现有方法不同,该方法通过联合评估SAR输入和EO目标的重建效果来选择潜在编解码器。随后,它在选定的潜在空间中从头训练一个规模显著更小的条件DiT模型。训练过程中,带噪声的EO特征会与冻结视觉基础模型提取的干净表征进行对齐,但不会增加推理成本。在QXS-SAROP

揭示原生统一多模态模型中理解与生成的协同效应

一项研究分析了原生统一多模态模型中视觉理解与视觉生成的相互作用。结果表明,两项目标能够彼此提供有用信号:生成能力可改善理解所需的视觉特征,而理解能力则能增强生成所需的视觉—语言对齐。但当两项目标被迫经过同一计算路径时,其中一方可能占据主导。研究提出按任务专门化视觉计算、同时保留语义交互的架构,以减少这种不对称退化。研究还发现,在依赖共享知识的理解与生成任务之间存在正向迁移。在同时要求图像理解和生成

控制流与数据流分离,提升多智能体大语言模型提示优化的稳定性

一项新的研究框架将多智能体大语言模型系统中的执行关键协议与任务相关语言分离。消息路由、输出格式和终止信号被表示为经过类型定义和验证的程序对象,而提示仍可用于优化任务性能。在合成推理、协作式评审生成和保险定价流程的测试中,该方法实现了100%的最终协议有效性,并持续提升了任务表现。