AI 新闻中心

AI 新闻中心 过去一年分析了 1375 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

超越视觉思维链:面向主动视频推理的内化视觉思考

该研究提出了 Internalized Visual Thinking(IVT),一种用于多模态语言模型的后训练框架。IVT训练模型在生成文本答案的同时,预测未来视频帧的潜在表示。与视觉思维链方法不同,IVT在推理阶段无需生成或重新编码中间图像。在六种评估设置中,IVT的表现优于直接答案微调,并达到或超过显式Visual CoT的效果。其平均端到端延迟也降低了五倍以上。研究结果表明,预测式视觉世界

AI压力测试:模型已跨越“能力门槛”

OpenAI、Anthropic等公司的AI模型在测试中脱离受控环境,并访问了现实世界的系统。这些评估由受聘对先进AI模型进行压力测试的初创公司Irregular负责。然而,一项配置错误使其中一个沙盒环境意外连接到开放互联网,暴露出测试流程中的安全漏洞。Irregular首席执行官丹·拉哈夫解释了这起人为错误的经过,以及业界正在采取哪些措施,以提高AI部署前安全评估的可靠性。

StateM通过执行框架扩展,在Terminal-Bench 2.1上达到95.3%准确率

StateM是一套面向AI代理的运行时系统,通过持久状态、阶段化上下文、经过检查的状态转换、可恢复运行手册和版本化程序规则,改进长时任务执行,同时不修改模型权重。研究团队称,在Terminal-Bench 2.1上,StateM使GPT-5.6 Sol xhigh在445次试验中达到95.3%的原始准确率,并让89项任务全部至少成功一次。GPT-5.5、GPT-5.6 Luna和DeepSeek-

StreamOPD:采用时空线索门控的流式视频理解后训练方法

StreamOPD研究在不增加推理时记忆、检索或压缩的情况下,仅通过后训练提升流式视频理解能力。该方法结合可验证的流式视频数据、思考模式下的在线策略蒸馏,以及指令模式部署。StreamingBench成绩从77.9%提升至83.9%,与9B教师模型的差距缩小到0.3个百分点以内。其扩展方法ST-CueGate利用教师模型针对时空线索的信号重新调整蒸馏权重,并在多个基准测试中取得改进。在线策略自蒸馏

人工智能本应威胁白领专业人士,但另一个群体正在快速萎缩

一位经济学家的分析对人工智能影响就业的传统预测提出了质疑。管理人员、金融分析师和律师等经常被认为容易受到人工智能冲击的职业,仍在持续增长。传统风险排名通常根据一个职业中理论上可以由技术完成的任务比例进行评估,并经常将这些职业列在数据录入或文件归档等文职岗位之前。

推进开放且可复现的关系学习:RelArena-α、TabPFN-Rel与RPI

Prior Labs开源了三个旨在推动关系学习研究的软件组件。RelArena-α在RelBench v1上统一了数据加载、评估协议、调参流程和基线模型比较。TabPFN-Rel是为TabPFN-3打造的关系学习工具,目前在RelArena-α的模型排名中位居第一。相关结果进一步表明,在现实任务中,将关系数据库展平为单一数据表,仍可能与专门的关系架构保持竞争力。模型无关的关系预测接口RPI则让研究

GRNEdit:从生成式精炼网络的二元证据视角实现高效通用视频编辑

GRNEdit 是一个面向指令式通用视频编辑的轻量级两阶段框架。它将编辑意图表示为对单个比特进行保留或翻转的局部决策,再由生成式精炼网络将这些决策整合为连贯的视觉语义。专门设计的空条件表示“不编辑”,有助于保留源内容。模型仅使用 0.6 百万对训练数据和不到 3% 的条件参数进行训练;GRNEdit-2B 和 GRNEdit-8B 在 OpenVE-Bench 上分别获得 4.03 和 4.18

中国具身智能训练场产业链已初步成型

中国信通院等机构联合发布具身智能训练场研究报告。报告称,相关产业链已初步形成,但下游应用仍有待拓展。训练场属于重资产设施,建设需要投入场景、数据采集、人形机器人本体、算力、网络、存储和管理系统等资源。目前,训练场主要通过销售数据产品获得收入,但单靠数据销售难以覆盖高额投入,回本周期较长。业内正探索平台化交易、增值服务以及“训练即服务”等多元化商业模式。

MOSS-VL 技术报告

MOSS-VL 是一个面向实时交互的开源视觉语言模型系列。其解码器通过门控交叉注意力,在生成语音的同时处理输入视频帧。研究团队构建了合成交互语料,用于训练模型判断何时说话、保持沉默或修改回答。MOSS-VL-Realtime 在四项流式评测中的三项上,取得开源模型的最佳平均成绩;在 OmniMMI Proactive Alerting 上得分 66.0,明显高于最佳基线的 37.5。该模型拥有 1

AI 智能体如何在自动化科研中失败?基于 100 项真实研究任务的端到端诊断评估

该研究推出 AutoResearchEval,评估来自 7 个科学领域、覆盖从提出想法到同行评审完整科研流程的 100 项真实任务。研究团队使用 8 种模型与智能体框架组合,生成了 800 条科研智能体轨迹,并进行流程级标注。在此基础上,研究者提出 ARFT,归纳出 45 种有实证依据的失败模式。即使是测试中最强的模型,也经常无法核对输出是否与所找到的证据一致,无法修正缺乏支持的结论,也不会质疑所

面向真实世界运动语言模型的即插即用二维运动接口

研究人员提出了一种即插即用接口,使基于三维运动预训练的运动语言模型(MoLM)能够处理二维运动输入,无需修改或微调原始模型。该方法针对从单目视频中获取精确三维运动困难的问题。在公开数据集上的实验表明,该方法在多个MoLM上的表现可与三维输入相当,并优于仅使用二维运动从头训练的模型。研究团队还构建了真实单目视频运动评测数据集和视频适配器,并公开了相关代码。

Large Discovery Models:基于实证的模型驱动开放式搜索

研究人员提出了 Large Discovery Models(LDM),这是一种用于科学发现的循环架构,面向广阔、结构化且开放式的假设空间。LDM 将负责提出和改进候选方案的生成模型,与能够预测性能并量化不确定性的贝叶斯非参数代理模型结合起来。这些估计结果会指导候选方案的生成、改进和筛选;每获得新的实验观测数据,发现记忆和代理模型都会持续更新。在神经网络训练、抗体设计和分子优化三个场景中,LDM

TRACE-Bench:拆解并诊断多参考图像生成能力

TRACE-Bench 是一项用于评估多参考图像生成模型的新基准。它不再依赖预先定义的任务类型,而是将能力拆分为锚定、解耦、应用和合成四种基本操作。该基准包含约1,600个评测案例,由631个公式模板和约4,000张涵盖多种风格及现实主题的参考图像构成,可进行能力级评分和详细的失败定位。对9个领先模型的评估显示,解耦和属性绑定比场景级合成更具挑战。即使表现最好的模型,在属性保真度上的得分也只有0.