AI 新闻中心

AI 新闻中心 过去30天分析了 912 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

H3-World:将语言理解转化为交互式世界控制

H3-World是一种高效框架,可将拥有330亿参数的MiniMax-H3视频生成模型转化为交互式世界模型。该系统无需引入专用动作模块,即可通过自然语言指令更精确地控制角色行为和摄像机运动,并实现时间层面的控制。系统将每个动作表示为角色指令与摄像机指令的结构化组合,并与对应时间段的视频潜在表示对齐。时间注意力路由会将每条指令限制在指定时间区间内,从而减少不同动作之间的控制干扰。使用8,000个游戏

评估多模态大语言模型作为无人机控制的视觉语言行动智能体

该研究评估多模态大语言模型直接进入无人机控制回路后的表现。研究提出DroneCATS-Agent架构和DroneCATS基准,测试四项能力:接近可见目标、跟踪移动目标、搜索初始视野之外的区域,以及指挥多架无人机。模型无需微调,也不依赖预先定义的函数调用模式。结果显示,即使是简单的具身任务,目前模型仍远未达到可靠水平。小型开源模型有时比前沿模型更稳定地飞入目标范围,但经常过早宣布到达,或始终不宣布到

StudentSim:训练基于大语言模型的学生模拟器

StudentSim是一套为AI导师构建个性化学生模拟器的训练框架。它先利用多名学生的数据进行联合训练,再针对每名学生进行专门化,使模拟器能够复现特定学生的回答,并模拟其在导师指导下的变化。配套的StudentSimEval评估协议涵盖60名学生,测试领域包括国际象棋、英语作为第二语言的写作和数学。在三个领域中,StudentSim在行为保真度和指导响应能力上都超过了GPT-5.4。在国际象棋概念

消息人士:OpenAI 的 Astra 模型采用“recurrent depth”,提升成本与性能但使推理更难监控

据《The Information》报道,OpenAI 即将推出的 Astra 模型采用了名为“recurrent depth”的技术,可能提升成本效率和性能。但这种方法也会让模型的推理过程更难检查和监控。OpenAI 表示,Astra 在编程以及操作电脑应用程序等方面的能力将有所增强。

Hi-Q:面向多跳问答的层次化证据引导查询细化

Hi-Q是一种面向多跳问答的证据条件化层次化查询细化框架。系统首先判断检索到的证据是否支持当前查询单元;如果无法解决,则通过保持依赖关系的算子进一步展开,并验证语义覆盖范围。由此生成的查询树,其结构由语料库中的支持信号决定,而不是由固定的分解模板或预先构建的图决定。在三个采用全语料库检索的基准测试中,Hi-Q平均取得52.3 EM和64.0 F1,分别比IRCoT高15.1 EM和18.2 F1。

ReFlowSET:基于表征对齐的潜在流匹配实现SAR到EO图像转换

ReFlowSET是一种条件潜在流匹配方法,用于将合成孔径雷达(SAR)观测数据转换为电光(EO)图像。与通常依赖自然图像预训练自编码器的现有方法不同,该方法通过联合评估SAR输入和EO目标的重建效果来选择潜在编解码器。随后,它在选定的潜在空间中从头训练一个规模显著更小的条件DiT模型。训练过程中,带噪声的EO特征会与冻结视觉基础模型提取的干净表征进行对齐,但不会增加推理成本。在QXS-SAROP

揭示原生统一多模态模型中理解与生成的协同效应

一项研究分析了原生统一多模态模型中视觉理解与视觉生成的相互作用。结果表明,两项目标能够彼此提供有用信号:生成能力可改善理解所需的视觉特征,而理解能力则能增强生成所需的视觉—语言对齐。但当两项目标被迫经过同一计算路径时,其中一方可能占据主导。研究提出按任务专门化视觉计算、同时保留语义交互的架构,以减少这种不对称退化。研究还发现,在依赖共享知识的理解与生成任务之间存在正向迁移。在同时要求图像理解和生成

控制流与数据流分离,提升多智能体大语言模型提示优化的稳定性

一项新的研究框架将多智能体大语言模型系统中的执行关键协议与任务相关语言分离。消息路由、输出格式和终止信号被表示为经过类型定义和验证的程序对象,而提示仍可用于优化任务性能。在合成推理、协作式评审生成和保险定价流程的测试中,该方法实现了100%的最终协议有效性,并持续提升了任务表现。

EM^2Mem:面向大语言模型的事件中心多模态记忆

EM^2Mem 是一种多模态记忆框架,在构建记忆时将长视频中的异构证据绑定到事件锚点。每个按事件索引的记忆单元整合多模态记录、时间上下文、图关联关系、语义事实和来源信息,使语言模型能够直接读取围绕具体事件组织的紧凑证据,而无需在推理阶段从彼此孤立的片段中重建跨模态和时间对应关系。在三个长视频问答基准测试中,EM^2Mem 相比最强的记忆基线,平均准确率分别提升了2.0、2.4和3.7个百分点。事件

GUI-CC:评估 GUI 世界模型作为智能体环境的上下文一致性

GUI 世界模型通常被评估为单步预测下一屏幕的模型,但其预期用途是作为 GUI 智能体的多步交互环境。GUI-CC 评估生成状态在反复用于后续交互时能否保持上下文一致性。该基准包含两条赛道:基于真实移动端 GUI 轨迹构建的 500 个离线任务,以及覆盖 30 个应用、经模拟器验证的 200 个在线智能体循环任务。评估指标包括转移保真度、转移合理性、上下文一致性和任务进度。实验表明,单步生成的屏幕

安全措施奏效了。LLM 系统真的更安全吗?

一项研究考察了已部署 LLM 服务中的安全措施是否真正提升了整个系统的安全性。拒答率、攻击成功率和政策违规率等常见指标,只能说明控制措施在受测试请求上的表现,并不能反映攻击者在调整方法或寻找其他入口后,仍能获得多少有害任务帮助。研究使用统一的部署层面标准比较不同类型的安全措施。一次成功的攻击就足以证明有害帮助仍然存在;但较高的局部评测分数,并不能证明剩余的有害帮助很少。要得出这一结论,还需要了解安