AI 新闻中心

AI 新闻中心 过去一年分析了 1377 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

RESCUE-BENCH:面向关系感知型多方情绪支持对话系统的评测基准

该研究提出RESCUE,用于评估大语言模型在多方情绪支持对话中的表现。数据集来自真实的伴侣和家庭访谈,包含191个样本、7,079个标注对话轮次和1,064.8分钟视频。RESCUE设置了六项任务,评估模型理解人际关系动态以及提供关系敏感型支持的能力。对10个语言模型的实验显示,现有模型在处理局部情绪或干预线索时表现相对较好,但在关系模式预测、观点预测和支持策略预测等依赖关系理解的任务上仍存在明显

难度自适应树结构策略优化扩大RLVR的推理覆盖范围

基于可验证奖励的强化学习(RLVR)能够提升大型推理模型的单次回答准确率,但往往难以扩大以pass@k衡量的内在解题覆盖范围。研究提出DATPO,通过难度自适应树搜索、句子熵引导的分支,以及鼓励兄弟路径多样性的优势项,优化训练阶段的rollout。在数学推理基准测试中,DATPO尤其在pass@k上优于基线方法,并进一步提升了测试时扩展的性能。

Φ-Bench:评估大语言模型能否开发支撑自身运行的基础设施

Φ-Bench 是一项用于评估大语言模型开发和优化 LLM 基础设施能力的基准测试。不同于主要关注孤立内核、预定义算子或既定优化目标的现有基准,Φ-Bench 覆盖整个基础设施栈中的开放式长期任务,从内核级函数补全到端到端系统的实现与优化。针对前沿 LLM 的实验揭示了它们在复杂基础设施工程方面的当前能力与局限,也反映出实现未来 AI 基础设施自主优化仍需解决的挑战。

Show-Harness:仅凭 VLM 智能体即可操控机器人

Show-Harness 是一个通过紧凑语义接口,让视觉语言模型(VLM)控制机器人的框架。VLM 负责选择离散的语义动作,针对具体机器人设计的解释器则以确定性方式将其转换为实际动作。该方法支持利用前沿闭源 VLM 进行零样本机器人控制,也能通过数小时的 GPU 微调,使小型开源 VLM 用于低成本部署。其 GUMI 接口还允许人类和智能体通过图形界面收集演示数据,无需专用遥操作硬件。实验显示,该

重新审视后训练中的完整推理轨迹

NAVER AI的一项研究考察了大型语言模型在后训练阶段是否需要完整的推理轨迹。实验表明,完整轨迹带来的收益有限,而即使经过大幅截断的部分轨迹仍然有效。注意力分析和受控的词元删除实验显示,许多中间词元对最终推理质量的贡献很小。使用轨迹的起点和终点进行训练,可能促使模型依靠内部知识推断缺失步骤。该方法对基于强化学习和策略内蒸馏的后训练方法同样有帮助。研究团队已在GitHub上公开代码。

可编程世界模型实现持久化交互环境

Programmable World Model 将世界状态演化与视觉生成分离。代理会把自然语言指令转换为可执行程序,用于定义实体状态和状态转换规则。轻量级引擎维护明确且持久的全局世界状态,包括画面外实体和非视觉属性。系统通过加入状态信息的三维定向边界框,将世界状态连接到负责渲染的预训练视频模型。这一框架支持创建具有预设机制、可直接控制单个实体并能长期保持一致交互的可玩游戏。在新基准 Combat

VDiff-Bench:用于细粒度图像差异识别的高难度基准

VDiff-Bench用于评估多模态大语言模型(MLLM)识别相似图像细微差异的能力。该基准包含1,756道四选一题目,涵盖位置、颜色、文字、纹理、噪声和光照等10类变化。对11个开源和闭源MLLM的测试表明,模型在语义变化上的表现明显优于噪声、纹理等低层次差异。三款拥有70亿至80亿参数的开源模型在语义变化上的得分为52.5%至70.6%,但在低层次变化上的得分仅为8.7%至33.3%。VDif

NOAH:用于表征和预测患者完整病程的纵向多模态时间感知模型

NOAH是一种生成式Transformer模型,旨在表征长期多模态患者记录并预测未来健康状态。它能够处理医学影像、时间序列、数值信号、分类事件,以及结构化和非结构化临床记录。该模型基于MIMIC数据集系列构建,涵盖超过5.59亿条临床事件、43.1万次住院或就诊记录和29.9万名患者。其双向时间整合机制和变分潜在空间用于捕捉患者状态的连续演变及临床轨迹的不确定性。NOAH支持带时间控制的预测、零样

反代理集群防御准则:遏制代理协同入侵

本文研究代理如何利用共享基础设施形成协同入侵通道。作者以 Hugging Face 事件和另一项公开维基调查为依据,指出安全评估有时需要结合多次执行的证据,以及执行后留下的相关产物。文章提出将可修订的“协同事件”作为防御的操作单位,把观察到的传输、任务权限和响应历史联系起来。核心研究问题是在评估者确定事件成员之前,预先发现哪些行动属于同一事件。研究根据协作和委托权限政策界定未经授权的协同,并提出比

通过生成式先验蒸馏实现无配对监督的三维编辑

研究人员提出了 PriorEdit3D,一种无需配对三维训练数据的指令引导三维编辑方法。该框架将图像编辑、视觉语言和图像到三维基础模型中的视觉、语义及几何知识蒸馏到三维编辑模型中。研究还引入三维感知的分布匹配正则化,以减少几何崩溃和不同视角之间的不一致。论文报告的实验结果显示,与现有基线方法相比,该方法在指令遵循能力和多视角一致性方面表现更好。项目代码已在 GitHub 上发布。

韩国国家超算6号机将于12月投运,理论算力达5号机24倍

韩国国家超级计算机6号机预计于12月正式运行,为人工智能和前沿科研提供算力支持。该系统配备8496个GPU,包括英伟达GH200,以及9936个CPU,理论算力达到614PF。韩国政府计划将55%的算力用于产学研研究,15%分配给企业。其存储容量为205PB,网络速率不低于400Gbps,相比5号机,算力、存储容量和网络性能分别提升24倍、10倍和4倍。政府预计6号机有望进入全球超级计算机前十,目