AI 新闻中心

AI 新闻中心 过去24小时分析了 217 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

EVO-WAM:通过视频—动作验证改进世界动作模型

EVO-WAM无需收集额外的专家示范,也无需在外部环境中执行候选动作,即可将世界动作模型适配到新的机器人任务。该方法利用视觉语言模型筛选能够完成任务的视频片段,并通过逆向动力学模型验证视频与对应动作是否一致。在RoboTwin 2.0的七项未见任务中,Cosmos3的平均成功率从26.9%提高到68.0%,DreamZero则从28.5%提高到46.4%。在真实世界的三项未见长时程复合任务中,Co

LongLive-Plug:面向视频生成的一次性通用蒸馏

LongLive-Plug 是一种蒸馏框架,可在基础模型上以 LoRA 适配器的形式训练可复用能力,包括少步采样、可控的无分类器引导,以及自回归长视频生成中的误差校正。研究人员称,该方法无需额外训练即可部署到 54 个下游模型,覆盖三类骨干模型系列和八种任务类别。

EasyPPO:稳定 Critic 是关键

这项研究发现,Critic 的两种失效模式可能导致大语言模型的 PPO 训练不稳定:在 Actor 和 Critic 训练中都排除被截断的 rollout,以及不同提示词之间的回报噪声分布不均。EasyPPO 通过仅对 Actor 筛除过长 rollout、按噪声水平加权 Critic 回归损失,并缩小 Critic 的小批量规模来应对这些问题。在编程、数学推理和多轮搜索测试中,EasyPPO 在

报告称微软 Copilot 外包人员可完整查看用户照片和 AI 提示词

据 404 Media 报道,数百名受雇于微软的合同工能够查看用户上传的照片、发送给 Copilot 的原始提示词,以及 AI 生成的编辑结果。这些人员据称负责评估 AI 生成内容的质量,而不是传统意义上的内容审核。一名合同工表示,照片中的人脸没有经过模糊处理,部分提示词涉及性内容,且存在疑似未经同意的素材。微软隐私常见问题称,图片用于 AI 训练前会对人脸等信息进行模糊处理,但这一说明是否完全适

HiRAE:采用残差预算的分层表征自编码

HiRAE是一种分层自编码器,融合视觉编码器各层级的表征,以提升图像重建质量,同时保持与生成模型的兼容性。该方法以最深层表征为锚点加入残差修正,并为较浅层级设置更严格的预算,限制修正幅度。HiRAE-24保留了潜在标记数量和通道维度。在ImageNet-256上,相比RAEv2,其重建FID从0.299降至0.209。在文生图任务中,HiRAE-24还在GenEval、DPG-Bench和GenA

各向异性表征提升 JEPA 世界模型的规划能力

一项研究表明,准确的预测和未发生坍塌的表征,并不能保证潜在世界模型具有与任务一致的规划几何结构。研究人员提出 AnisoWM 和 ΛReg,用具有固定迹和各向异性约束的可学习对角协方差,替代固定的各向同性高斯正则化。预测目标、预测器架构和欧氏规划器均保持不变。在四个视觉控制环境中,AnisoWM 的规划成功率均高于 LeWorldModel,其潜在规划成本也与实际任务结果更加一致。

超越时间线:Grounded Entity Biographies增强长视频记忆能力

研究人员提出了Grounded Entity Biographies(GEB),一种用于回答超长视频问题的框架。GEB将同一物理对象在不同视频片段中的视觉定位观测连接起来,构建可检索的对象“传记”,同时保留每个时刻的上下文。在问答过程中,系统会将该传记与事件证据一同检索,从而跟踪对象在长时间事件序列中的经历。在四个基准测试中,包括持续一天和一周的录制内容,GEB均优于此前的视频记忆框架。在EgoL

DeepSeek 开源面向华为昇腾平台的基础设施组件

DeepSeek 开源了面向华为昇腾 AI 加速平台的基础设施组件,包括 TileLang 编译工具以及计算和通信库,与此前面向英伟达平台发布的组件相对应。套件涵盖矩阵运算、跨设备通信、向量处理和稀疏注意力等工具。DeepSeek 表示,其模型训练中使用的每个 TileLang 算子都有昇腾高性能实现;在多项关键测试中,这些组件的性能已接近硬件上限。

SentZero:面向胸部 X 光零样本分析的句子中心视觉语言预训练

SentZero 是一种用于胸部 X 光零样本分析的视觉语言预训练框架。它利用大型语言模型对放射科报告进行句子级结构化,以增加训练配对的多样性,并减少对比学习中的假阴性。此外,该方法会根据每个句子的语义调整视觉特征。研究人员报告称,SentZero 在多项下游任务和数据集上提升了零样本泛化能力。

MaLiang-Harness:以可编程方式生成图像和视频

可执行程序能够明确控制图像和视频的构建方式,但代码成功运行并不意味着生成结果符合指定的构图、外观或运动要求。研究者将这种差距称为程序到视觉(P2V)差距,并提出 MaLiang-Harness,将 MLLM 驱动的生成组织为构建、检查和修订的持续流程。该框架把程序版本、修改历史与渲染结果关联起来,使变更可追踪、可验证。在 MaLiang-IBench 上评估 11 个闭源 MLLM、在 MaLia

WorldAttention:面向交互式视频世界模型的高效注意力架构

WorldAttention 是一种面向文本条件交互式视频世界模型的注意力架构,旨在降低完整 KV 缓存带来的计算和内存开销,同时保留长程上下文。该系统结合线性全局注意力与自适应稀疏注意力,并通过分层缓存管理历史 KV 数据。论文报告称,在 VBench-Long 和 InterVBench 测试中,其主体一致性得分分别为 0.9472 和 0.9668,优于所比较的方法。

OmniTaskonomy:视觉生成何时能提升视觉理解?

这项研究探讨,在什么条件下,训练模型生成视觉内容也能提升视觉理解能力。受控实验表明,采用合适的方法进行图像到图像生成训练,可以提高图像到文本理解任务的表现;训练数据越多,收益也越大。研究团队提出 OmniTaskonomy,这是一个涵盖 19 种生成任务和 25 种视觉理解能力的分类体系。不同任务的迁移效果各不相同,例如深度预测有助于度量式 3D 推理,而物体指点有助于计数。任务间梯度对齐程度越高

模型改变想法之处:通过回溯分歧定位提升可验证奖励强化学习的效率

该研究提出 Hindsight-Divergence Localization(HDL),通过 token 对数似然的变化,识别可验证奖励强化学习中值得进一步探索的早期决策点。HDL 不再独立生成大量完整轨迹,而是先生成少量根轨迹,再从选定位置生成续写来补足训练组。续写复用根轨迹的前缀,策略更新仅依据新生成的后缀。在数学、编程和智能体任务的三个模型测试中,与组规模和训练步数相同的 GRPO 相比,