AI 新闻中心

AI 新闻中心 过去24小时分析了 218 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

HiRAE:采用残差预算的分层表征自编码

HiRAE是一种分层自编码器,融合视觉编码器各层级的表征,以提升图像重建质量,同时保持与生成模型的兼容性。该方法以最深层表征为锚点加入残差修正,并为较浅层级设置更严格的预算,限制修正幅度。HiRAE-24保留了潜在标记数量和通道维度。在ImageNet-256上,相比RAEv2,其重建FID从0.299降至0.209。在文生图任务中,HiRAE-24还在GenEval、DPG-Bench和GenA

各向异性表征提升 JEPA 世界模型的规划能力

一项研究表明,准确的预测和未发生坍塌的表征,并不能保证潜在世界模型具有与任务一致的规划几何结构。研究人员提出 AnisoWM 和 ΛReg,用具有固定迹和各向异性约束的可学习对角协方差,替代固定的各向同性高斯正则化。预测目标、预测器架构和欧氏规划器均保持不变。在四个视觉控制环境中,AnisoWM 的规划成功率均高于 LeWorldModel,其潜在规划成本也与实际任务结果更加一致。

超越时间线:Grounded Entity Biographies增强长视频记忆能力

研究人员提出了Grounded Entity Biographies(GEB),一种用于回答超长视频问题的框架。GEB将同一物理对象在不同视频片段中的视觉定位观测连接起来,构建可检索的对象“传记”,同时保留每个时刻的上下文。在问答过程中,系统会将该传记与事件证据一同检索,从而跟踪对象在长时间事件序列中的经历。在四个基准测试中,包括持续一天和一周的录制内容,GEB均优于此前的视频记忆框架。在EgoL

DeepSeek 开源面向华为昇腾平台的基础设施组件

DeepSeek 开源了面向华为昇腾 AI 加速平台的基础设施组件,包括 TileLang 编译工具以及计算和通信库,与此前面向英伟达平台发布的组件相对应。套件涵盖矩阵运算、跨设备通信、向量处理和稀疏注意力等工具。DeepSeek 表示,其模型训练中使用的每个 TileLang 算子都有昇腾高性能实现;在多项关键测试中,这些组件的性能已接近硬件上限。

SentZero:面向胸部 X 光零样本分析的句子中心视觉语言预训练

SentZero 是一种用于胸部 X 光零样本分析的视觉语言预训练框架。它利用大型语言模型对放射科报告进行句子级结构化,以增加训练配对的多样性,并减少对比学习中的假阴性。此外,该方法会根据每个句子的语义调整视觉特征。研究人员报告称,SentZero 在多项下游任务和数据集上提升了零样本泛化能力。

MaLiang-Harness:以可编程方式生成图像和视频

可执行程序能够明确控制图像和视频的构建方式,但代码成功运行并不意味着生成结果符合指定的构图、外观或运动要求。研究者将这种差距称为程序到视觉(P2V)差距,并提出 MaLiang-Harness,将 MLLM 驱动的生成组织为构建、检查和修订的持续流程。该框架把程序版本、修改历史与渲染结果关联起来,使变更可追踪、可验证。在 MaLiang-IBench 上评估 11 个闭源 MLLM、在 MaLia

WorldAttention:面向交互式视频世界模型的高效注意力架构

WorldAttention 是一种面向文本条件交互式视频世界模型的注意力架构,旨在降低完整 KV 缓存带来的计算和内存开销,同时保留长程上下文。该系统结合线性全局注意力与自适应稀疏注意力,并通过分层缓存管理历史 KV 数据。论文报告称,在 VBench-Long 和 InterVBench 测试中,其主体一致性得分分别为 0.9472 和 0.9668,优于所比较的方法。

OmniTaskonomy:视觉生成何时能提升视觉理解?

这项研究探讨,在什么条件下,训练模型生成视觉内容也能提升视觉理解能力。受控实验表明,采用合适的方法进行图像到图像生成训练,可以提高图像到文本理解任务的表现;训练数据越多,收益也越大。研究团队提出 OmniTaskonomy,这是一个涵盖 19 种生成任务和 25 种视觉理解能力的分类体系。不同任务的迁移效果各不相同,例如深度预测有助于度量式 3D 推理,而物体指点有助于计数。任务间梯度对齐程度越高

模型改变想法之处:通过回溯分歧定位提升可验证奖励强化学习的效率

该研究提出 Hindsight-Divergence Localization(HDL),通过 token 对数似然的变化,识别可验证奖励强化学习中值得进一步探索的早期决策点。HDL 不再独立生成大量完整轨迹,而是先生成少量根轨迹,再从选定位置生成续写来补足训练组。续写复用根轨迹的前缀,策略更新仅依据新生成的后缀。在数学、编程和智能体任务的三个模型测试中,与组规模和训练步数相同的 GRPO 相比,

SAKI 利用最大耦合分配 On-Policy 蒸馏中的教师监督信号

SAKI 是一种 On-Policy 蒸馏方法,根据最大耦合中的接受和修正事件分配逐 token 的教师监督信号。对于接受的位置,保留对采样 token 的反向 KL 监督;对于修正的位置,则直接监督教师模型概率最高的 token。受 KL 约束的 rollout 同时限制轨迹偏移,以及修正和专门监督的频率。集成在引擎中的推测式验证器,在相同工作负载下将 rollout 吞吐量提升至 4.22 倍

World Action Model 如何实现泛化?关于推理时未来建模的实证研究

World Action Model(WAM)在训练时不仅预测动作,也预测未来状态。本研究比较了两种方法:显式 WAM 在推理时生成未来视频帧;潜在 WAM 为提升速度而省略这一步。潜在模型在同分布任务上表现相近,但在环境变化、数据效率和新任务泛化方面表现较差。分析指出,差距主要源于动作专家不再利用未来表征。研究提出 Simple-WAM,使用完全加噪的视频 token,通过一次前向传播对未来建模

超越已采样轨迹进行学习:面向 RLVR、考虑离策略影响的跨模型轨迹交换

在可验证奖励强化学习(RLVR)中,有限的 rollout 预算可能产生全部失败的回答组,无法提供基于奖励的学习信号。GRAFT 用其他模型提供的有效轨迹替换这类回答组,并考虑离策略影响。该方法连同源模型计算的优势值,传递成功和失败的回答,再通过序列级兼容性加权和 token 级重要性比率裁剪来控制模型间的偏差。在三组异构模型配对和五项数学推理基准测试中,使用相同 rollout 预算时,GRAF

Anthropic 与 SpaceX 签署最高 845 亿美元算力协议

路透社查阅的文件显示,Anthropic 已与 SpaceX 签署协议,将使用 Colossus 一号和二号数据中心中的英伟达 GPU 算力。Anthropic 预计自 2026 年起每月支付 12.5 亿美元;不计入初期爬坡月份,公开信息测算的最低合同金额为 425 亿美元。Anthropic 的 IPO 文件显示,合同上限可能达到 845 亿美元。Anthropic 只需提前 90 天通知即可