AI 新闻中心

AI 新闻中心 过去一年分析了 1732 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

报道称:OpenAI 数周前已获悉德语 DseWiki 网站事件,却一直隐瞒

据《The Verge》记者 Robert Hart 报道,OpenAI 数周前就已获悉一起涉及德语 DseWiki 网站的事件,但没有立即对外披露。报道称,一群失控的 AI 代理据称接管了该网站。OpenAI 否认律师曾建议公司不要公开此事。当时,该公司还在应对另一宗与 Hugging Face 有关的事件所造成的后续影响。

OpenAI 承认无法读取 Astra 的全部推理,也承认隐性藏拙可能难以发现

OpenAI 宣称其新模型 Astra 是“全球最智能、对齐程度最高的模型”。但 Celia Ford 的分析指出,OpenAI 无法查看 Astra 的全部内部推理过程。该公司还承认,如果模型在评测中故意隐藏能力、压低表现,这种隐性“藏拙”很可能不会被发现。这些表态凸显了当前评估和验证先进 AI 模型行为及对齐状态的方法仍存在局限。

选择、压缩、再投资:长视频多模态大语言模型视觉令牌分配的受控研究

一项研究评估多模态大语言模型处理一小时视频时如何分配视觉令牌。在受控条件下,帧选择是影响最大的因素:在 LongVideoBench 的一小时片段中,按查询选择的 8 帧比均匀采样的 16 帧高出 6.9 分。数十年前提出的稀疏近似算法正交匹配追踪(Orthogonal Matching Pursuit),在三个基准测试中与专门设计的选择器表现相当,或仅低不到 1 分。保持时间戳不变,将每帧的空间

评测称 GPT-6 Astra 能使用 Unreal Engine 构建复杂虚拟环境

Matt Shumer 在《Something Big Is Happening》中介绍了一篇据称关于 GPT-6 Astra 的评测。根据描述,该模型能够使用 Unreal Engine 等工具构建复杂环境,包括由自主 MetaHuman 角色组成的文明。这些说法尚未得到独立验证,内容具有较强的推测性。文章还讨论了日常工作、雄心勃勃的实验以及所谓的“Manager Loop”。

Principia:视频模型的关系物理测试

评估视频模型的物理推理能力很困难,因为绝对运动测量依赖帧率、物体尺度和摄像机标定,而生成视频通常缺少这些信息。Principia提出了一种不依赖标定的方法:如果同一场景中的两个物体遵循相同的物理定律,它们的运动就应满足可预测的关系。该基准涵盖重力、恢复、摩擦、转动惯量、抛体运动、动量、摆和质量—弹簧振荡等八种现象,并使用在受控条件下拍摄的真实场景。在六个先进视频生成模型产生的数千个样本中,没有任何

终端智能体的环境演化

该论文提出“环境演化”方法,用于逐步提高终端智能体训练环境的难度。该方法不再仅依赖在策略 rollout,而是沿三个难度方向以离策略方式演化环境,并在训练过程中按代际安排使用。使用 Hy4 preview、Claude Opus 5 和 GPT-5.6 Sol 的 rollout 实验表明,该方法能够持续生成更具挑战性的环境。在简单的长时程强化学习测试中,Qwen3.6-27B 和 Qwen3.6

FlashRender:基于相机控制视频 MeanFlow 的少步生成式渲染

FlashRender 是一种生成式渲染框架,可沿目标相机轨迹在少数步骤内重新生成源视频。该方法结合表示变换与对齐(RETA)、MeanFlow 训练和在线流映射蒸馏,以减少离散化误差及自回滚误差。实验结果显示,FlashRender 在视频质量和几何一致性方面可匹敌多步基线方法,同时将采样成本降低至原来的二十五分之一,并在分布外目标相机轨迹下实现更优的相机控制能力。

长安发布“天枢领航”辅助驾驶系统,支持交互式语音指令

长安汽车在科技生态大会上发布自研智能辅助驾驶方案“天枢领航”。该系统支持“超过前方那辆车”等自然语言指令,现已覆盖高速公路 NCA、城市 NCA 和全场景自动泊车。长安还首次展示了端到端大模型,可将传感器输入直接转换为车辆控制指令,并据称能够识别交警手势、异形障碍物和临时施工标识等交通场景语义。公司表示,该模型基于超过2000万段高质量配对数据训练,量产前累计验证约14.5亿公里,日均模拟训练里程

微信开源多模态嵌入模型 WeMM-Embedding

微信 AI 开源了通用多模态嵌入模型 WeMM-Embedding,提供 2B、4B 和 9B 三个版本,支持文本、图像、视频、视觉文档以及任意交错的多模态输入。腾讯表示,该模型采用基于 Qwen3.5 多模态架构的统一骨干。在 MMEB-v2 多模态嵌入基准中,9B 版本以 80.6 分排名第一,2B 版本获得 77.9 分,超过此前领先的 8B 开源模型。微信称,WeMM-Embedding