AI 新闻中心

AI 新闻中心 过去30天分析了 4739 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

TERRA:面向肌骨运动的地形感知重建、动作重定向与控制

TERRA 是一套流程,可从缺少场景几何信息的动作数据中,为肌肉驱动的智能体重建、重定向并控制具有地形感知能力的动作。该方法结合地形先验、估计的接触点以及自由空间线索,推断任务所需的支撑面。重定向过程还会考虑解剖结构、肌腱连续性和接触约束。研究人员利用来自五个数据集的动作—地形配对数据,以 9.4 小时的多样化运动数据训练了一个控制策略。在各项评测中,TERRA 提高了地形准确度,减少了解剖和交互

Bloomberg Tech Screentime 特别节目

彭博社记者埃德·路德洛在洛杉矶现场报道 Bloomberg Screentime 2026,并与科技和媒体行业的领军人物对谈。Suno 首席执行官迈基·舒尔曼探讨 AI 如何拓展音乐产业,而不只是颠覆它。Promise 首席执行官乔治·斯特龙波洛斯和 Luma AI 首席运营官卡罗琳·英格博恩讨论 AI 在电影制作中的作用日益增强。Vermillio 首席执行官丹·尼利则深入探讨 AI 与创作者权

Promise首席执行官:人工智能让小团队也能制作大型电影

Promise首席执行官兼联合创始人乔治·斯特龙波洛斯正在打造一家以人工智能为核心的娱乐工作室,将生成式人工智能用于开发、制作和视觉特效。他表示,这项技术可使部分动画项目的成本降低50%以上,并帮助规模较小的团队制作更大规模的作品。斯特龙波洛斯在《Bloomberg Tech》节目中与埃德·勒德洛谈及这一计划。

Luma AI 押注好莱坞的“混合式”未来

Luma AI 首席运营官 Caroline Ingeborn 表示,生成式 AI 有望通过降低成本、为创作者实现雄心勃勃的项目提供新方式,推动更多影视制作回到洛杉矶。她认为 AI 是创意专业人士的工具,而非替代者。她所说的“混合式电影制作”,是将真实演员和剧组与 AI 生成的环境结合起来。

重新思考潜在视觉推理:让潜在推理建立在视觉证据之上

潜在视觉推理使多模态大型语言模型能够通过连续的潜在 token 执行中间计算,而不必将每一步推理都表达为文字。由于这些步骤无法直接观察,监督其学习较为困难。研究发现潜在 token 与视觉证据之间存在差距:即使图像变化会影响正确答案,token 的反应仍然较弱。研究人员认为,GRPO 训练缺乏明确监督可能是原因之一,并提出 ReaLVR,通过对比正确与错误答案、相关与不匹配的视觉证据来引导潜在处理

系统评估 GPT-6 Astra 作为具身控制策略的能力

一项研究在六个机器人控制领域评估了 GPT-6 Astra。Astra 能生成数值形式的动作,但结果显示,有用的任务决策与可靠的物理控制之间仍存在差距。与已训练的控制器结合时,它在受测的 RoboDojo 子集上成功率为 48%,在 DexJoCo 的十次试验中为 50%,在 RoboCasa365 上为 38.7%。导航方面,它在 RxR 指令跟随和 HM3D 物体搜索中的成功率分别达到 92%

关键不在图片展示了什么:无关语境会扰乱 VLM 评判,却没有提供信息

研究人员推出 MIST 压力测试,包含 200 个英文句子,其中的短语既可作比喻理解,也可按字面理解,评判应仅依据句子。在 13 个视觉语言模型(VLM)评判器中,尽管指示要求忽略图片,符合语境的图片和误导性图片都改变了约 20% 的标签。两种图片条件下不同的标签中,只有 37% 朝图片所呈现的含义移动。无论没有图片、图片与句意一致还是具有误导性,模型与人工标注者的一致度均未改变。结果表明,图片的

DC-SAE:深度压缩语义自编码器加速扩散模型收敛

DC-SAE是一种旨在兼顾高空间压缩率、图像重建质量和扩散模型训练速度的自编码器。该方法使用语义编码器生成紧凑的潜在表示,并通过像素级编码器保留图像细节。在ImageNet的512 × 512图像上,DC-SAE实现了32倍空间压缩,PSNR达到29.79,gFID达到3.37。研究团队表示,与高压缩率基线方法DC-AE相比,DC-SAE的PSNR提升13.5%,gFID改善54.9%,同时保持相

DyRAD:面向动态驾驶场景的雷达新视角合成

DyRAD是一种利用录制雷达数据重建动态驾驶场景的方法。它分别建模静态背景反射体和经过运动跟踪的动态点反射体,从而生成完整的距离、方位角和多普勒(RAD)张量。该方法将物体速度投影到雷达视线方向,使多普勒信息既作为渲染输出,也用于监督目标轨迹。由雷达信号处理链推导出的解析点扩散函数,可避免把传感器造成的反射扩散错误地融入场景几何。DyRAD在RADIal、Boreas和合成数据集上进行了评估;在R

跳出框架思考:语言模型能否选择性地依赖外部指导?

一项新研究探讨语言模型能否采纳有用指导,同时拒绝不可靠的指令。研究人员推出 Box²-Bench,在保持模型和任务不变的情况下,仅改变工作流程的可靠性。前沿模型通常能从可靠指导中受益,但面对误导性或逐渐失效的流程仍然脆弱。研究团队使用两个开放权重模型进行训练,发现反事实监督微调可以提升稳健性,而基于结果的强化学习则能增加对有用工作流程的使用。这种能力还延伸到同伴纠错和应对损坏的记忆,表明选择性依赖