在潜空间中推理:让潜在视觉推理成为必要计算
该研究提出因果视觉循环推理(CVRR),旨在确保多模态模型生成答案时真正使用潜在视觉计算。CVRR在预训练视觉语言模型处理图像后,从问题表示初始化循环状态,并通过反复读取相同的视觉证据来更新该状态。在解码前,系统会移除视觉状态和原始多模态KV缓存,因此只有最终循环状态能够将图像条件信息传递给答案。在多个基准测试中,CVRR在这一严格接口下仍保持了较强的视觉能力,而兼容的潜在推理方法未能恢复相当的性
AI 新闻中心 过去24小时分析了 196 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
该研究提出因果视觉循环推理(CVRR),旨在确保多模态模型生成答案时真正使用潜在视觉计算。CVRR在预训练视觉语言模型处理图像后,从问题表示初始化循环状态,并通过反复读取相同的视觉证据来更新该状态。在解码前,系统会移除视觉状态和原始多模态KV缓存,因此只有最终循环状态能够将图像条件信息传递给答案。在多个基准测试中,CVRR在这一严格接口下仍保持了较强的视觉能力,而兼容的潜在推理方法未能恢复相当的性
TANGO 是一个面向人形机器人的视觉语言导航框架,用于处理障碍物密集的室内环境。不同于将导航简化为二维路径规划,TANGO 会持续调整机器人的全身,包括手臂位置、躯干姿态和步态,以无碰撞方式穿越复杂的三维空间。系统接收自然语言指令和机器人第一视角的 RGB 观测,直接预测包含 29 个自由度的关节空间动作。TANGO 完全在仿真环境中训练,通过全局路径规划、全身运动生成、面向障碍物的动作编辑以及
研究人员提出“程序图”,用于组织大语言模型智能体所需的程序性知识。与仅从不断累积的交互历史中不受约束地生成动作不同,该方法将步骤、关系和条件表示为图结构。在每个决策步骤,指导模型会把相关子图转换为情境化指引,影响智能体的下一步行动,但不会直接规定行动。基于大语言模型的改进循环会比较成功和失败的执行轨迹,并仅采纳能够保持或提升留出验证集性能的图结构修改。研究人员称,在多个数据集、任务类型和语言模型上
该研究提出 Mask Forcing,用于改进面向实时视频生成的自回归视频扩散模型蒸馏。现有的 Distribution Matching Distillation 方法受到反向 KL 目标函数的模式选择倾向影响,可能导致学生模型分布坍缩,并生成过度饱和或过度平滑的视频。Mask Forcing 在自回归自滚动过程中,沿空间和时间维度使用随机掩码,将更干净的信号注入噪声输入。这样可以促使学生模型探
该报告介绍了 Gander,这是一个将视频、语音和文本流式输入统一起来的端到端模型,旨在实现连续的多模态交互。其 Cerebellum-Brain 架构由 Cerebellum 负责实时对话与响应,Brain 负责复杂推理、工具调用和智能体任务。Streaming Thinker-Talker 设计支持低延迟、全双工交互,包括用户随时打断、模型主动提供中间反馈以及提出后续问题。内部人工评估显示,G
中国网络作家唐家三少警告,AI 洗稿和批量生成的低质量内容正在网络文学行业扩散。据称,热门作品的结构可以被拆解,再由 AI 重新填充,48 小时内生成 500 万字。他将这类内容称为“AI 泔水”,并呼吁行业加强自律、完善法规标准、保护青少年,同时明确标注 AI 生成的文字内容。报道引用的相关数据和预测尚未经过独立验证。
智己汽车正式确认了此前曝光的无方向盘车辆。该工程测试车型采用与新一代LS6同源的技术,并使用线控转向,取消方向盘与车轮之间的机械连接,改由电信号控制车轮。全线控四轮转向系统据称可在约20毫秒内执行指令。为提升安全性,系统配备双电源、双通信和双硬件备份;即使前轮转向链路发生双重故障,后轮转向仍可作为额外冗余介入,协助车辆保持稳定并安全停车。智己表示,该系统达到车规功能安全最高等级ASIL D,失效概
Anthropic 对齐科学负责人埃文·休宾格表示,他个人认为未来十年内 AI 可能杀死全人类的概率超过 10%。他还担心 AI 进行递归式自我改进。休宾格称,Anthropic 正在认真应对这一问题,但目前还没有解决超级智能对齐问题的可靠方案,也无法明确证明公司正朝着解决目标稳步前进。
CosmoH2G提出了一个数据集和基线方法,用于将人类手部演示迁移到机器人夹爪。该数据集包含1,254种物体的6,189个操作片段,重点覆盖旋转、翻转和复杂轨迹等高空间复杂度动作。所提出的两阶段框架首先预测夹爪的初始和终止稀疏关键帧,然后以此为条件生成完整的连续动作序列。为减轻误差累积,系统学习夹爪的方向,并依据抓取启发式方法和运动学一致性对平移进行后处理优化。作者报告称,在仿真和真实机器人实验中
研究人员提出了在策略反向蒸馏(OPRD),旨在让更强的学生模型从较弱的教师模型中学习,同时超越教师的性能。OPRD在学生模型生成的轨迹上,评估教师策略相对于参考策略的变化,并仅放大得到验证器支持、且与该变化方向一致的策略梯度更新。这样既能利用教师指导加快训练,又不会将教师的能力上限强加给学生。在连续模型迁移和多教师蒸馏实验中,OPRD以更少的学生更新次数取得了优于现有强化学习和蒸馏方法的性能。研究
据博主 @超维界 透露,华为 Pura X View 和 Mate XT 2 手机支持将多模态 AI 模型下载并部署在设备端。用户据称可在约 6GB 的多模态增强模型和约 15GB 的多模态混合专家模型之间选择。两款模型均可在无网络状态下运行,功能包括本地图像生成、语音合成、相机 AI 超清增强、图库修图和人声播报。混合专家模型还可用于复杂任务理解、应用操控以及离线整理照片。相关信息来自博主爆料,
多名图书作者向纽约联邦法院提交简易判决动议,要求认定 OpenAI 未经许可复制 194 部图书并用于 AI 模型训练,且相关行为不构成合理使用。本案源于美国作家协会 2023 年对 OpenAI 和微软提起的集体诉讼。原告称,OpenAI 曾从 LibGen 获取图书,并在 GPT-3 论文中将相关数据集改称为“Books1”和“Books2”,以淡化其与 LibGen 的关联。乔治·R·R·马
OpenAI 官方状态页面显示,北京时间 9 月 8 日 22:32 至 9 月 9 日 05:59,ChatGPT 和 Images API 的图像生成功能出现故障。用户提交图像生成请求时遇到错误的频率上升,文件上传处理也受到影响:部分文件虽显示上传完成,却一直停留在处理中,另一些上传请求则直接失败。OpenAI 尚未公布具体技术原因、受影响用户数量或预计恢复时间。目前该故障已修复。
GE-Act 2.0是一种用于机器人操作的世界行动模型,通过预测未来状态来指导机器人行动。与许多依赖预训练视频生成模型的系统不同,其生成和行动组件均使用操作数据从零开始初始化和训练。该模型结合了控制导向自动编码器、单步视觉规划器和逆动力学模型。将联合训练数据从300小时扩展到3万小时后,两种机器人平台的成功率分别从17.1%提升至44.1%,以及从13.4%提升至31.1%。性能提升覆盖了大多数技
一项研究考察大语言模型中的激活引导向量,究竟是否反映了人类价值观的连贯语义结构,还是仅仅利用了与特定行为相关的捷径。研究人员依据施瓦茨基本人类价值理论,构建了涵盖20种价值观、2.6万个样本的基准测试。基于分布的方法部分恢复了理论预测的价值关系;以行为为中心的方法虽然取得相近的引导效果,但与预期价值结构的相关性较低。几何一致性随模型规模扩大而提升,却在指令微调后下降。代码和数据已公开。