从多向量视觉文档索引中还原文档
视觉文档检索系统通常为每页存储约一千个图像块向量,且常使用第三方数据库。研究发现,仅凭这些索引就能部分还原页面:在 ViDoRe v3 基准测试中,攻击恢复了 47% 的单词和 45% 的敏感词元。将还原页面用作查询时,原始页面有 98.4% 的概率排名第一。词元池化和向量打乱可将单词恢复率降至约 8%,但模型仍能较大程度地还原被打乱向量的顺序。研究人员建议,对这类索引的保护应与其编码的文档同等严
AI 新闻中心 过去24小时分析了 191 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
视觉文档检索系统通常为每页存储约一千个图像块向量,且常使用第三方数据库。研究发现,仅凭这些索引就能部分还原页面:在 ViDoRe v3 基准测试中,攻击恢复了 47% 的单词和 45% 的敏感词元。将还原页面用作查询时,原始页面有 98.4% 的概率排名第一。词元池化和向量打乱可将单词恢复率降至约 8%,但模型仍能较大程度地还原被打乱向量的顺序。研究人员建议,对这类索引的保护应与其编码的文档同等严
该研究分析了将全注意力与滑动窗口注意力,或门控线性注意力变体相结合的大语言模型。作者发现,扩展上下文时存在跷跷板效应:线性注意力混合模型从长上下文持续预训练中获益更多,而滑动窗口混合模型在向更长序列进行长度外推时表现更好。研究还总结了滑动窗口混合模型的多项局限,并提出 Sliding-Window Linear Attention。作者称,该方法无需额外训练即可实现16倍长度外推,并在64K上下文
Long-WAM 是一套模型与系统框架,旨在实时机器人控制中利用更长的视觉历史。研究发现,当视频模型采用自回归方式预训练时,延长上下文带来的收益更大。在 RoboCasa GR-1 上,将上下文扩展至 19.2 秒后,成功率从 63.3% 提升至 78.7%;双向预训练未带来类似提升。Long-WAM 在 LIBERO-Long、RoboTwin 2.0 和 DOMINO 的对比方法中也取得最佳结
自回归视频生成需要对当前帧进行去噪,同时将其键值表示写入上下文,以供未来预测使用。由于这两种功能通常共享参数,其梯度可能相互冲突。SGF+为上下文写入和去噪分配独立参数,同时通过因果注意力保留两者的交互。该方法使用原有生成目标联合优化,不引入辅助损失。在评估的逐帧和分块生成设置中,它提升了视觉质量与时间一致性,且不需要额外视频数据或更长的训练时间。研究者报告称,仅用五秒生成序列训练的模型,无需针对
GRACE是一种两阶段方法,可压缩预训练视频自编码器,同时保持其与预训练扩散Transformer(DiT)的兼容性。该方法将原始潜变量保留为冻结的基础表示,并加入残差潜变量来补充更高压缩率造成的信息损失,同时将压缩表示对齐到冻结DiT的特征空间。随后通过轻量微调和非对称去噪调整DiT。在Wan2.1-I2V-14B上,GRACE在480 × 832 × 81设置下将token数量减少至八分之一、
小鹏汽车宣布旗下Robotaxi正式命名为“XPENG YOYO”,并上线供用户参与内测的小程序。用户可通过小程序调节车内温度和香氛、预选音乐。小鹏正在广州开展公开道路测试,并称量产车型已完成超过2000次内部测试订单。公司计划明年实现无安全员载客运营,预计广州业务最快于2027年下半年达到单车盈亏平衡。
曾在 Anthropic 和 OpenAI 任职的雅各布·考克森在纽约市议会听证会上表示,AI 可能很快自主开展研究,进一步削弱人类监督。他称,自己过去的工作某种意义上是在研究如何让 AI 取代自己。考克森提到,AI 研究自动化的目标时间约为 2027 至 2028 年,进度符合预期甚至有所超前。他认为两家公司缺乏充分的安全保障,并呼吁 AI 实验室提高透明度、放慢开发速度。
多名用户发现,Claude网页版和桌面版的语言菜单已出现简体中文与繁体中文,部分账号打开后会直接显示中文界面。此次更新是将产品界面中文化,并非新增中文对话能力;Claude此前已支持中文聊天。Anthropic尚未正式公告,官方语言设置文档也暂未列出中文。界面中文化不代表服务扩展至中国大陆,当前支持地区没有变化。
抖音生活服务发布中秋、国庆假期消费报告。公司称,抖音团购订单量同比增长53%。报告将“豆包订酒店”作为AI在旅游场景中的应用案例,称其下单量环比增长56%。以上数据均来自公司报告。
微软在一场活动中宣布推出新硬件并调整 Windows,旨在让桌面环境融入更多 AI。简短介绍未提供其他技术细节。
这项研究探究推理模型为何在多轮自我训练后性能下降。研究发现两个主要问题:模型生成的无效问题,以及措辞不同但数学上等价的问题会绕过传统多样性筛选。R-Quest利用有效性和新颖性反馈:先训练求解模型识别并拒绝无效问题,再由冻结的基础模型评估问题对的新颖性。在涵盖数学推理、通用推理和代码生成的12项基准测试中,该方法在两个模型系列上均取得最高平均性能。连续十轮自我进化中,性能提升保持稳定;最后一轮R-
论文研究学习器与采样器执行不一致如何导致大语言模型强化学习不稳定。研究发现,不一致的方向与幅度同样重要。TRIAGE 在响应片段级别诊断有问题的更新贡献,选择性地重新平衡策略梯度更新,并对残留的严重不一致进行有界修正。该方法在学习器和采样器两端均保留原生 NVFP4 执行,使用 4 位权重和激活值。在 Qwen3-4B 和 Qwen3-30B-A3B 上的实验显示,在评估的训练周期内优化过程保持稳
AMD 已为 Radeon RX 9000、RX 7900/7800/7700/7600 系列以及 Radeon AI PRO R9700 发布驱动更新。该版本不包含游戏方面的改进,主要新增对同日发布的加速计算软件栈 ROCm 10.1 的支持。更新内容包括提升数据移动与放置效率、引入 ROCm CLI、支持 LLVM 24、更新 AI 和数学库、提供 hipThreads 加速,以及扩展 GPU
据《The Information》援引知情人士报道,英伟达曾讨论再向人形机器人制造商 Figure 投资 10 亿美元。Figure 正以约 380 亿美元的投前估值寻求新一轮融资。报道称,英伟达还可能投资开发 Nemotron 模型及其他 AI 应用的初创公司。CEO 黄仁勋担心 AI 需求降温或替代芯片可能削弱英伟达的市场地位。英伟达希望利用充足资金扶持更多模型和应用,并减少对少数大型客户的
据报道,快手旗下AI视频服务可灵AI正筹备在香港首次公开募股,已选定中金公司、高盛和瑞银担任承销银行,目标募资至少10亿美元,最快可能于2026年上市。目前相关商讨仍在进行,细节可能变动,可灵AI尚未公开回应。若成功上市,融资可能用于支持后续模型研发和算力基础设施建设。相关消息尚未得到确认。