AI 新闻中心

AI 新闻中心 过去30天分析了 4645 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

麦肯锡:到2035年,约1100万美国劳动者或因AI改变岗位而需要转行

麦肯锡最新研究估计,随着AI改变工作岗位,到2035年约有1100万美国劳动者(约占当前劳动力的7%)可能需要转行。未来十年,每年转行人数可能增至目前的三倍。办公室和行政支持、零售和销售,以及运输和物流等领域预计较易受到影响。许多劳动者需要大量再培训,也可能面临收入下降。研究称,低收入劳动者需要转行的可能性接近高收入者的8倍。由于AI采用速度及其他劳动力市场趋势仍存在不确定性,麦肯锡估计受影响人数

英伟达推出 AI 智能体安全工具 OpenShell,称可防止类似 Hugging Face 的事件重演

英伟达发布面向 AI 智能体的软件安全工具 OpenShell。公司称,该工具利用 CPU 的硬件功能限制智能体行为,并检测其试图绕过限制的行为;目前也在推动对 Arm 和英特尔 CPU 的支持。此次发布正值外界接连报告 AI 智能体利用漏洞、访问敏感系统之际。英伟达称,OpenShell 可能防止此前一起与 Hugging Face 有关的事件,但这一说法尚未得到独立验证。专家指出,技术防护措施

字节跳动据报正为豆包准备独立个人助理App

据知情人士透露,字节跳动正加快开发基于AI产品豆包的独立个人助理应用。公司从今年4月起已秘密内测一款名为“Spell”的应用。随着海外市场对同类AI助理的关注升温,字节计划将Spell项目团队与豆包对话团队合并,集中开发面向消费者的独立App。目前,官方尚未公布上线时间,具体功能也仍未披露。

当隐私将机器学习决策转移到设备端:拍卖中的信息与激励错配

该研究分析了将机器学习决策转移到隐私保护设备后,对拍卖预算控制造成的影响。由于设备之间的支出信息存在延迟或不可见,传统 pacing 机制可能导致严重超支。在包含 36 个活动和 50 台设备的模拟中,高预算压力下延迟 50 个 tick 时,超支达到 1,669.31%;即使降低预算压力,超支仍为 106.95%。基于可见预算的防护机制在零延迟时能够实现精确合规,但延迟一个 tick 后仍出现

WideSWE:编程智能体能否协调跨代码仓库的修改?

WideSWE是一项用于评估编程智能体的基准测试,重点关注需要在多个代码仓库中协调修改的软件开发任务。研究团队分析了103个软件生态系统,构建了120项真实任务,其中包括60项漏洞修复和60项功能开发。在7种智能体配置中,完整任务成功率介于10.83%和42.50%之间;结合Codex CLI与GPT-5.6-sol的配置表现最佳。结果显示,智能体经常无法识别所有必要修改、未完成已识别的工作,或虽

TT-VidT 解耦时间轴,提升以运动为中心的视频预训练效率

TT-VidT 是一种自监督视频学习方法,旨在将帧的外观信息与运动信息分离。研究人员在约 1.7 亿至 1.9 亿参数规模的编码器上,对架构和训练目标进行了 24 种受控组合实验。该方法将逐帧处理的 ViT-B/16 空间路径与紧凑的时间迁移层结合起来,并根据首帧外观锚点和各帧特有的运动 token 重建目标帧。在微调测试中,TT-VidT 在 Jester、Something-Something

模型内部信息何时有帮助?探讨表征工程在大语言模型安全中的作用

一项对照评估比较了基于行为的安全防护措施,以及读取或修改模型内部状态的方法。在安全控制方面,DPO 的整体表现最强,但通常会受益于更多训练数据,并且在后续使用良性数据微调后,安全性可能下降。表征引导方法主要在低数据量场景下具有竞争力,尤其是在使用高质量对比数据时。在安全监测方面,专门的文本监测器检测准确率最高;表征探针则以显著更低的边际成本保持竞争力。监测器引导的干预可以恢复良性微调后损失的大部分

面向多轮图像编辑的策略内自蒸馏

研究人员提出MT-OPSD,这是一种提升AI图像编辑模型在迭代编辑中鲁棒性的训练框架。现有模型在每次将新指令应用于上一轮生成的不完美图像时,性能往往会迅速下降。研究认为,原因在于训练阶段使用干净的源图像,而推理阶段必须反复以模型自身的输出作为条件输入,导致条件分布不匹配。MT-OPSD使用模型自行生成的中间状态进行训练,并通过以干净图像为条件的教师模型提供编辑监督,因此无需多轮编辑标注数据。研究团

GeoVerse:在几何潜在空间中合成具有世界一致性的新视角

GeoVerse 是一种从稀疏图像合成新视角的框架。它将预训练 3D 基础模型的几何潜在空间与视频生成模型提供的外观先验相结合,并通过全局空间记忆保持不同视角之间的一致性。据报告,在测试中,与 GLD 相比,GeoVerse 在 DL3DV 上的 PSNR 高出 2.23 dB,在 Mip-NeRF360 上的 ATE 降低了 32.4%。

InfiniHand:从第一人称视频流式估计世界坐标系中的手部运动

InfiniHand是一种前馈式方法,可从未经校准的第一人称视频中连续重建手部三维运动。它联合估计手部几何结构和相机运动,而不是串联独立的手部姿态估计器与SLAM系统。该方法采用持续时空记忆,并使用约5,000小时的第一人称数据进行训练。在基准测试中,与ViDiHand相比,其ARCTIC PA-p误差降低21.4%,同时减轻世界坐标系重建中的漂移。处理速度为每秒11.19帧,超过HaWoR的两倍

通过交错式强化学习,让统一模型学会原生反思

UMM-Reflection训练统一多模态模型检查图像、发现错误,并通过多轮迭代自行修正生成结果。不同于监督微调,或只优化图像生成器及模型单一部分的强化学习,该方法评估完整的反思轨迹,并同时更新反思文本和图像修订。在BAGEL上,相比监督微调,GenEval提升了12.05分。在训练中未使用的WISE(+10.97)、OneIG-Bench(+3.48)和T2I-CompBench++(+4.63

DroneWAM:面向无人机视觉导航的高效世界动作模型

DroneWAM是一种面向无人机视觉导航的高效世界动作模型。它采用基于JEPA的架构,直接在表征空间中预测未来状态,避免生成完整未来图像所需的计算成本。预训练Resampler将编码器的密集特征压缩为更少的潜在标记,自适应 rollout 则根据当前场景调整预测深度。研究人员还构建了模拟数据集DroneNav-6D,包含同步RGB观测、6自由度飞行轨迹、控制指令和随机风力扰动。在比较方法中,Dro

确定性 PRM 引导为何在离散扩散推理中表现较差

一项针对离散扩散语言模型的研究发现,在相同的前向传递计算预算下,确定性过程奖励模型(PRM)引导不如更简单的方法:独立采样候选答案,再用结果奖励模型(ORM)重新排序。在 GSM8K 上,使用 8 个候选答案的 PRM 引导准确率为 65.18%,而 ORM 重新排序达到 75.13%;候选数增至 32 个时,差距扩大到 12.69 个百分点。研究人员指出两个问题:PRM 在去噪过程中的信号会减弱

Draft-KV:学习语言模型之间有用的潜在通信

潜在通信在语言模型之间传递内部状态,而非解码后的文本。但接收模型准确率提高,并不能单独证明它利用了消息内容。在五组方法与数据集的实验中,将消息替换为来自无关问题的消息,准确率变化最多为0.60个百分点。Draft-KV改为传递发送模型针对当前问题起草答案时形成的键值状态。两个模型均保持冻结,只训练包含105万个参数的接口。以Qwen3-8B为发送模型时,冻结的Qwen2.5-0.5B-Instru

RenderRank:使用压缩视觉 Token 对文本重新排序

RenderRank 是一种重排序模型,将文档作为图像处理,使用压缩视觉表示取代传统的文本 Token 序列。模型先让相关性评分与基于文本的教师模型对齐,再优化同一查询下正例和负例文档之间的相对评分。在 11 个 BEIR 数据集上,RenderRank 减少了 16.5% 至 35.5% 的输入 Token,平均 NDCG@10 为 55.96。在长文档数据集上,其平均 NDCG@10 达到 8