AI 新闻中心

AI 新闻中心 过去7天分析了 1091 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

QwenGyre:用于训练超长时域智能体的弹性强化学习框架

QwenGyre是一套面向在线强化学习的框架,适用于执行时间长达数小时、包含数百次模型与环境交互,并在每次rollout中生成数十万令牌的智能体任务。该框架可在rollout与训练之间动态调配GPU,重建分支轨迹,评估阶段性进展,并去除冗余路径。根据文中评测,QwenGyre将NL2RepoBench成绩从52.5%提升至58.5%,相较Colocate最高加速1.85倍,相较Async最高加速1

结构化残差连接提升扩散 Transformer 性能

该研究分析了扩散 Transformer(DiT)中的残差连接。现有 DiT 通常将前面各层的信息整合到统一的残差流中。研究人员提出一种自适应连接架构,将局部残差连接与通往重要早期表示的长距离路径结合起来,使每个 Transformer 模块能够在图像去噪过程中选择性地提取空间和语义特征。实验显示,该方法最多可减少至原先 1.73 分之一的训练迭代次数,并将强大的 REPA-XL/2 模型在无引导

距离移除视觉编码器还有多远?无编码器多模态预训练的缩放定律

一项研究比较了使用预训练视觉编码器的多模态大语言模型,与直接从原始像素学习视觉表征的无编码器模型的缩放特性。无编码器模型在较小规模下表现较差,但研究预测其可能在约 10^22 FLOPs 时追上传统架构。在多模态目标上,最优计算分配会转向更大的模型,而文本目标的缩放趋势基本不变。随着训练计算量增加,语言模型逐渐承担视觉编码器的功能:视觉 token 之间的双向交互变得更有益,视觉处理转向更早的层,

ColNanoVDR 实现多向量视觉文档检索中的无文档查询蒸馏

ColNanoVDR 是一个将视觉语言模型大型查询编码器蒸馏为小型模型的框架,面向视觉文档检索。不同于需要编码并缓存所有训练页面的传统方法,它仅使用教师模型的查询嵌入训练学生模型。其 OTW 目标通过带熵正则的最优传输和可学习的令牌权重,对齐教师与学生的查询令牌,且不要求两者采用对应的分词方式。基于五个先进教师模型蒸馏出的 1.49 亿参数纯文本学生模型,在 ViDoRe v1 至 v3 上保留了

Imprint Reader:从权重更新读取到行为干预

该研究提出 Imprint Reader,利用 Semantic Mount-and-Read Tuning,以自然语言描述语言模型冻结的权重更新。研究通过无变化和随机扰动对照,减少缺乏依据的解读。在未见过的更新上,系统由评审判定的 Pass@100 在知识任务上为 2%,在行为任务上为 16%,表明用语言读取权重更新具有可行性,但可靠性仍然有限。Reader 还可作为可微分代理指标,用于引导模型

我国生成式人工智能用户规模突破7亿,普及率超过50%

中国互联网络信息中心发布的报告称,2026年上半年我国生成式人工智能用户规模超过7亿,普及率突破50%。智能问答仍是最主要的使用方式,图片和视频处理、文本处理等场景也快速增长。报告还称,我国智能算力规模达到2185EFLOPS,首个全国产10万卡人工智能超集群已投入运行。中国开源大模型、工业和农业应用、具身智能及人形机器人产业均取得进展。2026年上半年,我国人工智能相关投融资事件达1255起,披

麦肯锡:到2035年,约1100万美国劳动者或因AI改变岗位而需要转行

麦肯锡最新研究估计,随着AI改变工作岗位,到2035年约有1100万美国劳动者(约占当前劳动力的7%)可能需要转行。未来十年,每年转行人数可能增至目前的三倍。办公室和行政支持、零售和销售,以及运输和物流等领域预计较易受到影响。许多劳动者需要大量再培训,也可能面临收入下降。研究称,低收入劳动者需要转行的可能性接近高收入者的8倍。由于AI采用速度及其他劳动力市场趋势仍存在不确定性,麦肯锡估计受影响人数

英伟达推出 AI 智能体安全工具 OpenShell,称可防止类似 Hugging Face 的事件重演

英伟达发布面向 AI 智能体的软件安全工具 OpenShell。公司称,该工具利用 CPU 的硬件功能限制智能体行为,并检测其试图绕过限制的行为;目前也在推动对 Arm 和英特尔 CPU 的支持。此次发布正值外界接连报告 AI 智能体利用漏洞、访问敏感系统之际。英伟达称,OpenShell 可能防止此前一起与 Hugging Face 有关的事件,但这一说法尚未得到独立验证。专家指出,技术防护措施

字节跳动据报正为豆包准备独立个人助理App

据知情人士透露,字节跳动正加快开发基于AI产品豆包的独立个人助理应用。公司从今年4月起已秘密内测一款名为“Spell”的应用。随着海外市场对同类AI助理的关注升温,字节计划将Spell项目团队与豆包对话团队合并,集中开发面向消费者的独立App。目前,官方尚未公布上线时间,具体功能也仍未披露。

当隐私将机器学习决策转移到设备端:拍卖中的信息与激励错配

该研究分析了将机器学习决策转移到隐私保护设备后,对拍卖预算控制造成的影响。由于设备之间的支出信息存在延迟或不可见,传统 pacing 机制可能导致严重超支。在包含 36 个活动和 50 台设备的模拟中,高预算压力下延迟 50 个 tick 时,超支达到 1,669.31%;即使降低预算压力,超支仍为 106.95%。基于可见预算的防护机制在零延迟时能够实现精确合规,但延迟一个 tick 后仍出现

WideSWE:编程智能体能否协调跨代码仓库的修改?

WideSWE是一项用于评估编程智能体的基准测试,重点关注需要在多个代码仓库中协调修改的软件开发任务。研究团队分析了103个软件生态系统,构建了120项真实任务,其中包括60项漏洞修复和60项功能开发。在7种智能体配置中,完整任务成功率介于10.83%和42.50%之间;结合Codex CLI与GPT-5.6-sol的配置表现最佳。结果显示,智能体经常无法识别所有必要修改、未完成已识别的工作,或虽

TT-VidT 解耦时间轴,提升以运动为中心的视频预训练效率

TT-VidT 是一种自监督视频学习方法,旨在将帧的外观信息与运动信息分离。研究人员在约 1.7 亿至 1.9 亿参数规模的编码器上,对架构和训练目标进行了 24 种受控组合实验。该方法将逐帧处理的 ViT-B/16 空间路径与紧凑的时间迁移层结合起来,并根据首帧外观锚点和各帧特有的运动 token 重建目标帧。在微调测试中,TT-VidT 在 Jester、Something-Something

模型内部信息何时有帮助?探讨表征工程在大语言模型安全中的作用

一项对照评估比较了基于行为的安全防护措施,以及读取或修改模型内部状态的方法。在安全控制方面,DPO 的整体表现最强,但通常会受益于更多训练数据,并且在后续使用良性数据微调后,安全性可能下降。表征引导方法主要在低数据量场景下具有竞争力,尤其是在使用高质量对比数据时。在安全监测方面,专门的文本监测器检测准确率最高;表征探针则以显著更低的边际成本保持竞争力。监测器引导的干预可以恢复良性微调后损失的大部分

面向多轮图像编辑的策略内自蒸馏

研究人员提出MT-OPSD,这是一种提升AI图像编辑模型在迭代编辑中鲁棒性的训练框架。现有模型在每次将新指令应用于上一轮生成的不完美图像时,性能往往会迅速下降。研究认为,原因在于训练阶段使用干净的源图像,而推理阶段必须反复以模型自身的输出作为条件输入,导致条件分布不匹配。MT-OPSD使用模型自行生成的中间状态进行训练,并通过以干净图像为条件的教师模型提供编辑监督,因此无需多轮编辑标注数据。研究团

GeoVerse:在几何潜在空间中合成具有世界一致性的新视角

GeoVerse 是一种从稀疏图像合成新视角的框架。它将预训练 3D 基础模型的几何潜在空间与视频生成模型提供的外观先验相结合,并通过全局空间记忆保持不同视角之间的一致性。据报告,在测试中,与 GLD 相比,GeoVerse 在 DL3DV 上的 PSNR 高出 2.23 dB,在 Mip-NeRF360 上的 ATE 降低了 32.4%。