AI 新闻中心

AI 新闻中心 过去一年分析了 1378 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

LAION-BVD:用于多模态预训练的1,000万小时开放视频数据集

LAION-BVD是一个面向多模态学习的大规模开放视频数据集。它包含从Common Crawl收集的13亿个视频网址,并从中下载了8,000万个视频,总时长达1,000万小时。该数据集支持视频、音频和图像模态的预训练。研究人员通过内容感知的场景检测提取视频片段,并生成合成的视频和音频字幕。使用这些数据训练的模型在标准视频-文本和音频-文本基准测试中取得了有竞争力的表现,且随着数据和模型规模扩大而持

WeMM-Embedding:微信多模态嵌入模型技术报告

腾讯发布 WeMM-Embedding 多模态嵌入模型系列,支持文本、图像、视频、视觉文档以及任意交错的多模态输入。该系列包含 2B、4B 和 9B 参数版本,并公开模型权重和代码。根据技术报告,2B 版本在 MMEB-v2 上超过了此前领先的 8B 开源基线模型;9B 版本则以 80.6 的综合得分取得新的最高成绩。腾讯还表示,该模型在 26 项内部任务和 14 项线上 A/B 测试中均带来改进

斯坦福研究:22至25岁职场新人受AI冲击最大

斯坦福数字经济实验室更新的一项研究,分析了薪资服务商ADP覆盖数百万美国劳动者的高频薪资数据。研究尚未发现生成式AI在全美范围大规模替代岗位的证据,但显示刚进入职场的年轻人受到的影响最直接。在软件开发、客服等AI影响较大的职业中,22至25岁人群的就业率比受影响较小的领域低约19%;2025年的差距为13%。同一职业中的资深从业者没有出现类似的就业下降。研究人员认为,依赖标准化、文档化知识的入门岗

小米 YU7 GT 创纪录后,梅赛德斯-AMG 也在纽博格林测试自动驾驶

小米此前驾驶搭载自动驾驶技术的 YU7 GT,以 10 分 29.483 秒完成纽博格林赛道一圈,创下该赛道首个自动驾驶圈速纪录。如今,梅赛德斯-AMG 似乎也开始进行类似测试。被拍到的 GT 63 原型车车顶安装了三个传感器,先以极低速沿赛道两侧行驶,收集地图和圈速数据。首次完全脱手驾驶时,车辆采取非常保守的策略,严格限制加速并提前制动,用时不到 20 分钟。第二圈比第一圈快了几分钟,但据报道仍

面向掩码扩散机器翻译的长度自适应解码

一项研究探讨掩码扩散语言模型在机器翻译中如何确定目标序列长度。研究提出无需训练的 Entropy-Valley(EV)方法,通过全掩码前向推理得到的平均预测熵,对候选输出长度进行评估。与依据训练语料长度统计的基线相比,EV 恢复了使用参考目标长度时 COMET-22 改进幅度的相当一部分。在英中、中英和英德翻译实验中,适合去噪的长度不一定与参考长度一致。与使用相同微调数据训练的自回归 LLaMA-

Best Practice Critic Optimization 改进语言模型强化学习训练

Best Practice Critic Optimization(BPCO)是一种面向大型语言模型的训练方法,用精心设计的评论器取代了针对每个提示采样多个回答的做法。该方法结合了 DPPO、限制在奖励范围内的价值预测、蒙特卡洛价值目标、未归一化的策略优势,以及根据回答长度调整的广义优势估计。在数学推理任务的受控实验中,BPCO 在参数规模从 15 亿到约 300 亿的模型上持续改进了强大的评论器

工信部:中国已成功研制近200项人工智能关键标准

工业和信息化部表示,中国已成功研制近200项人工智能关键标准。在“十五五”时期,中国将加快新一代通信网和算力网规划建设,推动5G、工业互联网在重点行业规模化应用,并加强6G技术研发。政府还将增强网络和数据安全保障能力,建设新兴产业发展示范基地,重点支持人工智能、机器人、智能网联新能源汽车等领域。

AutoSaddler:基于智能体执行轨迹的自动化 Harness 优化

AutoSaddler 是一个用于自动改进大语言模型智能体 Harness 的框架。它将 Harness 优化定义为离线学习问题,利用小批次中的失败信号来调整提示词、工具配置和控制逻辑。系统会诊断失败轨迹,将 Harness 视为代码生成结构化补丁,并通过验证选择更新方案。在 GAIA2、SWE-Bench Pro 和 Terminal-Bench 2.0 上,相较于对应的基础 Harness,性

CAFE:自我改进的搜索智能体需要共同演化的反馈

CAFE(Coupled Agent–Feedback Evolution)通过交替训练搜索智能体和批评器,使二者共同改进。该框架学习智能体应在何时请求反馈,以及如何利用反馈在错误累积前修正正在进行的搜索轨迹。它结合在线强化学习与离线偏好优化,从成功和失败的轨迹中学习反馈策略。在七项智能体搜索基准测试中,CAFE平均优于所评估的基于强化学习的搜索智能体,在六项域外基准测试中保持性能提升,并减少了答

Meta^n:通过涌现深度实现递归式自我改进

Meta^n是一种递归改进大语言模型代理的方法。它不修改执行自我改进的操作,而是将一个固定操作反复应用于自身生成的结果。系统读取下层求解器堆栈的执行轨迹及生成这些轨迹的代码,然后将下一层构建为策略性预处理流程和可调用辅助函数库。固定操作旨在避免系统失稳,而不断增长的输入则让每一层能够从更高层次进行推理。递归深度由收敛情况决定,进化式存档则搜索不同的层级链。作者称,在两个基础模型和八类基准测试中,M

基于可验证奖励的在线策略蒸馏

该研究提出OPDVR,将在线策略蒸馏与基于可验证奖励的强化学习结合起来。该方法利用教师模型提供的密集令牌级指导信号,并通过ReLU门控机制,使蒸馏信号与完整轨迹的正确性保持一致。正确轨迹获得非负奖励,错误轨迹获得非正奖励,同时无需增加额外超参数。在六项推理基准测试中,OPDVR均优于标准在线策略蒸馏。相关代码已在GitHub上公开。

扩散模型的策略内自蒸馏

DiffusionOPSD是一种策略内自蒸馏方法,用于根据人类偏好和特定任务奖励调整扩散模型。该方法将图像级奖励梯度转换为去噪过程中间预测的明确训练目标。在SD 3.5-M和Z-Image-Turbo上的实验中,它在20个奖励匹配设置中的19个取得了最佳最终留出分数。与最强竞争方法相比,性能最高提升44%;相较DiffusionNFT,GPU使用时间在SD 3.5-M上减少40%,在Z-Image

Recuris推动长期任务AI代理的记忆递归演化

Recuris是一种面向长期任务AI代理的经验记忆与工作记忆架构。工作记忆负责跟踪任务进度,并从经验记忆和技能记忆中选择相关技能,而不是依赖完整的交互历史。系统利用执行数据定位失败原因,并进行经过验证的记忆更新。在四项基准测试和十个模型上,作者报告称,已完成的37个模型—基准组合中有35个实现了任务成功率提升。在tau-bench上,GPT-5.6 Sol提升17.8个百分点,Claude Opu

卫星自主运行时代开启:中国航天垂直大模型“华山”完成在轨验证

中科天塔研发的航天垂直大模型“华山”健康管理模块,已在“辰光一号”技术试验卫星上完成全流程在轨实战验证。系统采用多类时序神经网络和包络算法,完成了训练、评估与预测任务,具备遥测数据解析、异常检测、趋势预测和自主决策能力。不同于传统的“地面训练、星上推理”模式,“华山”实现了数据采集、星上训练、风险预警和健康评估的闭环。该方案有望减少原始遥测数据下传量,缓解天地通信带宽压力,并降低未来低轨大型卫星星

掩码不是模型本身:审计注意力、状态空间与混合序列模型中的前缀不变性

一项研究对前缀不变性进行了形式化定义:位置 t 的表示不应依赖未来输入。研究提出的轻量审计只需两次前向传播,无需训练或梯度,即可精确定位因果性失效的位置。仅检查注意力掩码并不充分,因为扫描操作或归一化也可能导致信息泄漏。在针对8个检查点进行的192次故障注入测试中,掩码检查一个问题也没有发现,而该审计定位了全部192个故障。研究还发现了Zamba2和Nemotron-H中的缺陷。