AI 新闻中心

AI 新闻中心 过去一年分析了 8900 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

KVCMAS:面向多智能体系统共享上下文的高效 KV 缓存校正

KVCMAS 是一种用于多智能体系统高效共享 KV 缓存的框架。它使用紧凑的低秩状态表示不同智能体之间的缓存偏差,并沿智能体工作流串联校正,无需额外进行参考缓存预填充。该方法支持动态变化的共享上下文,同时保持第一个智能体缓存的精确性。在语言和视觉语言工作负载测试中,KVCMAS 的准确率达到或超过现有 KV 缓存共享方法。在高并发服务场景下,与不共享 KV 缓存的推理相比,其首 token 延迟提

SolveEdit:评测生成模型视觉问题解决能力的基准

SolveEdit 是一项评测模型通过场景变换解决视觉问题能力的基准。模型需要根据图像和目标推断并执行必要的修改,同时保留无关内容。该基准包含 2,728 个案例,不依赖单一参考图像,同时衡量目标完成情况和意外改动。受测模型中的最高得分为 57.0。两阶段视觉规划器在三种受测图像生成模型上的平均得分提升了 9.1 分;GPT-Image-2 的得分则从 57.0 提高到 71.6。

EvolvingAvatar:随对话进展自适应的交互式3D头部生成

EvolvingAvatar是一种因果生成系统,可根据面部视频和音频,在对话过程中自适应地生成交互式3D头部动作。它无需动作标签作为训练目标,而是利用对话中的视听上下文进行测试时自监督学习。研究团队还推出了一个包含455.95小时对话视频的基准数据集。在最具挑战性的分布外测试中,随着对话展开,生成的表情统计与录制数据之间的差异最多降低了11.1%。

何时仅靠思考仍不够:训练小型推理模型超越其参数知识

一项研究区分了两类瓶颈:可以通过进一步反思解决的执行瓶颈,以及需要外部信息的知识瓶颈。研究提出 FlyBy,让小型推理模型先自行思考,必要时再选择性地查询更强大的模型。在 1,158 道高难度题目上,FlyBy-4B 的 pass@8 达到 45.96%,超过 Qwen3-14B 的 41.64%,服务成本则低 2.7 倍。FlyBy-8B 的 pass@8 达到 51.81%。

微软优化 Edge:网页应用更流畅,AI 智能体能力进一步扩展

微软面向 Edge 开发者推出多项新功能,旨在提升网页性能,并让 AI 智能体完成更多浏览器任务。新的性能指标和 JavaScript 分析工具可以帮助开发者定位单页应用中的瓶颈,减少操作卡顿、白屏以及看似卡死等问题。通过 WebMCP 等 API,网站能够提供结构化工具,供 AI 智能体在浏览器内执行信息查询、表单填写和选项比较等任务。OpaqueRange API 还可让拼写检查、建议和提示气

SciGen-Verifier:用于可解释科学图像生成验证的多模态推理模型

SciGen-Verifier是一种用于评估科学图像的多模态模型,涵盖电路图、几何作图和函数图像等内容。配套基准SciGen-Verify面向多个科学领域,不仅评估图像是否正确,还评估解释和纠错编辑指令。该模型先进行监督微调,随后通过基于评分标准的两阶段强化学习进行优化。作者称,SciGen-Verifier相较于规模大得多的专有模型具有竞争力,并可作为在线批评器,用于迭代修正生成的科学图像。

重新思考自动语音相似度评估:从EER转向嵌入几何

一项研究质疑将说话人验证模型的等错误率(EER)作为人类语音相似度判断代理指标的普遍做法。研究人员通过建立人类感知对齐指标发现,对齐程度更多取决于模型的训练目标,而不是验证性能。AAM-Softmax等基于间隔的分类损失,其感知对齐效果明显低于原型式度量损失;EER也无法可靠反映人类判断。研究将这种差异归因于嵌入空间的几何结构:有效维度与感知对齐程度呈-0.95的秩相关。加入维度瓶颈后,感知对齐指

REALM:面向具身反应式倾听的由粗到细生成框架

REALM 是一套为具身对话代理生成音频驱动面部动作的框架。它将听者的动作历史与说话者音频相结合,并考虑说话线索与听者反应之间的时间延迟。粗阶段解码器预测主要动作轨迹,随后通过音频条件随机调整细化面部表情,同时保留整体姿态。在 ViCo 和 L2L 数据集上的评估中,REALM 在多项动作质量指标上优于受测基线。研究团队还将系统部署到 Ameca 人形机器人上,并通过用户感知研究评估生成的行为。

AdaGuard:支持用户自定义策略的自适应防护模型

AdaGuard是一系列防护模型,可根据推理时提供的策略评估智能体的行为轨迹。研究团队推出了AdaptiveSafety数据集,包含10,939条训练样本和1,000条测试样本,覆盖包含1至100条规则的策略。数据集结合了策略和行为变化的反事实案例、解释信息以及完整的违规规则列表。强化学习方法SafePO用于提升违规识别能力,并平衡解释推理与最终判定。AdaGuard提供0.6B、4B和8B参数规

BaRe-Mem:提升智能体咨询稳健性与适应性的贝叶斯可靠性记忆

在多智能体系统中,不可靠的建议可能让结果变差。BaRe-Mem 根据中央模型的内部信念表征和历史交互,估计提供建议的智能体是否可靠。这些估计用于调节建议的影响,并帮助系统决定是咨询其他智能体还是自主推理。在九个基准和六种中央模型上的测试中,面对误导性建议时,BaRe-Mem 比辩论和多数投票方法更稳健。在难度较高的任务中,无论测试的误导信息程度如何,其表现都优于自主推理。在 MuSiQue 基准上

面向交互式世界的精准编辑与灵活引用

EditWorld是一种用于精准编辑和灵活引用交互式世界的视频世界模型。现有视频世界模型主要侧重导航和探索,而EditWorld能够在自回归生成过程中流式处理编辑指令和参考图像。该模型采用Gated Causal Attention处理随时间变化的编辑条件,并通过Sparse Context机制限制长程推理中的历史上下文。研究团队还构建了专门的数据合成与标注流程,并提出用于系统评估流式世界编辑能力

利用自适应循环 Transformer 改进测试时扩展

这项研究探讨了重复利用网络层的 Transformer,能否在输出变长时更有效地提升推理表现。研究团队提出 TaH2,将额外迭代分配给能够从中受益的 token,而不是对所有 token 执行相同次数的循环。在难度较高的 AIME 基准测试中,与无循环基线模型相比,TaH2 的测试时解码计算量每翻倍所带来的准确率增益提高了 53%。在计算量相同的条件下,其最高准确率也高出约 3.4 个百分点。代码

LG Innotek 将部署车辆,为自动驾驶传感系统开发收集数据

LG Innotek 将与自动驾驶软件公司 Applied Intuition 合作,在韩国运营传感数据采集车队。车队将以首尔、仁川和京畿道为中心,到 2028 年计划部署 20 辆数据采集及软件开发车辆,并在美国、欧洲和日本投放车辆。车辆将搭载 LG Innotek 的摄像头、雷达和激光雷达。公司计划将采集的数据与数字孪生环境结合,用于提升传感器性能并验证系统有效性,重点关注传感器融合和极端工况

IDC:2026年上半年全球人形机器人出货量同比增长432.1%

IDC最新报告显示,2026年上半年全球人形机器人出货量接近2.5万台,同比增长432.1%。中国出货量超过1.9万台,占全球市场约77.9%,全球市场规模超过7.4亿美元。人形机器人的应用正从科研、教育和展示逐步扩展至工业制造、物流、零售等商业场景。与此同时,小型、低成本产品开始通过电商渠道面向个人消费者销售,主要提供教育和陪伴功能。IDC预计,到2030年全球人形机器人出货量将超过75万台,较

影石据报正在研发主打拍摄的智能眼镜,前框可更换并或搭载通义千问

据中国媒体援引知情人士消息,影石创新正在研发一款面向内容创作者、主打免手持拍照和视频拍摄的智能眼镜。产品可能采用可更换前框设计,主要功能集中在镜腿部分。AI 功能或将搭载阿里巴巴通义千问大模型。影石还计划进一步探索将生成模型直接部署在设备端,以减少对云端服务的依赖。公司此前获得的一项专利描述了分体式电池设计:电池佩戴在身体其他部位,再通过电线为眼镜供电,从而减轻头部负重。该产品目前尚未正式发布,相