AI 新闻中心

AI 新闻中心 过去一年分析了 8898 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

谷歌就欧盟要求开放安卓系统、提供搜索数据提起上诉

谷歌已向欧盟普通法院提起诉讼,反对欧盟委员会依据《数字市场法》采取的相关措施。欧盟要求谷歌向竞争性 AI 服务商开放安卓系统,允许用户通过语音启动自选的 AI 助手,并在 2027 年 1 月前向第三方搜索引擎提供与谷歌搜索相当的部分搜索数据访问权限。谷歌认为,分享敏感的搜索查询可能对用户隐私和安全造成不可逆的损害。目前,该程序尚未进入正式的违规调查阶段。

Duplex-MPE:全双工对话中的多方交互基准

Duplex-MPE是一项评估语音助手参与多人对话能力的基准,涵盖三到四名人类发言者。它测试助手何时应回答、保持沉默或停止说话。该基准包含2,000个场景,输入为连续对话音频,不提供转录文本或预先划分的发言边界。四项指标分别评估新回应的启动、回答准确性、适当保持沉默,以及人类解决请求时停止发言的能力。在测试的五个开放权重语音系统中,MiniCPM-o 4.5在三项能力上表现最佳。其他系统虽然更频繁

SkillDRE 通过执行前与运行时反馈演化智能体技能

SkillDRE 是一个用于自动演化 AI 智能体恶意技能包的框架。它将执行前的扫描器引导优化,与在防御机制下根据执行结果进行的运行时改进结合起来。每次修改都会重新扫描并执行,从而形成跨阶段闭环。在 SkillsBench 上对四个受害模型进行评估时,SkillDRE 的平均攻击成功率达到 45.28%,比最强基线高 40.3%。最终提交的技能未被 SkillScan 检出,同时基本保持了良性任务

DepthBench 衡量残差连接如何提升计算深度

该研究提出了 DepthBench,这是一个用于评估 Transformer 模型计算深度的受控基准。研究人员在保持模型规模和预训练方案不变的情况下,系统调整了 10 种代表性架构的宽度与深度比例。标准 Pre-LN 以及大多数基于归一化或缩放的变体,从增加深度中获得的收益有限;当模型变得更深更窄时,性能甚至可能下降。相比之下,HC 和 Full AttnRes 即使在极端深层配置下也能持续提升性

“英语(美国)”如何成为默认选项?研究揭示大语言模型对美式英语的结构性偏向

一项研究探讨大语言模型为何偏好美式英语而非英式英语。研究人员比较了1,813组英美英语表达,并分析训练数据、分词器、预测成本及生成文本。在受审查的6个预训练语料库和21个后训练数据集中,美式英语均占优势。分词器通常能更紧凑地表示美式英语,模型对其预测成本也更低。即使使用中性的英语提示,生成内容仍以美式英语为默认。研究指出,这种结构性语言偏向可能导致语言同质化,并加剧全球人工智能部署中的不平等。

PLDR-LLM 的训练与推理动力学:行映射坍缩、重整化与预测性约化

这部专著提出了描述幂律解码器表征语言模型(PLDR-LLM)训练与推理的框架,并将以行为中心化的学习映射变化分解为参数贡献、相互作用和数值观测误差。分析还考虑了优化器状态、数据顺序及预测性约化所需的其他条件。实验表明,结果会受到观测方式和优化器的影响,且未能支持所测试的自治行状态模型。研究支持有限条件下的预测和特定状态的算子约化,但并未确立普适的临界类别。

TokenCast预测LLM智能体执行期间的Token消耗

TokenCast是一种预测LLM智能体Token消耗的方法。同一任务在不同运行中,消耗量可能相差很大。该方法对各执行阶段的成本及其带来的上下文增长进行建模,并在运行过程中更新预测,无需额外调用LLM。在四个任务套件和六种智能体模型的评测中,与最强对照方法相比,平均绝对误差平均降低14.5%。在离线预算控制回放测试中,在任务完成率相同的情况下,其Token用量比固定预算策略平均减少21.3%。代码

豆包计划推出个人助理产品:4月已内测,代号“Spell”

据新浪科技援引知情人士消息,豆包正在开发个人 AI 助理。由豆包手机助手团队主导的探索产品“Spell”早在 4 月便开始内部测试,但尚未正式对外发布。豆包据称计划将 Spell 与豆包产品更深入地结合,并由 Spell 项目团队和豆包对话团队共同负责开发。新产品预计较快推出,但目前尚无官方细节或发布时间。

诡异又硬核:研究团队打造能用指尖行走的机械手

苏黎世联邦理工学院研究人员改造了一款机械手,使其能够用指尖行走。它有五根手指、共20个关节,并通过基于树莓派的机载计算机自主运行。研究团队在 Isaac Lab 仿真环境中运用强化学习,让神经网络学会稳定步态。测试中,机械手在14种室内外表面移动;在25次被推倒的测试中,有21次能够自行站起。它也保留了操作功能,在键盘演示中的按键正确率达到90%。研究人员设想让它进入大型机器人无法抵达的狭窄空间,

PReCache:通过低秩预计算与中性重构高效共享 Multi-LoRA 智能体的 KV 缓存

PReCache 是一种无需训练的 KV 缓存共享框架,面向 Multi-LoRA 智能体系统。该方法共享基础模型缓存,同时预先计算紧凑的智能体专属低秩缓存,从而避免重复处理共享上下文。ReBaseShared 设计从未应用适配器的隐藏状态中重构共享基础缓存,以减少复用其他 LoRA 适配器生成的表示所造成的精度损失。在多个模型和智能体基准测试中,与不共享 KV 缓存的推理相比,PReCache

KVCMAS:面向多智能体系统共享上下文的高效 KV 缓存校正

KVCMAS 是一种用于多智能体系统高效共享 KV 缓存的框架。它使用紧凑的低秩状态表示不同智能体之间的缓存偏差,并沿智能体工作流串联校正,无需额外进行参考缓存预填充。该方法支持动态变化的共享上下文,同时保持第一个智能体缓存的精确性。在语言和视觉语言工作负载测试中,KVCMAS 的准确率达到或超过现有 KV 缓存共享方法。在高并发服务场景下,与不共享 KV 缓存的推理相比,其首 token 延迟提

SolveEdit:评测生成模型视觉问题解决能力的基准

SolveEdit 是一项评测模型通过场景变换解决视觉问题能力的基准。模型需要根据图像和目标推断并执行必要的修改,同时保留无关内容。该基准包含 2,728 个案例,不依赖单一参考图像,同时衡量目标完成情况和意外改动。受测模型中的最高得分为 57.0。两阶段视觉规划器在三种受测图像生成模型上的平均得分提升了 9.1 分;GPT-Image-2 的得分则从 57.0 提高到 71.6。