AI 新闻中心

AI 新闻中心 过去24小时分析了 254 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

TokenCast预测LLM智能体执行期间的Token消耗

TokenCast是一种预测LLM智能体Token消耗的方法。同一任务在不同运行中,消耗量可能相差很大。该方法对各执行阶段的成本及其带来的上下文增长进行建模,并在运行过程中更新预测,无需额外调用LLM。在四个任务套件和六种智能体模型的评测中,与最强对照方法相比,平均绝对误差平均降低14.5%。在离线预算控制回放测试中,在任务完成率相同的情况下,其Token用量比固定预算策略平均减少21.3%。代码

豆包计划推出个人助理产品:4月已内测,代号“Spell”

据新浪科技援引知情人士消息,豆包正在开发个人 AI 助理。由豆包手机助手团队主导的探索产品“Spell”早在 4 月便开始内部测试,但尚未正式对外发布。豆包据称计划将 Spell 与豆包产品更深入地结合,并由 Spell 项目团队和豆包对话团队共同负责开发。新产品预计较快推出,但目前尚无官方细节或发布时间。

诡异又硬核:研究团队打造能用指尖行走的机械手

苏黎世联邦理工学院研究人员改造了一款机械手,使其能够用指尖行走。它有五根手指、共20个关节,并通过基于树莓派的机载计算机自主运行。研究团队在 Isaac Lab 仿真环境中运用强化学习,让神经网络学会稳定步态。测试中,机械手在14种室内外表面移动;在25次被推倒的测试中,有21次能够自行站起。它也保留了操作功能,在键盘演示中的按键正确率达到90%。研究人员设想让它进入大型机器人无法抵达的狭窄空间,

PReCache:通过低秩预计算与中性重构高效共享 Multi-LoRA 智能体的 KV 缓存

PReCache 是一种无需训练的 KV 缓存共享框架,面向 Multi-LoRA 智能体系统。该方法共享基础模型缓存,同时预先计算紧凑的智能体专属低秩缓存,从而避免重复处理共享上下文。ReBaseShared 设计从未应用适配器的隐藏状态中重构共享基础缓存,以减少复用其他 LoRA 适配器生成的表示所造成的精度损失。在多个模型和智能体基准测试中,与不共享 KV 缓存的推理相比,PReCache

KVCMAS:面向多智能体系统共享上下文的高效 KV 缓存校正

KVCMAS 是一种用于多智能体系统高效共享 KV 缓存的框架。它使用紧凑的低秩状态表示不同智能体之间的缓存偏差,并沿智能体工作流串联校正,无需额外进行参考缓存预填充。该方法支持动态变化的共享上下文,同时保持第一个智能体缓存的精确性。在语言和视觉语言工作负载测试中,KVCMAS 的准确率达到或超过现有 KV 缓存共享方法。在高并发服务场景下,与不共享 KV 缓存的推理相比,其首 token 延迟提

SolveEdit:评测生成模型视觉问题解决能力的基准

SolveEdit 是一项评测模型通过场景变换解决视觉问题能力的基准。模型需要根据图像和目标推断并执行必要的修改,同时保留无关内容。该基准包含 2,728 个案例,不依赖单一参考图像,同时衡量目标完成情况和意外改动。受测模型中的最高得分为 57.0。两阶段视觉规划器在三种受测图像生成模型上的平均得分提升了 9.1 分;GPT-Image-2 的得分则从 57.0 提高到 71.6。

EvolvingAvatar:随对话进展自适应的交互式3D头部生成

EvolvingAvatar是一种因果生成系统,可根据面部视频和音频,在对话过程中自适应地生成交互式3D头部动作。它无需动作标签作为训练目标,而是利用对话中的视听上下文进行测试时自监督学习。研究团队还推出了一个包含455.95小时对话视频的基准数据集。在最具挑战性的分布外测试中,随着对话展开,生成的表情统计与录制数据之间的差异最多降低了11.1%。

何时仅靠思考仍不够:训练小型推理模型超越其参数知识

一项研究区分了两类瓶颈:可以通过进一步反思解决的执行瓶颈,以及需要外部信息的知识瓶颈。研究提出 FlyBy,让小型推理模型先自行思考,必要时再选择性地查询更强大的模型。在 1,158 道高难度题目上,FlyBy-4B 的 pass@8 达到 45.96%,超过 Qwen3-14B 的 41.64%,服务成本则低 2.7 倍。FlyBy-8B 的 pass@8 达到 51.81%。

微软优化 Edge:网页应用更流畅,AI 智能体能力进一步扩展

微软面向 Edge 开发者推出多项新功能,旨在提升网页性能,并让 AI 智能体完成更多浏览器任务。新的性能指标和 JavaScript 分析工具可以帮助开发者定位单页应用中的瓶颈,减少操作卡顿、白屏以及看似卡死等问题。通过 WebMCP 等 API,网站能够提供结构化工具,供 AI 智能体在浏览器内执行信息查询、表单填写和选项比较等任务。OpaqueRange API 还可让拼写检查、建议和提示气

SciGen-Verifier:用于可解释科学图像生成验证的多模态推理模型

SciGen-Verifier是一种用于评估科学图像的多模态模型,涵盖电路图、几何作图和函数图像等内容。配套基准SciGen-Verify面向多个科学领域,不仅评估图像是否正确,还评估解释和纠错编辑指令。该模型先进行监督微调,随后通过基于评分标准的两阶段强化学习进行优化。作者称,SciGen-Verifier相较于规模大得多的专有模型具有竞争力,并可作为在线批评器,用于迭代修正生成的科学图像。

重新思考自动语音相似度评估:从EER转向嵌入几何

一项研究质疑将说话人验证模型的等错误率(EER)作为人类语音相似度判断代理指标的普遍做法。研究人员通过建立人类感知对齐指标发现,对齐程度更多取决于模型的训练目标,而不是验证性能。AAM-Softmax等基于间隔的分类损失,其感知对齐效果明显低于原型式度量损失;EER也无法可靠反映人类判断。研究将这种差异归因于嵌入空间的几何结构:有效维度与感知对齐程度呈-0.95的秩相关。加入维度瓶颈后,感知对齐指

REALM:面向具身反应式倾听的由粗到细生成框架

REALM 是一套为具身对话代理生成音频驱动面部动作的框架。它将听者的动作历史与说话者音频相结合,并考虑说话线索与听者反应之间的时间延迟。粗阶段解码器预测主要动作轨迹,随后通过音频条件随机调整细化面部表情,同时保留整体姿态。在 ViCo 和 L2L 数据集上的评估中,REALM 在多项动作质量指标上优于受测基线。研究团队还将系统部署到 Ameca 人形机器人上,并通过用户感知研究评估生成的行为。

AdaGuard:支持用户自定义策略的自适应防护模型

AdaGuard是一系列防护模型,可根据推理时提供的策略评估智能体的行为轨迹。研究团队推出了AdaptiveSafety数据集,包含10,939条训练样本和1,000条测试样本,覆盖包含1至100条规则的策略。数据集结合了策略和行为变化的反事实案例、解释信息以及完整的违规规则列表。强化学习方法SafePO用于提升违规识别能力,并平衡解释推理与最终判定。AdaGuard提供0.6B、4B和8B参数规

BaRe-Mem:提升智能体咨询稳健性与适应性的贝叶斯可靠性记忆

在多智能体系统中,不可靠的建议可能让结果变差。BaRe-Mem 根据中央模型的内部信念表征和历史交互,估计提供建议的智能体是否可靠。这些估计用于调节建议的影响,并帮助系统决定是咨询其他智能体还是自主推理。在九个基准和六种中央模型上的测试中,面对误导性建议时,BaRe-Mem 比辩论和多数投票方法更稳健。在难度较高的任务中,无论测试的误导信息程度如何,其表现都优于自主推理。在 MuSiQue 基准上

面向交互式世界的精准编辑与灵活引用

EditWorld是一种用于精准编辑和灵活引用交互式世界的视频世界模型。现有视频世界模型主要侧重导航和探索,而EditWorld能够在自回归生成过程中流式处理编辑指令和参考图像。该模型采用Gated Causal Attention处理随时间变化的编辑条件,并通过Sparse Context机制限制长程推理中的历史上下文。研究团队还构建了专门的数据合成与标注流程,并提出用于系统评估流式世界编辑能力