360CityArena:面向具身智能体的逼真城市导航基准
360CityArena是一项用于评估具身智能体城市探索能力的基准,测试环境由360度视频构建而成,具有较高的真实感。该项目以日本东京秋叶原为对象,利用覆盖85条街道的602段视频进行重建,并设置了175项人工设计任务,涵盖环境理解、路径推理和空间推理。评估结果显示,即使是当前先进的基于大语言模型和视觉语言模型的智能体,表现仍远低于人类:Gemini 2.5 Flash得分为17.1%,人类为77
AI 新闻中心 过去一年分析了 1373 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
360CityArena是一项用于评估具身智能体城市探索能力的基准,测试环境由360度视频构建而成,具有较高的真实感。该项目以日本东京秋叶原为对象,利用覆盖85条街道的602段视频进行重建,并设置了175项人工设计任务,涵盖环境理解、路径推理和空间推理。评估结果显示,即使是当前先进的基于大语言模型和视觉语言模型的智能体,表现仍远低于人类:Gemini 2.5 Flash得分为17.1%,人类为77
该研究提出 Decoding-Level Taboo,一种无需提示词、可在生成过程中直接干预语言模型 logits 空间的诊断测试。该方法在词边界动态屏蔽主要候选 token,迫使模型采用不常见的表达方式并偏离其惯常生成路径。对多个开放权重模型系列的评估显示,模型在偏离常规路径时的鲁棒性同时受到参数规模和后训练指令对齐程度的影响;总体而言,规模更大且对齐更好的模型表现更稳健。该方法还可用于生成多样
UniMoMo是一种面向稀疏混合专家推荐模型的训练后压缩框架。它不依赖参数距离,而是利用无标签校准集测量专家对相同推荐状态的功能相似性,并据此合并专家。同时,分层自适应保护机制会限制对高路由频率专家的合并,以减少性能下降。该方法无需额外的在线压缩模块,即可将训练完成的模型转换为更小的专家配置。在Amazon Beauty、KuaiRec和TenRec数据集上,四专家模型达到原始NDCG@10的99
安德森・霍罗威茨合伙人 Fabrizio Serafini 称,计算机操作型 AI 智能体已从演示阶段进入可部署阶段,在部分企业流程中的成本可能低于印度离岸外包劳动力。这类智能体能够读取屏幕、点击界面、输入文字,并在缺少明确 API 的软件中处理错误。文章引用 OSWorld-Verified 数据称,领先模型的任务完成率已从 2025 年初的 42% 提升至 2026 年 6 月的 85%,但这
DistilVDR 是一个拥有 5.24 亿参数的视觉文档检索系统,由一个 80 亿参数的视觉语言模型蒸馏而来。其非对称编码器将更多视觉处理能力集中在文档端,同时保持较小的查询编码器,并且无需相关性标注或负样本采样。HiRes 版本在 ViDoRe v1 至 v3 上取得 61.74 的平均 NDCG@5,达到教师模型性能的 86.9%。两个版本生成的索引都明显更小,为一百万份文档建立索引的速度约
研究人员称,疑似与中国有关的黑客利用开源人工智能代理开发了自主黑客工具,并于7月入侵台湾政府网站。据称,这些人工智能代理能够同时执行侦察和入侵行动,可能表明网络战正在进入新阶段。目前相关结论仍基于研究人员对事件的分析。
Fréchet 距离近年来被用作生成器后训练的分布级目标,以补充样本级扩散损失和流匹配损失。但直接优化 Fréchet 目标可能导致“Fréchet 作弊”:目标指标不断提升,而视觉质量以及其他特征空间中的分布对齐却停滞或恶化。AdvFD在传统 Fréchet 损失使用的静态特征表示之外,引入经过校准的对抗式学习表示。该表示通过对抗训练最大化真实样本与生成样本之间的 Fréchet 差异,生成器则
一项研究探讨了深度研究智能体如何在上下文不断增长时,移除价值较低的信息。研究在检索前、检索后和合成前三个阶段,对比了轻量级启发式方法与学习型价值模型。结果显示,剪枝发生的阶段比具体评分规则更重要:提前剪枝能带来最大的整体节省,而较晚剪枝主要用于优化最终合成上下文。轻量级启发式方法最多可减少 73% 的 Token 使用量,同时几乎不影响质量。但没有任何单一方法能在质量、效率和忠实度方面全面占优。
一项研究探讨了开放式大语言模型在46种语言机器翻译任务中的无参考后训练方法。研究人员以监督微调的MiLMMT-46-v0.1模型为基础,采用Group Relative Policy Optimization(GRPO),奖励信号取自两个无参考质量评估模型的平均值,并加入语言识别门控。随后,他们对监督微调和强化学习模型的检查点进行线性插值,得到MiLMMT-46-v1.0。根据论文报告的评测结果,
Combodied Agents 是一种旨在弥补智能体人工智能结构性缺陷的框架。数字智能体主要改变软件状态,具身智能体则改变物理状态,但两者都未必能够充分建模个人状态、意图和自主性的持续变化。该方法将人的状态轨迹置于核心,并把软件工具、传感器、可穿戴设备、机器人和人工服务作为干预渠道。框架结合多模态事件感知、可由用户纠正的长期记忆以及个人世界模型,并根据同意、不确定性、安全性、可逆性和用户控制选择
研究人员提出 iFAN,一种用于图像分割掩码 Transformer 的训练框架。现有基于查询的解码存在两个不匹配问题:概率分数最高的查询不一定能生成最准确的掩码,最终层解码也可能丢弃中间层更优的预测。iFAN通过调整后的概率—掩码排序,使查询竞争更符合掩码质量,并通过跨层自蒸馏将更强的中间层预测传递到最终层。这些机制仅在训练阶段使用,因此推理仍保持高效。在COCO、ADE20K和Cityscap
TSDS-Toolbox 是一个统一框架,用于系统且可复现地比较时间序列数据集相似性测量方法。该工具支持用户添加自定义数据集、相似性方法以及预测、分类和生成等下游时间序列任务。通过集成的数据集规约器,它还能够一致地评估数据集级和序列级相似性。研究人员在多种实验设置下验证了该工具的有效性,并已公开发布。
这篇综述研究智能体系统中的协同进化,即多个智能体与环境相互适应,并彼此施加进化压力。文章将现有研究分为三个阶段:智能体之间的协同进化、智能体与环境之间的协同进化(涉及不断变化的任务和反馈),以及元协同进化,即让进化机制本身也具备可适应性。研究还讨论了如何评估、扩展、保障安全并控制日益自主的进化系统。
DSAgentBench 是一个用于评估 AI 智能体在真实计算机环境中执行完整数据科学工作流的基准测试。它包含 275 项任务,覆盖数据整理、探索、建模、可视化和验证,并要求协调使用笔记本、IDE、终端、浏览器和数据库。确定性评估器不仅检查代码执行,还会验证分析正确性、可视化结果和模型性能。在对 15 个闭源和开源模型的实验中,表现最强的 Claude-4.6-Sonnet 任务成功率也只有 5
SkillZip是一种无需任务评估即可压缩自我进化AI智能体所积累技能的方法。它不将技能视为扁平文本,而是识别重复的规则和动作序列,将共享结构统一描述,并把差异保留为明确的例外。该方法采用带类型的最小描述长度目标,并对触发条件、工作流边、工具要求、义务和输出字段设置严格的覆盖约束,以保留罕见但重要的规则。SkillZip支持一次性压缩和持续更新,无需重新执行任务或解析完整历史。论文报告的实验显示,