评估多模态大语言模型作为无人机控制的视觉语言行动智能体
该研究评估多模态大语言模型直接进入无人机控制回路后的表现。研究提出DroneCATS-Agent架构和DroneCATS基准,测试四项能力:接近可见目标、跟踪移动目标、搜索初始视野之外的区域,以及指挥多架无人机。模型无需微调,也不依赖预先定义的函数调用模式。结果显示,即使是简单的具身任务,目前模型仍远未达到可靠水平。小型开源模型有时比前沿模型更稳定地飞入目标范围,但经常过早宣布到达,或始终不宣布到
AI 新闻中心 过去一年分析了 4187 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
该研究评估多模态大语言模型直接进入无人机控制回路后的表现。研究提出DroneCATS-Agent架构和DroneCATS基准,测试四项能力:接近可见目标、跟踪移动目标、搜索初始视野之外的区域,以及指挥多架无人机。模型无需微调,也不依赖预先定义的函数调用模式。结果显示,即使是简单的具身任务,目前模型仍远未达到可靠水平。小型开源模型有时比前沿模型更稳定地飞入目标范围,但经常过早宣布到达,或始终不宣布到
StudentSim是一套为AI导师构建个性化学生模拟器的训练框架。它先利用多名学生的数据进行联合训练,再针对每名学生进行专门化,使模拟器能够复现特定学生的回答,并模拟其在导师指导下的变化。配套的StudentSimEval评估协议涵盖60名学生,测试领域包括国际象棋、英语作为第二语言的写作和数学。在三个领域中,StudentSim在行为保真度和指导响应能力上都超过了GPT-5.4。在国际象棋概念
三星将为部分 Galaxy 折叠手机和智能手机推出 My FanCam 功能。该 AI 功能可通过一次点击识别多人表演视频中的指定人物,持续追踪其移动,并自动重新裁切画面,让目标尽量保持在画面中央。功能支持 16:9、9:16 和 1:1 三种输出比例,也能处理过去已经录制的视频。首次分析时,系统可同时分析多名人物,用户之后可以切换不同对象查看对应的跟拍结果。三星表示,视频分析完全在设备端完成,不
Reddit社区一名开发者打造了一款学习应用,让用户可以在平板上手写笔记,并由Claude在同一页面以手写风格回应。应用能够识别手写内容,在笔记旁添加问题或解释,还支持导入PDF和电子书。用户可以标记段落、要求生成相关批注,并根据学习材料创建测验。目前软件主要针对支持手写笔的Android平板进行优化,包括Daylight DC-1,其他平台的适配仍在推进。系统会将手写矢量数据发送给Claude,
Hi-Q是一种面向多跳问答的证据条件化层次化查询细化框架。系统首先判断检索到的证据是否支持当前查询单元;如果无法解决,则通过保持依赖关系的算子进一步展开,并验证语义覆盖范围。由此生成的查询树,其结构由语料库中的支持信号决定,而不是由固定的分解模板或预先构建的图决定。在三个采用全语料库检索的基准测试中,Hi-Q平均取得52.3 EM和64.0 F1,分别比IRCoT高15.1 EM和18.2 F1。
ReFlowSET是一种条件潜在流匹配方法,用于将合成孔径雷达(SAR)观测数据转换为电光(EO)图像。与通常依赖自然图像预训练自编码器的现有方法不同,该方法通过联合评估SAR输入和EO目标的重建效果来选择潜在编解码器。随后,它在选定的潜在空间中从头训练一个规模显著更小的条件DiT模型。训练过程中,带噪声的EO特征会与冻结视觉基础模型提取的干净表征进行对齐,但不会增加推理成本。在QXS-SAROP
一项新的研究框架将多智能体大语言模型系统中的执行关键协议与任务相关语言分离。消息路由、输出格式和终止信号被表示为经过类型定义和验证的程序对象,而提示仍可用于优化任务性能。在合成推理、协作式评审生成和保险定价流程的测试中,该方法实现了100%的最终协议有效性,并持续提升了任务表现。
EM^2Mem 是一种多模态记忆框架,在构建记忆时将长视频中的异构证据绑定到事件锚点。每个按事件索引的记忆单元整合多模态记录、时间上下文、图关联关系、语义事实和来源信息,使语言模型能够直接读取围绕具体事件组织的紧凑证据,而无需在推理阶段从彼此孤立的片段中重建跨模态和时间对应关系。在三个长视频问答基准测试中,EM^2Mem 相比最强的记忆基线,平均准确率分别提升了2.0、2.4和3.7个百分点。事件
小米将于9月7日举行秋季旗舰新品发布会,预计发布澎程N70 Pro、N70 Max、N90 Max三款新车,以及小米18 Fold折叠屏手机和小米平板9 Pro Max。手机和平板预计首发搭载玄戒O3,小米将其定位为AI旗舰SoC。官方称,该芯片拥有最高200TOPS张量算力,支持LPDDR6,并配备针对端侧MiMo模型重新设计的NPU。相关性能数据均来自小米官方,尚未见独立验证。新车还将搭载小米
欧盟委员会已将OpenAI旗下ChatGPT、Reddit和Roblox列为《数字服务法》(DSA)规定的超大型在线平台。根据公告,这三项服务在欧盟的月活跃用户均超过4500万,因此必须承担额外的监管义务,包括删除非法内容,以及加强对未成年人隐私和安全的保护。若未能遵守规定,企业可能面临最高相当于全球年度营业收入6%的罚款。各公司必须在12月底前完成相关合规措施。这项决定表明,欧盟严格的数字监管正
GUI 世界模型通常被评估为单步预测下一屏幕的模型,但其预期用途是作为 GUI 智能体的多步交互环境。GUI-CC 评估生成状态在反复用于后续交互时能否保持上下文一致性。该基准包含两条赛道:基于真实移动端 GUI 轨迹构建的 500 个离线任务,以及覆盖 30 个应用、经模拟器验证的 200 个在线智能体循环任务。评估指标包括转移保真度、转移合理性、上下文一致性和任务进度。实验表明,单步生成的屏幕
澳大利亚律所 Gilbert + Tobin 介绍了如何在全公司部署 ChatGPT Enterprise 和 Codex。其做法结合了首席执行官主导的投入、严格的治理流程以及人的责任机制。这一案例主要展示了法律服务机构如何组织和扩大生成式人工智能的应用。
据报道,Anthropic已发布新一代旗舰模型Fable 5.1,并向拥有相应访问权限的用户提供Mythos 5.1。该公司称,Fable 5.1在多项基准测试中超过上一代Fable 5及竞争产品,并重点提升了处理长时间、复杂智能体任务的能力,适用于编程、研究和知识工作。Anthropic表示,按Token计费的典型工作负载平均成本较上一代降低约25%,高强度智能体任务的成本降幅最高可达45%。不
据报道,OpenExecutive由在企业“AI转型”中失去工作的开发者打造。该项目将企业希望用人工智能取代员工的逻辑延伸到管理层,测试CEO的工作是否也能被自动化。目前没有证据表明该系统确实能够替代CEO。
据彭博社援引消息人士报道,人工智能编程初创公司Cognition AI即将完成一轮规模约为10亿美元的融资。交易完成后,该公司的估值将从今年5月的260亿美元升至约470亿美元。知情人士称,Cognition还获得了投资者近100亿美元的投资兴趣。