LongWoF-Bench 评估 EvoMap Gene 在可验证长工作流任务中的表现
LongWoF-Bench 研究能否通过 EvoMap 将经过验证的执行经验整理为可复用的结构化“Gene”,以帮助模型完成复杂工作流。该基准包含 778 项可由机器验证的任务,涵盖代码生成、智能体环境合成、数学推理和规则遵循。在拥有 Claude Opus 验证执行轨迹的 252 项任务中,演化后的 Gene 在全部 7 个评测模型上均超过 Skill,优势为 8.7 至 15.5 个百分点。相
AI 新闻中心 过去24小时分析了 177 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
LongWoF-Bench 研究能否通过 EvoMap 将经过验证的执行经验整理为可复用的结构化“Gene”,以帮助模型完成复杂工作流。该基准包含 778 项可由机器验证的任务,涵盖代码生成、智能体环境合成、数学推理和规则遵循。在拥有 Claude Opus 验证执行轨迹的 252 项任务中,演化后的 Gene 在全部 7 个评测模型上均超过 Skill,优势为 8.7 至 15.5 个百分点。相
广汽集团董事长冯兴亚与华为创始人任正非于8月24日在深圳再次会面。启境汽车表示,此次会晤标志着双方从战略共识转向深化发展,也意味着启境已完成第一阶段的产品与市场验证,进入加速期。启境未来将聚焦约30万元人民币级别的高端智能电动车市场。华为乾崑智驾授权体验中心和启境授权用户中心目前已覆盖90余座城市、超过300家门店。启境GX7已在成都车展完成全球实车首秀,计划于9月上市。
据报道,苹果计划在iOS 27、iPadOS 27和macOS 27中加入Siri AI,并通过候补名单限制初期使用权限。MacRumors称,三款操作系统的Beta 7测试版已经加入相关机制。用户申请加入后,可获得预计等待时间;苹果还可能根据服务器需求和拥堵情况动态调整排队时间。测试期间,部分用户曾等待约一周才获得使用资格。正式版发布后,苹果预计将根据服务器容量,分批向用户开放Siri AI。
中国举行的两场活动展示了人形机器人领域取得的进展。不过,该行业距离实现类似ChatGPT的重大突破仍有很长的路要走。
据媒体报道,阿里巴巴创始人马云近日连续多日买入阿里巴巴港股,累计金额超过6亿港元。此前,阿里巴巴宣布拟配售总额800亿港元的新股,这是公司自2019年在香港上市以来首次配售新股。公司表示,配售所得净额将全部用于发展全栈AI能力和加强AI基础设施。阿里巴巴集团主席蔡崇信和CEO吴泳铭也买入了公司股票,蔡崇信于8月25日再次增持。有关马云买入股票的消息目前尚未得到官方确认。
会议软件公司 Calendly 宣布进行大规模品牌重塑,推出由设计工作室 Smith & Diction 打造的新标志、字标、色彩体系和品牌定位。公司还表示将扩展生产力产品,加入 AI 邮件助手和 AI 会议记录工具。相关功能旨在减少会议安排及其配套事务性工作的时间和精力。
ChatGPT能帮助用户省钱吗?一位用户表示,利用ChatGPT的财务功能审视自己的支出后,节省的金额已经超过每月20美元的Plus订阅费。这只是个人经历,不能证明ChatGPT能够持续提供可靠的财务建议。
企业 CEO 越来越热衷于炫耀公司已交由 AI 处理的业务流程。文章探讨了这一趋势,但没有提供具体的技术突破或可量化的行业整体影响。
据报道,SpaceX 已完成以 600 亿美元收购 AI 编程初创公司 Cursor。The Information 称,在交易宣布当天,埃隆·马斯克通过视频参加了 Cursor 的全员大会。五名知情人士表示,马斯克承认 SpaceX 的 AI 部门落后于竞争对手,并称自己“不习惯失败”。他据称还表示,Grok 尚未成为所在市场的领导者,要求 Cursor 员工协助 SpaceX 追赶竞争对手。马
企业可以通过提升可见性、治理能力和责任制,为人工智能应用的下一阶段扩张做好准备。这些措施旨在帮助组织以更加可控和负责任的方式扩大人工智能的使用。
Dr. Dre 与 Jimmy Iovine 谈论苹果收购 Beats 带来的经验、创造力,以及人工智能在音乐创作中的应用。两人支持把 AI 视为类似鼓机的工具,并探讨美国企业界为何缺乏足够的协作。
一项研究探讨了人脸呈现攻击检测系统能否在不使用人脸数据的情况下,学习可迁移的检测特征。研究人员构建了受控数据集 TPO,收录番茄、土豆和洋葱的真实、打印及重放记录。基于基础模型的检测器在 TPO 上训练后,在四项标准跨数据集人脸 PAD 基准测试中取得 92.70% 的平均 AUC,优于使用合成人脸训练的模型,并接近使用真实人脸数据训练的系统。结果表明,模型学习的主要是呈现、打印和重拍过程中的共同
EXPL-FR提出了一种无需访问内部架构即可解释深度人脸识别模型的方法。研究人员使用轻量级适配器,将视觉语言模型的图像编码器对齐到冻结的人脸识别模型嵌入空间。由于图像和文本编码器共享同一空间,22个类别中的978个属性提示词可以转换为人脸识别空间中的锚点。研究通过人脸验证协议和消融实验检验这种迁移是否有效。并非所有概念都能被识别,因为人脸识别模型会丢弃身份验证不需要的因素。一个无需标签的指标筛选出
据《The Information》报道,Meta 计划在未来数周推出面向消费者的 AI 智能体平台“Hatch”。一份内部文件显示,Hatch 是基于 Meta AI 虚拟助理 OpenClaw 打造的智能体。报道称,该平台是 Meta CEO 马克·扎克伯格 AI 战略的一部分,旨在将公司的 AI 投资商业化,并降低对广告收入的依赖。Meta 据称曾考虑采用分级定价模式,高级订阅费用最高可能达
鸿蒙智行将于 8 月 26 日直播问界 M6 Max 的城区辅助驾驶挑战。该车搭载华为乾崑智驾 ADS 5 增强版,计划在成都应对复杂路口、城市立交和混行窄路等真实场景。华为还将现场介绍 Limera 激光视觉传感器。该传感器通过共用光学架构,同时获取激光雷达的 3D 点云与摄像头图像,并进行物理融合。传感器采用固态设计,体积较小,可安装在前挡风玻璃后方,并处于雨刷清洁范围内,因此无需单独清洗。华