OpenAI宣布“自动化研究实习生”里程碑:内部智能体运行时长达人工的3.1倍
OpenAI表示,其内部系统已达到“自动化研究实习生”里程碑。在人类监督和指导下,该系统能够完成资深研究人员通常需要数天处理的、定义明确的复杂任务。截至8月中旬,OpenAI核心研究组织中,每投入一个人类工作日,智能体的运行时间相当于3.1个智能体工作日。不过,这一比例衡量的是运行时间和工作量,并不等同于相同的生产力或实际产出。OpenAI员工Kevin Liu认为,递归式自我改进可能成为未来几年
AI 新闻中心 过去一年分析了 4191 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
OpenAI表示,其内部系统已达到“自动化研究实习生”里程碑。在人类监督和指导下,该系统能够完成资深研究人员通常需要数天处理的、定义明确的复杂任务。截至8月中旬,OpenAI核心研究组织中,每投入一个人类工作日,智能体的运行时间相当于3.1个智能体工作日。不过,这一比例衡量的是运行时间和工作量,并不等同于相同的生产力或实际产出。OpenAI员工Kevin Liu认为,递归式自我改进可能成为未来几年
据《娱乐资本论》报道,字节跳动旗下火山引擎近日邀请多家版权方参与AI版权管理平台内测。品牌方和短剧制作方可调用Seedance、Seedream等模型,使用已获授权的正版IP进行创作;版权方则可在后台完成监修、审核和交易管理。平台预计于今年下半年正式上线,提供面向消费者的模板创作和面向企业客户的自由创作两种授权方式。目前据称已有数十个头部IP签约,包括周星驰旗下比高集团相关影视作品。部分企业项目报
OpenAI 的网站构建工具只需简单提示,就能创建精美的落地页、指南、游戏和简单应用。本文经 Wonder Tools 授权转载;该通讯专门介绍实用的网站和应用。
ShallowStream 是一个用于提升多模态大语言模型连续视频处理效率的框架。它利用模型的浅层同时进行视频帧编码和轻量级检索索引构建,并持续维护该索引。在查询阶段,系统根据浅层生成的注意力分数评估上下文帧,再通过考虑多样性的策略选择准确且全面的证据。论文作者称,该方法在性能上可媲美现有领先的流式处理方法,同时将每帧预填充延迟最多降低52.1倍,将10秒视频的端到端延迟最多降低11.9倍。相关源
AdaptVPR是一种生成式数据增强框架,旨在提升视觉地点识别对光照、天气、季节变化和动态遮挡的鲁棒性。视觉语言模型负责解析场景属性,基于规则的调度器则根据可编辑性和风险约束选择生成路径。系统可生成天气、光照和时间等全局外观变化,加入局部动态遮挡物,或结合两类扰动。基于几何一致性和外观多样性的验证机制会筛除不可靠样本,降低结构偏移风险。由此构建的AdaptCities数据集包含16万条经过验证的合
百度旗下小度将于9月8日举行新品发布会,推出多款搭载人工智能功能的硬件,包括智能屏、闺蜜机、智能摄像机和智能音箱。新品将整合“超能小度”智能体能力。百度去年推出了多模态AI助手,并宣布为已售出的数千万台小度设备提供免费升级。
腾讯微信视觉团队开源了通用多模态嵌入模型 WeMM-Embedding,支持文本、图像等输入。该模型提供 2B、4B 和 9B 三种规模,面向不同部署需求。其采用统一架构,并结合两阶段训练与知识蒸馏,在多模态理解能力和部署效率之间进行平衡。据腾讯介绍,WeMM-Embedding 已大规模部署于微信推荐与搜索系统,日调用量达到十亿级。此次开源使开发者能够使用一款已在大型商业服务中部署的模型,但公告
9月7日,千问开放平台上线10余款金融服务智能体,覆盖证券投资、基金、期货和保险。用户可在千问对话中直接调用相关服务,也可从首页进入。由不同金融机构提供的智能体支持市场与企业基本面分析、投资参考,以及保险产品核保要求对比等功能。千问生态目前已延伸至物流运输、房产、本地生活、汽车出行等十多个领域。此次扩容反映出AI应用正从通用对话转向面向具体行业任务的专业服务。相关功能属于分析和产品筛选辅助,不应替
大型语言模型正越来越多地用于将自然语言问题描述转化为优化模型。但现实中的运筹学需求通常缺少目标、约束条件或业务规则,而这些信息可能改变最终的数学规划模型。研究人员提出了 OR-Clarify,这是一个用于评估智能体能否在建模前识别必要澄清事项的基准。同时,他们提出两阶段框架 InterOPT,用于找出对建模至关重要的未解决信息,并决定继续提问还是停止。在选择题实验中,InterOPT 在准确恢复缺
美国普通投资者正利用基于 Claude 或 Codex 构建的 AI 智能体开发交易算法。他们将股票投资组合连接到这些系统,让软件自动执行部分投资策略。这一趋势催生了“机器人散户投资者”,但也带来了系统可靠性、风险管理和潜在金融损失等问题。
iRobot 在 IFA 2026 发布了 Roomba Duo,这是一套由扫拖一体主机和紧凑型副机构成的清洁系统。两台设备可实时通信,并利用 AI 协调清洁任务。主机负责清洁开放式地面,配备 PowerSpin Max 滚筒拖把,可提供 46 牛顿下压力。高度仅 83.5 毫米的 Roomba Plus 575 Combo Robot 主要清洁角落和边缘,可跨越 35 毫米高的门槛,并配备可向外
微博 CEO 王高飞分享了驾驶鸿蒙智行智界 R7 约 100 公里的体验,并高度评价华为乾崑智驾 ADS 5.0。他提到,系统在狭窄道路会车时会适度减速,在减速或安全降级时提示原因,还能辅助车辆驶出车位并完成转向。在一个后方紧邻出口的 Y 字形车位中,车辆通过多次打方向完成了原地掉头。不过,他将 ADS 5.0 与特斯拉 FSD V14 相提并论,主要是个人驾驶感受,并非标准化测试结论。他同时指出
一项研究表明,在循环神经网络中,状态被写回和保存的方式可能决定低精度推理的准确率。在用于荧光寿命成像的 GRU 编码器—解码器中,采用确定性的 4 位状态存储后,短寿命成分 τ1 和长寿命成分 τ2 的估计误差分别增加约 70 倍和 300 倍。原因是反复出现的小幅更新低于写入阈值,未能反映到存储状态中。误差反馈、残差记忆和方向记忆能够在无需重新训练的情况下恢复准确率。对独立训练的 LSTM 进行
MaxKernel 是一个用于设计和优化 TPU 定制内核的多智能体系统。它支持三种方式:人类参与的协作式设计、基于性能指标和追踪数据的全自动优化,以及用于更广泛探索设计空间的图搜索式自主探索。多个专业子智能体分别负责规划、实现、自我调试、测试和硬件性能分析。研究人员在 TPU 基准套件 JaxBench 的 50 项任务,以及先进开源模型的真实工作负载上进行了评估,并称该系统在许多情况下达到了专
一项研究分析了大型语言模型在修复漏洞时为何经常修改超出必要范围的代码。研究人员使用 BigCodeBench 的 400 个问题,注入受控的 AST 级错误,以衡量修复结果是否接近最小补丁。即使是 GPT-5.5 等强大模型,也经常产生不必要的大幅修改并增加认知复杂度。加入保留原有代码的指令后,过度 Levenshtein 距离从 0.195 降至 0.131,新增认知复杂度降低 26.6%,Pa