Anthropic 研究员展示自我改进型 AI 的初步成果
自动化系统在评估特定失配行为的 10 项基准测试中全部提升了表现,同时没有降低整体性能。这些结果初步展示了开发自我改进型 AI 的方法,但尚未证明 AI 已具备广泛且自主的自我改进能力。
AI 新闻中心 过去30天分析了 911 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
自动化系统在评估特定失配行为的 10 项基准测试中全部提升了表现,同时没有降低整体性能。这些结果初步展示了开发自我改进型 AI 的方法,但尚未证明 AI 已具备广泛且自主的自我改进能力。
CaSKG是一种改进大语言模型智能体检索可复用程序性技能的框架。它首先利用语义、词法、输入输出和结构等信号构建高召回率的有向候选图,然后通过删除、替换和重排技能对的反事实测试来校准边的相关性。生成的加权图可在不改变智能体策略或任务接口的情况下,实现紧凑且面向任务的技能扩展。在ALFWorld和ScienceWorld上对六种大语言模型进行评测时,CaSKG在全部12种模型与基准组合中取得最高任务得
Fin认为,用户数量和每位用户处理的Token数量同时呈指数增长,使当前的AI时代区别于此前的技术基础设施建设周期。这一趋势可能支撑AI实验室的算力经济模型。文章还探讨了继编程之后的下一个收入增长引擎、AI基础设施泡沫的可能性、开源与闭源模型的经济性,以及AI半导体建设周期为何可能比互联网建设更长。
一篇最新论文认为,在许多医疗任务中,AI的表现往往优于医生。这一观点引发了对医生未来角色、人类责任以及AI在医疗领域应用边界的讨论。
《Fast Company》梳理了Meta在人工智能领域的发展历程。Meta于2013年成立研究机构Facebook AI Research(FAIR),但在公司将战略重点转向元宇宙期间逐渐落后于AI竞争对手。如今,Meta正投入其所称前所未有的大量资金,以重新取得竞争优势。8月,首席执行官马克·扎克伯格在公司网站发布了一篇长达6,537字的AI宣言,阐述公司的人工智能战略。
WikiSkill 是一个让 AI 智能体技能与持久知识库共同演进的研究框架。它将原始执行经验、积累的知识和可执行技能分开,并持续把经验整合到一个维基中,为后续技能更新提供依据。研究人员表示,在多种模型和基准测试中,WikiSkill 的表现优于现有技能演进方法,也普遍优于不具备技能的基线系统。较大的模型通常能从演进后的技能中获得更多收益,而配备技能的小模型有时可以超过没有技能的大得多的模型。这些
该研究认为,扩展世界模型不能只依靠更多爬取的视频和计算资源,还需要能够提供可靠奖励信号的递归式数据引擎。代码智能体可以利用可执行环境,由编译器和运行时系统提供高质量反馈,从而支持强化学习后训练。相比之下,空间生成目前往往依赖CLIP分数等模糊且可能存在偏差的指标。游戏引擎可以自动检查碰撞、物理效果、可导航性和基本可玩性,而开发者则通过接受或拒绝场景提供整体质量信号。研究提出“人类—引擎验证强化学习
Procedura是一种3D建模智能体框架,可根据文本提示生成可编辑的参数化程序。大语言模型先将物体规划为装配图,再逐步编写各个部件。每个部件只有通过编译、配合和连通性检查后才会被纳入。独立的视觉评审器会根据诊断出的问题逐项改进装配结果。该图结构还支持按部件指定材料,以及经过模拟验证的关节运动。研究人员表示,在P3D-Bench和硬表面基准MechBench-36上,Procedura在评测质量方
Magpie 是一种面向交互式游戏的生成式渲染系统,将游戏运行与视觉生成分离。游戏引擎负责处理玩家操作并维护世界状态,独立的渲染服务器则根据引擎生成的白盒画面输出视觉内容。该设计旨在保持游戏规则、对象状态和交互结果的稳定性与可复现性,同时减少早期游戏原型对完整视觉资产制作的依赖。Magpie 为将生成模型应用于游戏实时渲染提供了一种系统级实现路径。
生成式人工智能推动了视频编辑技术的发展,但按照多项指令编辑长视频仍然十分困难。按固定时长切分视频可能导致人物和物体被割裂、产生编辑幻觉,并破坏时间连续性。该研究提出多指令多镜头长视频编辑(MMLVE)任务以及 MMLVE-Bench 数据集。其智能体框架结合大语言模型和视觉语言模型,在镜头级别拆分视频,并更准确地解析编辑指令。研究还提出三项指标,用于评估跨镜头一致性、多指令解耦以及时空结构的保持程
GameWAM是一种用于电子游戏和图形用户界面原生闭环交互的世界-动作模型。它能够同时生成未来的视觉观测以及可执行的键盘和鼠标操作轨迹。该系统区分游戏操作与GUI操作模式,通过只执行短动作前缀、再依据新观测重新规划来处理长时程交互,并使用同步的游戏和GUI轨迹进行训练。实验表明,GameWAM在任务成功率方面具有竞争力,同时执行的原生操作少于对比智能体。研究还发现一种失败模式:在条件固定时,生成动
腾讯发布了开源模型 Hy4 preview,总参数量 7700 亿,激活参数 490 亿,上下文长度达到 100 万 Token。腾讯称,该模型在软件工程、办公分析、游戏开发和科学研究等任务上有所提升。在由 163 名内部专家对 203 项工程任务进行的盲测中,Hy4 preview 平均得分为 2.99 分(满分 4 分),略高于腾讯公布的 GLM-5.3 和 Kimi K3 得分。腾讯还表示,
论文提出 Self-OPD,一种面向流匹配模型的无教师策略内蒸馏框架。现有 OPD 方法通常需要为每个新目标训练专门的预训练教师模型,计算成本较高;教师与学生分布之间的差异还可能导致生成轨迹中的误差累积。Self-OPD 将学生模型自身的探索转化为逐步监督信号。在每个时间步,方法从确定性的下一状态预测中生成多个随机候选,通过采样运行这些候选,并将其奖励与模型自身的确定性参考基线进行比较。优势较高的
PILOT 是一种监督者—工作者框架,支持 AI 智能体在执行过程中持续改进。独立的监督者可以在工作者运行期间重新引导或终止任务,同时将执行过程中发现的流程和失败模式提炼为可复用的技能与记忆。在两个冻结的基础模型和三个基准测试中,PILOT 在六种配置中的五种排名第一。在 Terminal-Bench 2.0 上,其表现最多领先对比框架 9.8 个百分点。在自我改进测试中,使用 GLM-5.1 和
TTPO是一种无需真实标签、在推理阶段训练大语言模型的方法。它利用多数投票生成伪标签,对与投票结果一致的输出进行蒸馏,并惩罚不一致输出中的高置信度错误,以降低错误伪标签误导整个更新过程的风险。在五项竞赛级基准测试中,TTPO达到了使用标签监督的在策略自蒸馏方法的水平。在Qwen3-1.7B上,测试时训练性能从38.0%提升至45.2%;在不进行扩展思考的情况下,研究还报告了25.2%至36.4%的