AI 新闻中心

AI 新闻中心 过去24小时分析了 170 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

S3Gym:大语言模型能否将自我测试和自我评判转化为自我改进?

S3Gym是一项交互式基准测试,用于评估大语言模型能否测试自身行为、判断由此产生的经验,并改进未来的决策。该方法将开放式探索与严格的保留集评估分开,并在七个配备可执行环境验证器的文字游戏中测试智能体。研究比较了三种利用交互经验的路径:直接使用历史记录进行上下文学习、基于得分的摘要记忆,以及参数训练。结果表明,自我改进既不会自动发生,也不具有一致性。当经验能够被压缩为可复用的策略规则时,摘要更有帮助

ASPIRE:模型能否从模糊目标中自我进化?

ASPIRE是一项用于评估人工智能系统能否根据模糊目标自我改进的基准测试,例如“成为更好的研究者”。系统不会获得明确的任务和评估指标,只会收到一项自然语言能力目标。随后,智能体必须自行选择数据和更新方法,构建训练与验证信号,并决定评估时机。ASPIRE同时支持模型权重更新和智能体框架演化,并通过覆盖六个目标的520道专家编写隐藏题目进行评估。实验显示,当前智能体通常能够完成训练和框架编辑循环,但权

谷歌 Googlebook 的 Look up 应用提前曝光,主打上下文搜索和航班追踪

谷歌面向即将推出的 Googlebook 平台开发的 Look up 应用曾短暂上架 Google Play,随后被官方下架。该应用定位为桌面端上下文工具,用户选中文字后,无需离开当前页面,即可通过浮动窗口查看相关信息。已展示的信息来源包括 Google 搜索、Google 地图和 Google 航班,支持词义解释、地点信息和航班动态查询。用户还可以在类似聊天机器人的输入框中继续提问,将单次查询扩

Anthropic 升级 Claude Code 与 Cowork,支持后台操控 Mac

Anthropic 扩展了 macOS 版 Claude Cowork 和 Claude Code 的电脑控制功能。用户处理其他工作时,Claude 现在可以在后台通过屏幕交互执行点击、输入文字和导航操作。该功能要求使用 macOS 15 或更高版本,Mac 保持唤醒状态,并保持 Claude Desktop 应用打开。用户还可以在设置中启用“完全控制”模式。目前该功能仅面向个人 Pro 和 Ma

Kirin:从真实环境视频生成动物运动

Kirin 是一个从视频中重建和生成动物运动的框架。该系统利用大量真实环境中的动物视频,重建三维运动序列,并将其与文字描述配对,构建 AiM3D 数据集,为四足动物提供视频、文本和运动的对齐数据。在此基础上,研究人员开发了一个同时以文本和图像为条件的视觉引导运动生成模型,可为不同动物物种生成逼真的动作。结合现有的图像转三维模型,Kirin 还能自动为三维动物网格绑定骨骼并制作动画,为大规模、文本和

HarnessDev:大语言模型能否创建并进化自己的智能体框架?

HarnessDev 是一个用于评估语言模型能否构建和改进智能体执行基础设施的基准测试。在创建阶段,智能体从最小化的初始环境出发,建立完整的执行系统;在进化阶段,则根据执行反馈反复修改该系统。研究评估了 6 个大语言模型,覆盖 4 个领域和 5 个下游基准,共包含 2,207 个独立实例。生成的框架在编程、搜索和研究任务上明显落后于成熟的人工设计系统,但在写作和机器学习实验方面,表现达到或超过了部

Repo-To-Skill:将 GitHub 仓库提炼为 AI 技能

该研究推出 DisCo,一种将 GitHub 仓库和论文中的实践知识转化为紧凑、经过验证的技能的研究代理,用于自主机器学习研究。其 AREX-Skill Library 从 1,000 个广泛使用的 ML 仓库中提炼出超过 5,000 项技能。在模型、研究框架和执行预算保持不变的情况下,研究称配备这些技能的代理在 MLE-bench、PaperBench、FrontierCS 和 PassNet

地平线征程智驾芯片量产突破1500万套

中国芯片企业地平线宣布,征程系列智能驾驶芯片量产规模已突破1500万套。据公司介绍,相关芯片累计赋能800万名车主,并与超过40个汽车品牌达成合作,中国前十大车企均在其中。自2020年启动前装量产以来,地平线用了5年实现从0到1000万套,而从1000万套增至1500万套仅用12个月。公司称,目前已有500款量产车型确定采用其芯片,其中近130款属于中高阶智能驾驶领域,在手定点总量超过2000万套

百度引进北美前沿实验室专家,前 DeepSeek 研究员出任多模态负责人

百度基础模型研发部门正在重组研究团队。百度引进了来自一家未具名北美前沿实验室的资深研究员武钦,以增强文心系列模型的预训练能力。前 DeepSeek 研究员魏浩然也已转入百度,负责多模态算法开发。他的团队此前开源了 Unlimited OCR 模型,并在 OmniDocBench 基准测试中排名第一。百度希望通过引进人才强化文心的研究组织和技术开发,但这名新研究员的具体背景尚未公开。

EarlyEval通过提前预测结果降低AI智能体评估成本

评估大语言模型智能体的成本可能很高:前沿模型运行一次基准测试就可能花费数百至数千美元,反复测试会进一步增加开发成本。EarlyEval通过分析智能体的中间行为,提前预测其最终结果,并在成功或失败的置信度达到设定阈值时停止运行。该轻量级框架使用两个基于行为、文本和参考解决方案特征训练的LightGBM分类器。在SWE-bench Verified、TerminalBench和Toolathlon上,

语言模型可以控制自己的注意力

语言模型通常只需关注长上下文中的一小部分内容,但此前仍必须扫描整个 KV 缓存来寻找相关 token。Declarative Attention(DA)让模型在生成过程中自行声明需要关注完整上下文、特定区域,还是仅关注最近的输出。推理引擎会像处理工具调用一样解析这些声明,从而跳过大部分 KV 缓存读取。在涵盖 15 项长上下文任务的零样本评测中,DA 使 Gemma-4-31B 和 Qwen-3.