AI 新闻中心

AI 新闻中心 过去30天分析了 915 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

ASPIRE:模型能否从模糊目标中自我进化?

ASPIRE是一项用于评估人工智能系统能否根据模糊目标自我改进的基准测试,例如“成为更好的研究者”。系统不会获得明确的任务和评估指标,只会收到一项自然语言能力目标。随后,智能体必须自行选择数据和更新方法,构建训练与验证信号,并决定评估时机。ASPIRE同时支持模型权重更新和智能体框架演化,并通过覆盖六个目标的520道专家编写隐藏题目进行评估。实验显示,当前智能体通常能够完成训练和框架编辑循环,但权

Kirin:从真实环境视频生成动物运动

Kirin 是一个从视频中重建和生成动物运动的框架。该系统利用大量真实环境中的动物视频,重建三维运动序列,并将其与文字描述配对,构建 AiM3D 数据集,为四足动物提供视频、文本和运动的对齐数据。在此基础上,研究人员开发了一个同时以文本和图像为条件的视觉引导运动生成模型,可为不同动物物种生成逼真的动作。结合现有的图像转三维模型,Kirin 还能自动为三维动物网格绑定骨骼并制作动画,为大规模、文本和

HarnessDev:大语言模型能否创建并进化自己的智能体框架?

HarnessDev 是一个用于评估语言模型能否构建和改进智能体执行基础设施的基准测试。在创建阶段,智能体从最小化的初始环境出发,建立完整的执行系统;在进化阶段,则根据执行反馈反复修改该系统。研究评估了 6 个大语言模型,覆盖 4 个领域和 5 个下游基准,共包含 2,207 个独立实例。生成的框架在编程、搜索和研究任务上明显落后于成熟的人工设计系统,但在写作和机器学习实验方面,表现达到或超过了部

Repo-To-Skill:将 GitHub 仓库提炼为 AI 技能

该研究推出 DisCo,一种将 GitHub 仓库和论文中的实践知识转化为紧凑、经过验证的技能的研究代理,用于自主机器学习研究。其 AREX-Skill Library 从 1,000 个广泛使用的 ML 仓库中提炼出超过 5,000 项技能。在模型、研究框架和执行预算保持不变的情况下,研究称配备这些技能的代理在 MLE-bench、PaperBench、FrontierCS 和 PassNet

百度引进北美前沿实验室专家,前 DeepSeek 研究员出任多模态负责人

百度基础模型研发部门正在重组研究团队。百度引进了来自一家未具名北美前沿实验室的资深研究员武钦,以增强文心系列模型的预训练能力。前 DeepSeek 研究员魏浩然也已转入百度,负责多模态算法开发。他的团队此前开源了 Unlimited OCR 模型,并在 OmniDocBench 基准测试中排名第一。百度希望通过引进人才强化文心的研究组织和技术开发,但这名新研究员的具体背景尚未公开。

EarlyEval通过提前预测结果降低AI智能体评估成本

评估大语言模型智能体的成本可能很高:前沿模型运行一次基准测试就可能花费数百至数千美元,反复测试会进一步增加开发成本。EarlyEval通过分析智能体的中间行为,提前预测其最终结果,并在成功或失败的置信度达到设定阈值时停止运行。该轻量级框架使用两个基于行为、文本和参考解决方案特征训练的LightGBM分类器。在SWE-bench Verified、TerminalBench和Toolathlon上,

语言模型可以控制自己的注意力

语言模型通常只需关注长上下文中的一小部分内容,但此前仍必须扫描整个 KV 缓存来寻找相关 token。Declarative Attention(DA)让模型在生成过程中自行声明需要关注完整上下文、特定区域,还是仅关注最近的输出。推理引擎会像处理工具调用一样解析这些声明,从而跳过大部分 KV 缓存读取。在涵盖 15 项长上下文任务的零样本评测中,DA 使 Gemma-4-31B 和 Qwen-3.

像素文本表示学习的设计基础

该研究探讨模型如何直接在像素空间中读取、检索和压缩语言。通过系统性的控制变量实验,研究人员确定了四项关键因素:可变图像分辨率和字体大小、用于视觉对齐的自然图像文本对、防止像素级捷径学习的布局感知渲染,以及用于跨语言对齐的两阶段多语言训练课程。研究团队将这些原则整合到 Pixel Linguist II 中。这是一款采用原生分辨率、支持即时渲染,并使用2.8亿个训练样本训练的视觉编码器。该模型在英语

后训练让语言模型在编程竞赛中达到金牌水平

一项研究提出了一套端到端流程,用于将大型语言模型专门训练成竞赛编程系统。该方法结合了精选题目、合成推理轨迹、监督微调和强化学习。使用22,000道题目训练的Nemotron-3-Nano-CC,在加入测试时生成、评估和改进解答的策略后,于IOI 2025获得468分,超过金牌门槛。更大的Ultra-CC模型获得502分。随后,一个针对竞赛专门调整的系统在IOI 2026的前瞻性评估中取得600分中

ExecRetrieval 衡量代码嵌入检索中的功能正确性差距

ExecRetrieval 是一个用于测试代码嵌入系统能否区分功能正确代码与几乎相同但存在错误的代码变体的基准。数据集包含 939 个 Python 任务,每个任务配有一个经过执行验证的标准实现,以及最多四个通过单一目标修改生成、同样经过执行验证的错误干扰项。研究人员评估了 23 种密集嵌入配置和 BM25。表现最佳的托管系统 exec@10 达到 1.00,但 exec@1 仅为 0.331。在

PaperCompiler:通过仓库级规范编译实现忠实的论文到代码生成

PaperCompiler 是一个将研究论文转换为仓库级实现的框架。它把与实现相关的证据编译为明确的规范,保留来源信息,并区分论文支持、推断、外部委托和未解决的内容。规范还编码了防止性能退化的要求、任务归属、跨文件依赖关系和文件级约束。在 Paper2CodeBench 上,PaperCompiler 相比强基线将基于参考实现的保真度相对提升了 13.8%,得分从 3.64 提高到 4.15,同时

SolarWM:面向长时域视频世界模型的开放数据与可扩展训练

SolarWM 是一个完全开放的视频世界模型基础平台,覆盖从数据准备到长时域推理的完整流程。其数据引擎将来自 10 个数据集的 143 万个标准化视频片段转换为统一的逐帧对齐格式,涵盖视觉观测、度量相机几何、字幕、质量元数据、筛选决策和数据来源。统一的相机条件控制、训练和推理接口支持 4 个基于 Wan2.2、LTX-2.5 和 MiniMax-H3 的模型,参数规模为 50 亿至 330 亿,同

Cliff:从第一个错误开始学习推理过程奖励

这项研究提出了 Cliff,一种用于改进大语言模型可验证奖励强化学习的奖励塑形方法。研究利用现成的大语言模型识别每条推理轨迹中的第一个错误,并为正确前缀分配正向的词元级优势,为错误之后、已受无效前缀影响的部分提供负向反馈。在 12 个场景的实验中,Cliff 的推理性能比在线策略蒸馏高 15%,比标准 GRPO 高 7%;即使教师模型能力有限,也能取得改进。

AI让“赛博蟑螂”自主识别并躲避危险,准确率最高达93%

研究人员正在开发将AI、传感器和通信设备安装在蟑螂身上的系统,用于灾害现场搜救。背包式设备可以测量蟑螂的心跳、神经信号和身体动作,再由AI分析数据、判断周围环境,并辅助引导蟑螂避开危险区域。在紫外线、化学物质暴露和高温等环境测试中,表现最佳的模型达到93%的识别准确率,研究人员还成功引导蟑螂逃出迷宫。相关技术已进入灾区测试,但进入钢筋混凝土建筑后容易出现通信不稳定。其他研究则关注为昆虫提供水下活动

匹配需要双方协同:基于强化学习的协同进化生成式检索器

这项研究提出了 CoGR,一种让语言模型同时为查询和检索项生成紧凑关键词表示的检索框架。这些表示通过倒排索引直接匹配,因此能够兼容现有的关键词检索基础设施。在监督式微调之后,协同进化强化学习交替优化查询侧和项目侧生成器。与10种稀疏、稠密和生成式检索基线相比,CoGR在内部应用市场数据集和公开WANDS基准上均取得最佳表现,F1值较最强基线分别提升10.9%和36.1%。