AI 新闻中心

AI 新闻中心 过去一年分析了 1376 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。

循环语言模型提升组合式工具调用能力

一项研究考察了循环语言模型在复杂工具使用场景中的表现。这类任务要求模型协调多次 API 调用、维护中间状态,并保留工具交互之间的依赖关系。在 API-Bank、BFCL 和 NESTful 测试中,循环计算通常能提升多步骤及依赖感知工具调用的准确率,但对单独 API 调用的提升较小且依赖具体模型。自适应推理只在必要时增加计算量,因此在计算成本与性能之间取得了更好的平衡。

SPADE:在自适应合成可执行环境中进行自博弈

SPADE是一种强化学习框架,让同一个大语言模型同时承担两种角色:设计可执行的训练环境,并作为推理智能体在其中学习行动。每个环境都包含状态转移、奖励函数和验证代码,能够覆盖推理任务以及多步骤工具使用。在最高300亿参数的模型上,SPADE在数学、科学、代码和推理等八项留出测试中,平均比采用固定环境的强基线高5.3分。在工具使用任务上,BFCL-v4提升5.7分,ACEBench-Agent提升13

SkillForge:通过自蒸馏代理解决项目特定的软件问题

SkillForge 是一个从代码仓库中主动获取项目特定知识的框架,用于提升基于大语言模型的软件代理解决问题的能力。它通过重新实现已有测试覆盖的核心功能来生成合成问题,再通过解决这些问题,将知识蒸馏为可复用、并与相关仓库实体关联的技能。使用开源和闭源语言模型进行的实验表明,SkillForge 在自动化软件问题解决方面持续优于多种强基线方法。

FACET:在终端任务合成中保留源意图与可执行状态

FACET 是一个面向 AI 智能体训练的可执行终端任务规模化生成框架。它将相关智能体技能重构为一致的场景,先构建并修复执行环境,再生成任务指令、参考解法和验证器。共享容器状态为这些产物提供统一的可执行基础。基于执行的验证和针对性修复能够纠正单个产物的错误,无需重新生成已经有效的部分。实验表明,FACET 生成的任务及其成功轨迹可以提供高效、节省数据的监督信号,并提升不同规模模型在 Termina

问题就是问题:迈向可扩展的数学发现

人工智能系统越来越能够参与数学研究,但前沿模型的推理能力和数学专家的审查时间都十分有限。FAR(Find、Attempt、Recommend)系统让专家指定研究方向,而不是预先选择单个问题,以缓解这一瓶颈。系统从广泛的文献库中搜索未解决问题,尝试寻找解答,并将有潜力的结果优先提交人工审查。在组合数学试点中,FAR分析了5,245篇论文,找出6,453个猜想或开放问题,并筛选出4,717个看似定义清

LEGO-RL:面向编程代理的原生 Harness 强化学习

LEGO-RL 是一个将编程代理原生 Harness 接入可扩展策略梯度训练的框架,同时无需修改其内部控制流程。该框架通过进程内 LLM 代理、可扩展的沙箱编排和集成监控,解决环境崩溃与奖励投机导致的信号失真,以及训练与推理之间的不一致。研究人员使用 GSPO 训练 Qwen3.5-35B-A3B,并在三种 Harness 上进行评估。在 SWE-bench Verified 上,OpenHand

PTXBench评估并适配使用架构专用PTX进行GPU内核优化的LLM

PTXBench是一套用于评估和适配大型语言模型的基准测试,旨在利用架构专用PTX优化GPU内核。它在H100和B200 GPU上测量功能正确性、选定目标指令是否在运行时实际执行,以及相对于领先库的加速效果。评估显示,模型能力仍不均衡:在复杂的注意力反向传播工作负载上,成功率明显下降;而执行目标指令也不一定能带来有竞争力的性能。没有任何受测模型能在整套测试中持续达到领先库的水平。对Qwen3.6-

VentureBeat 任命 Rob Strechay 为首位首席分析师,扩大企业 AI 研究

Rob Strechay 此前担任 theCUBE Research 董事总经理兼首席分析师,现加入 VentureBeat,成为该公司的首位首席分析师,也是 VentureBeat Research 的创始分析师之一。他将负责云和数据基础设施、平台工程、DevOps 编排与可观测性,以及 AI 与企业安全交叉领域的研究。该研究计划面向正将生成式 AI 从试验阶段推进到生产部署的企业,重点分析多供

李飞飞:科技行业应更清楚地向公众说明 AI 的价值

AI 研究员李飞飞表示,包括她自己在内的科技从业者,需要更清楚地向公众解释人工智能能够带来的实际价值。她警告,美国社会不断升温的反 AI 情绪可能给全球带来风险。近一年来,美国多地对 AI 数据中心的抵制增加,争议主要集中在水资源和能源消耗上。皮尤研究中心调查显示,随着 AI 越来越多地进入日常生活,一半美国人对此的担忧超过了期待。李飞飞认为,许多亚洲国家更积极的态度,部分源于从基础教育阶段就重视

中国移动首个整合通信、算力与人工智能的天基载荷成功入轨

中国移动首个整合通信、计算与人工智能的天基载荷,搭载可重复使用的朱雀三号火箭成功进入轨道。该载荷由中国移动联合中国科学院计算技术研究所、鸿擎科技研发,采用全国产化软硬件体系,内置轻量化星载核心网和智能体。后续将开展星地智能组网、通信与计算及人工智能融合,以及新型卫星通信业务等在轨测试。项目还计划验证大模型实时推理和智能遥感数据处理,为低轨太空算力及天地一体化算力网络研究积累实测数据。

DiSCO:通过分布引导的对比式提示词优化防御文本生成图像

DiSCO是一种面向文本生成图像模型的零样本安全防御方法,完全以黑盒方式在提示词层面运行。该方法无需重新训练、微调或访问模型内部,因此可以应用于专有模型。DiSCO通过束搜索扩展提示词后缀,并利用目标模型自行生成的安全和不安全图像池进行对比评分,再根据反馈迭代调整,直到生成安全内容。在I2P基准测试中,研究人员报告称,该方法使未部署防御的模型攻击成功率降低37.7%,使已有防御的模型降低25.13

PixRestore:基于像素扩散 Transformer 的统一图像修复

PixRestore 是一种不依赖 VAE 的 Diffusion Transformer,可直接在像素空间中修复受损图像。不同于依赖预训练文生图模型的方法,该模型完全从头训练。它在经过分块处理的像素上执行流匹配,以保留细节,并根据不同的图像退化类型调整特征条件。研究人员还使用基于 DINO 的训练目标,将模型微调为单步推理版本,以提高效率。论文称,约 5000 万参数的模型在公开基准和真实世界测