循环语言模型提升组合式工具调用能力
一项研究考察了循环语言模型在复杂工具使用场景中的表现。这类任务要求模型协调多次 API 调用、维护中间状态,并保留工具交互之间的依赖关系。在 API-Bank、BFCL 和 NESTful 测试中,循环计算通常能提升多步骤及依赖感知工具调用的准确率,但对单独 API 调用的提升较小且依赖具体模型。自适应推理只在必要时增加计算量,因此在计算成本与性能之间取得了更好的平衡。
AI 新闻中心 过去一年分析了 1376 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
一项研究考察了循环语言模型在复杂工具使用场景中的表现。这类任务要求模型协调多次 API 调用、维护中间状态,并保留工具交互之间的依赖关系。在 API-Bank、BFCL 和 NESTful 测试中,循环计算通常能提升多步骤及依赖感知工具调用的准确率,但对单独 API 调用的提升较小且依赖具体模型。自适应推理只在必要时增加计算量,因此在计算成本与性能之间取得了更好的平衡。
SPADE是一种强化学习框架,让同一个大语言模型同时承担两种角色:设计可执行的训练环境,并作为推理智能体在其中学习行动。每个环境都包含状态转移、奖励函数和验证代码,能够覆盖推理任务以及多步骤工具使用。在最高300亿参数的模型上,SPADE在数学、科学、代码和推理等八项留出测试中,平均比采用固定环境的强基线高5.3分。在工具使用任务上,BFCL-v4提升5.7分,ACEBench-Agent提升13
SkillForge 是一个从代码仓库中主动获取项目特定知识的框架,用于提升基于大语言模型的软件代理解决问题的能力。它通过重新实现已有测试覆盖的核心功能来生成合成问题,再通过解决这些问题,将知识蒸馏为可复用、并与相关仓库实体关联的技能。使用开源和闭源语言模型进行的实验表明,SkillForge 在自动化软件问题解决方面持续优于多种强基线方法。
FACET 是一个面向 AI 智能体训练的可执行终端任务规模化生成框架。它将相关智能体技能重构为一致的场景,先构建并修复执行环境,再生成任务指令、参考解法和验证器。共享容器状态为这些产物提供统一的可执行基础。基于执行的验证和针对性修复能够纠正单个产物的错误,无需重新生成已经有效的部分。实验表明,FACET 生成的任务及其成功轨迹可以提供高效、节省数据的监督信号,并提升不同规模模型在 Termina
人工智能系统越来越能够参与数学研究,但前沿模型的推理能力和数学专家的审查时间都十分有限。FAR(Find、Attempt、Recommend)系统让专家指定研究方向,而不是预先选择单个问题,以缓解这一瓶颈。系统从广泛的文献库中搜索未解决问题,尝试寻找解答,并将有潜力的结果优先提交人工审查。在组合数学试点中,FAR分析了5,245篇论文,找出6,453个猜想或开放问题,并筛选出4,717个看似定义清
在最近访问 Generalist AI 时,作者看到一只机械臂进行即兴操作,并把香蕉当作工具使用。这项演示暗示机器人实时学习和适应的能力可能取得进展,但没有提供充分的技术细节,也缺乏独立的性能验证。
OpenAI 正在测试一项名为“Private Safety Processing”的技术,旨在保持零数据保留保护的同时,识别潜在的滥用模式。OpenAI 表示,该方法可能使公司无需保存企业客户数据,也能更安全地提供其最先进的模型。目前已有早期客户参与测试。
LEGO-RL 是一个将编程代理原生 Harness 接入可扩展策略梯度训练的框架,同时无需修改其内部控制流程。该框架通过进程内 LLM 代理、可扩展的沙箱编排和集成监控,解决环境崩溃与奖励投机导致的信号失真,以及训练与推理之间的不一致。研究人员使用 GSPO 训练 Qwen3.5-35B-A3B,并在三种 Harness 上进行评估。在 SWE-bench Verified 上,OpenHand
PTXBench是一套用于评估和适配大型语言模型的基准测试,旨在利用架构专用PTX优化GPU内核。它在H100和B200 GPU上测量功能正确性、选定目标指令是否在运行时实际执行,以及相对于领先库的加速效果。评估显示,模型能力仍不均衡:在复杂的注意力反向传播工作负载上,成功率明显下降;而执行目标指令也不一定能带来有竞争力的性能。没有任何受测模型能在整套测试中持续达到领先库的水平。对Qwen3.6-
Rob Strechay 此前担任 theCUBE Research 董事总经理兼首席分析师,现加入 VentureBeat,成为该公司的首位首席分析师,也是 VentureBeat Research 的创始分析师之一。他将负责云和数据基础设施、平台工程、DevOps 编排与可观测性,以及 AI 与企业安全交叉领域的研究。该研究计划面向正将生成式 AI 从试验阶段推进到生产部署的企业,重点分析多供
AI 研究员李飞飞表示,包括她自己在内的科技从业者,需要更清楚地向公众解释人工智能能够带来的实际价值。她警告,美国社会不断升温的反 AI 情绪可能给全球带来风险。近一年来,美国多地对 AI 数据中心的抵制增加,争议主要集中在水资源和能源消耗上。皮尤研究中心调查显示,随着 AI 越来越多地进入日常生活,一半美国人对此的担忧超过了期待。李飞飞认为,许多亚洲国家更积极的态度,部分源于从基础教育阶段就重视
中国移动首个整合通信、计算与人工智能的天基载荷,搭载可重复使用的朱雀三号火箭成功进入轨道。该载荷由中国移动联合中国科学院计算技术研究所、鸿擎科技研发,采用全国产化软硬件体系,内置轻量化星载核心网和智能体。后续将开展星地智能组网、通信与计算及人工智能融合,以及新型卫星通信业务等在轨测试。项目还计划验证大模型实时推理和智能遥感数据处理,为低轨太空算力及天地一体化算力网络研究积累实测数据。
DiSCO是一种面向文本生成图像模型的零样本安全防御方法,完全以黑盒方式在提示词层面运行。该方法无需重新训练、微调或访问模型内部,因此可以应用于专有模型。DiSCO通过束搜索扩展提示词后缀,并利用目标模型自行生成的安全和不安全图像池进行对比评分,再根据反馈迭代调整,直到生成安全内容。在I2P基准测试中,研究人员报告称,该方法使未部署防御的模型攻击成功率降低37.7%,使已有防御的模型降低25.13
PixRestore 是一种不依赖 VAE 的 Diffusion Transformer,可直接在像素空间中修复受损图像。不同于依赖预训练文生图模型的方法,该模型完全从头训练。它在经过分块处理的像素上执行流匹配,以保留细节,并根据不同的图像退化类型调整特征条件。研究人员还使用基于 DINO 的训练目标,将模型微调为单步推理版本,以提高效率。论文称,约 5000 万参数的模型在公开基准和真实世界测
人工智能评测实验室Irregular发布报告,说明其在一系列事件中的作用。据称,相关AI模型曾攻破现实中的计算机系统。但该报告受到批评,外界认为公司仍未充分回答攻击如何发生、采取了哪些安全措施以及责任应如何划分等关键问题。