Recuris推动长期任务AI代理的记忆递归演化
Recuris是一种面向长期任务AI代理的经验记忆与工作记忆架构。工作记忆负责跟踪任务进度,并从经验记忆和技能记忆中选择相关技能,而不是依赖完整的交互历史。系统利用执行数据定位失败原因,并进行经过验证的记忆更新。在四项基准测试和十个模型上,作者报告称,已完成的37个模型—基准组合中有35个实现了任务成功率提升。在tau-bench上,GPT-5.6 Sol提升17.8个百分点,Claude Opu
AI 新闻中心 过去一年分析了 504 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
Recuris是一种面向长期任务AI代理的经验记忆与工作记忆架构。工作记忆负责跟踪任务进度,并从经验记忆和技能记忆中选择相关技能,而不是依赖完整的交互历史。系统利用执行数据定位失败原因,并进行经过验证的记忆更新。在四项基准测试和十个模型上,作者报告称,已完成的37个模型—基准组合中有35个实现了任务成功率提升。在tau-bench上,GPT-5.6 Sol提升17.8个百分点,Claude Opu
据报道,英伟达计划投入最多60亿美元,打造全球最强大的开源人工智能模型之一。《华尔街日报》称,英伟达将获得Poolside的技术授权,并把100多名员工投入Nemotron项目。英伟达还据称将向Poolside追加10亿美元投资,该公司的投前估值可能高达120亿美元。该项目旨在与DeepSeek、Kimi等开源AI企业,以及OpenAI和Anthropic等前沿实验室竞争。目前,相关投资金额和项目
OpenAI 和谷歌正面临人工智能人才流失,但两家公司受到的影响似乎并不相同。与此同时,英伟达将再投入 60 亿美元支持开放权重模型。稀有书籍经销商也看到人工智能时代带来的销售增长,但他们对这一趋势仍持矛盾态度。
据 ModelScope 信息,阿里巴巴计划于 8 月 26 日 23:00(北京时间)开源 Qwen3.8-Flash-Next。页面显示,此次将发布 Qwen3.8-Flash-Next 和 Qwen3.8-Flash-Next-FP8 两个版本。官方称,Qwen3.8-Flash-Next 是基于下一代 Qwen4 架构构建的多模态混合专家模型。阿里巴巴表示,提前公开这些架构改进,是为了帮助
该研究针对检索增强生成(RAG)的两个瓶颈:证据利用率难以准确测量,以及上下文预算分配效率低下。作者提出一种因果留一法探针,用于分离每条证据对生成答案的实际贡献。实验表明,与单纯扩展单一上下文相比,将计算资源迭代分配到多次连续生成中,可使组合召回率提升16.7至20.5个百分点,并且在参数规模最高达320亿的模型上仍表现稳定。研究还构建了一个闭环调度器,结合因果反馈和归因引导的解码机制,推动模型整
研究提出了一种名为量化感知修复(QAH)的方法,用于在部署前恢复经过结构化压缩并量化为 4 位的大语言模型性能。与传统的量化感知训练不同,QAH 直接从未压缩的原始模型向 4 位学生模型进行知识蒸馏。在 GPT-OSS 120B 缩减至 60B、再转换为 MXFP4 的流程中,开放权重模型 Hypernova-60B 在 9 项基准测试中的 7 项达到或超过了 bfloat16 源模型,同时将权重
Industrial-Instruction 提出了两个开放问答数据集,以及一套将工业技术报告转化为训练和评测数据的完整流程。研究使用 906 份公开的松下文档,共 7,525 页,结合版面感知提取、语义检索和基于证据的选择题生成。经过筛选后,每个数据集约包含 13,600 组问答,并提供来源文档和独立的基准测试集。对参数量低于 100 亿的小型开放权重大语言模型进行微调后,松下基准测试的 Set
微软研究人员推出Thinkingbox,这是一个用于评估AI智能体的沙盒和基准测试,重点关注会修改后端持久状态的多步骤业务任务。Thinkingbox-bench包含507个受政策约束的工作流,覆盖零售、酒店、汽车保险、银行和IT支持等领域。系统通过可执行检查验证正确的状态转换,并拒绝缺失、错误或意外的影响。表现最强的模型在pass@1上达到65.36%,但pass^20仅为25.25%。结果表明
一项研究提出环境正则化策略优化(ERPO),作为大语言模型训练中传统 Policy-KL 正则化的替代方案。ERPO 通过 Query-KL 项限制训练查询分布的偏移,同时不对响应分布施加直接的梯度压力,从而在提升训练稳定性的同时保留探索能力。该方法无需额外的前向传播,即可接入 GRPO、PPO 和 REINFORCE 类训练流程。在六项数学推理基准测试中,作者报告称,ERPO 提高了准确率,并在
带搜索功能的 LLM 越来越多地利用实时网络内容进行商品推荐,因此可能被经过操纵的网页误导,成为虚假商品的无意推广者。研究团队推出 FORGE 基准测试,将检索网页中的真实商品替换为虚假商品,以评估模型的脆弱性。研究覆盖 225 件商品、15 个类别、5 种消费场景,以及 12 个商业和开放权重模型。结果显示,所有模型都存在漏洞:仅一张被污染的网页就能使虚假推荐率最高达到 27%;将排名前三的网页
一项研究分析了自动语音识别(ASR)错误如何影响执行多跳推理的语音检索增强生成(RAG)系统。研究人员使用四种英语口音、三个多跳问答基准和四种 RAG 配置,测试了实体图链接与迭代式查询改写。结构更复杂的配置通常取得更高的绝对 F1 分数,但与基础密集检索相比,它们使干净文本与含 ASR 错误输入之间的性能差距扩大了 36% 至 67%。查询实体被破坏是主要失败原因。两种轻量级表面形式修正只能弥补
据《华尔街日报》报道,中国 AI 模型与美国头部模型的差距已缩小至数个月。报道认为,这并非源于短期突然出现的技术突破,而是清华大学等高校长期形成的人才网络、开源技术、海外人才回流以及更高的算力利用效率共同推动的结果。智谱 AI 联合创始人唐杰、月之暗面创始人杨植麟和 DeepSeek 创始人梁文锋,是其中具有代表性的关键人物。DeepSeek 通过多头潜在注意力机制和混合专家模型降低了内存消耗与计
Prime Agent 是一个开源 harness,用于评估长时程 AI 智能体并支持编程智能体工作流。它将基于递归语言模型概念的持久化 IPython REPL,与可在多次运行轨迹之间保留历史、记忆、技能、提示词和子智能体规范的持续型 harness 结合起来。递归子智能体可以直接通信,Agents View 则允许人工检查和管理由后台服务支持的会话。该系统统一执行、恢复、验证和资源核算,同时将
研究人员表示,中国黑客将DeepSeek及其他开源人工智能模型整合到其行动中后,正在加大攻击力度。这表明,攻击者即使使用基础AI工具,也能提升针对海外目标的攻击能力。
美国法律 AI 独角兽 Harvey 宣布推出 Harvey Tenet。这款法律专用模型基于月之暗面的开放权重模型 Kimi K3,并通过后训练技术开发。据称,这是中国开放权重模型首次进入美国头部垂直 AI 公司的训练体系。Harvey 此前主要依赖 OpenAI、Anthropic 等闭源模型提供法律服务,覆盖超过 2400 家机构和 20 多万名律师。公开信息显示,Harvey 当前估值约为