CAFE:自我改进的搜索智能体需要共同演化的反馈
CAFE(Coupled Agent–Feedback Evolution)通过交替训练搜索智能体和批评器,使二者共同改进。该框架学习智能体应在何时请求反馈,以及如何利用反馈在错误累积前修正正在进行的搜索轨迹。它结合在线强化学习与离线偏好优化,从成功和失败的轨迹中学习反馈策略。在七项智能体搜索基准测试中,CAFE平均优于所评估的基于强化学习的搜索智能体,在六项域外基准测试中保持性能提升,并减少了答
AI 新闻中心 过去一年分析了 1731 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
CAFE(Coupled Agent–Feedback Evolution)通过交替训练搜索智能体和批评器,使二者共同改进。该框架学习智能体应在何时请求反馈,以及如何利用反馈在错误累积前修正正在进行的搜索轨迹。它结合在线强化学习与离线偏好优化,从成功和失败的轨迹中学习反馈策略。在七项智能体搜索基准测试中,CAFE平均优于所评估的基于强化学习的搜索智能体,在六项域外基准测试中保持性能提升,并减少了答
Meta^n是一种递归改进大语言模型代理的方法。它不修改执行自我改进的操作,而是将一个固定操作反复应用于自身生成的结果。系统读取下层求解器堆栈的执行轨迹及生成这些轨迹的代码,然后将下一层构建为策略性预处理流程和可调用辅助函数库。固定操作旨在避免系统失稳,而不断增长的输入则让每一层能够从更高层次进行推理。递归深度由收敛情况决定,进化式存档则搜索不同的层级链。作者称,在两个基础模型和八类基准测试中,M
DiffusionOPSD是一种策略内自蒸馏方法,用于根据人类偏好和特定任务奖励调整扩散模型。该方法将图像级奖励梯度转换为去噪过程中间预测的明确训练目标。在SD 3.5-M和Z-Image-Turbo上的实验中,它在20个奖励匹配设置中的19个取得了最佳最终留出分数。与最强竞争方法相比,性能最高提升44%;相较DiffusionNFT,GPU使用时间在SD 3.5-M上减少40%,在Z-Image
文章称,SpaceX以600亿美元收购了AI编程工具公司Cursor。报道称,埃隆·马斯克在一场面向1000多名Cursor员工的内部会议上承认,SpaceX的AI部门目前落后于Anthropic等竞争对手,并要求进一步扩大算力投入。Cursor据称获得了更多招聘预算,用于开发对标GitHub的Origin项目,以及推进与Grok和AI智能体相关的研发。整合过程中,多名高管和核心成员据称离职,公司
据报道,英伟达计划投入最多60亿美元,打造全球最强大的开源人工智能模型之一。《华尔街日报》称,英伟达将获得Poolside的技术授权,并把100多名员工投入Nemotron项目。英伟达还据称将向Poolside追加10亿美元投资,该公司的投前估值可能高达120亿美元。该项目旨在与DeepSeek、Kimi等开源AI企业,以及OpenAI和Anthropic等前沿实验室竞争。目前,相关投资金额和项目
中科天塔研发的航天垂直大模型“华山”健康管理模块,已在“辰光一号”技术试验卫星上完成全流程在轨实战验证。系统采用多类时序神经网络和包络算法,完成了训练、评估与预测任务,具备遥测数据解析、异常检测、趋势预测和自主决策能力。不同于传统的“地面训练、星上推理”模式,“华山”实现了数据采集、星上训练、风险预警和健康评估的闭环。该方案有望减少原始遥测数据下传量,缓解天地通信带宽压力,并降低未来低轨大型卫星星
Stable Diffusion图像生成模型开发商Stability AI完成7600万美元B轮融资。主要投资者包括环球音乐集团、索尼音乐集团、华纳音乐集团和游戏公司艺电(EA),AMD Ventures与Pacific Alliance Ventures也参与其中。公司累计融资额已达2.32亿美元。新资金将用于完善覆盖音乐、视频和图像生成的创意制作产品套件,并拓展专业服务业务。此次融资延续了St
一项研究对前缀不变性进行了形式化定义:位置 t 的表示不应依赖未来输入。研究提出的轻量审计只需两次前向传播,无需训练或梯度,即可精确定位因果性失效的位置。仅检查注意力掩码并不充分,因为扫描操作或归一化也可能导致信息泄漏。在针对8个检查点进行的192次故障注入测试中,掩码检查一个问题也没有发现,而该审计定位了全部192个故障。研究还发现了Zamba2和Nemotron-H中的缺陷。
据X用户@synthwavedd发布的消息,OpenAI据称已完成内部代号为Bel的下一代模型预训练。该模型据称拥有超过10万亿个参数,是Doug的直接继任者,并可能成为GPT-6之后的基础模型。消息还称,OpenAI希望让Bel达到接近通用人工智能(AGI)的水平。不过,相关说法目前尚未得到OpenAI官方证实。该用户还推测,Anthropic受算力条件限制,短期内可能面临压力,但预计明年初重新
一项可解释性研究将 AstroPT 用作受控测试平台。AstroPT 是一个使用数百万张星系图像训练的 Transformer,用于检验分析大语言模型的方法。天文学提供了已知的真实基准:研究人员事先知道不同概念的学习难度及其物理关系。几乎直接编码在像素中的属性,例如波段星等,会在训练早期和较浅的网络层中变得可解码。需要推断的属性,例如红移和比恒星形成率,则在更晚阶段、更加深层的网络中出现。这一顺序
Skild AI 发布了机器人基础模型 S1。该公司称,S1 可以通过一次视频演示学习预训练阶段未出现的任务,无需额外微调或训练后处理。公司还表示,该模型能够应对最长约 10 分钟的任务。不过,发布内容没有提供独立基准测试或详细技术验证,因此这些能力目前仍属于公司声明,能否稳定实现还有待外部评估确认。
Stability AI已获得7600万美元的新一轮融资,使公司的累计融资总额达到2.32亿美元。该公司开发了图像生成式人工智能系统Stable Diffusion。
人工智能安全初创公司Alice已筹集1.4亿美元,用于扩大对先进模型的压力测试,并帮助企业应对新出现的风险。首席执行官诺姆·施瓦茨表示,过去由个人实施的威胁正越来越多地被AI放大。近期涉及OpenAI和Anthropic前沿模型的事件进一步提升了外界对这一问题的关注。Alice与AI实验室及企业合作,在漏洞造成现实世界危害之前识别并修复风险。
Anthropic已将Claude Chat与Claude Cowork的记忆系统整合。除非用户选择退出,否则Cowork现在可以访问Claude Chat的聊天记录和已保存信息。记忆会在聊天过程中更新,同时提供用于管理敏感数据的控制选项。
OpenAI 和谷歌正面临人工智能人才流失,但两家公司受到的影响似乎并不相同。与此同时,英伟达将再投入 60 亿美元支持开放权重模型。稀有书籍经销商也看到人工智能时代带来的销售增长,但他们对这一趋势仍持矛盾态度。