ContextPilot:通过细粒度强化学习训练智能体主动管理上下文
ContextPilot 是一个面向长期智能体任务的主动式上下文管理框架。它在现有工具基础上加入规划、长期记忆和灵活的上下文卸载功能,并提出专用强化学习方法,用于识别关键编辑决策,更准确地评估各项操作对最终结果的贡献。在长上下文问答和深度搜索实验中,ContextPilot 在使用更紧凑工作上下文的同时,在多种基础模型和基准测试上持续优于现有方法。代码已公开。
AI 新闻中心 过去30天分析了 1114 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
ContextPilot 是一个面向长期智能体任务的主动式上下文管理框架。它在现有工具基础上加入规划、长期记忆和灵活的上下文卸载功能,并提出专用强化学习方法,用于识别关键编辑决策,更准确地评估各项操作对最终结果的贡献。在长上下文问答和深度搜索实验中,ContextPilot 在使用更紧凑工作上下文的同时,在多种基础模型和基准测试上持续优于现有方法。代码已公开。
研究人员推出 ElephantBench,这是一套可复现的基准测试,用于评估大语言模型是否保留罕见事实的不同说法。数据集包含1,094个问题,通过可审计的图谱式流程,从存在自然分歧的网络文档中生成。所有答案都与原始文档及权威公开来源进行核验,并由人工标注员审查。在测试的32个模型中,即使表现最好的模型,也只在52.4%的问题上同时找回两种说法。在其余大多数情况下,模型只记住一种说法而遗漏另一种。扩
据外媒 Android Headlines 报道,微软正加强内部 Token 使用监控,以降低 AI 成本。一份泄露的内部表格据称显示,一名员工在 28 天内产生了约 2.8 万美元的 Token 费用。在约 350 名自愿提交月度使用数据的美国员工中,费用中位数约为 300 美元。CoreAI 部门的月度费用中位数最高,约为 975 美元,个人最高支出达到 1.6 万美元。微软据报将加强对异常高
据报道,字节跳动原计划于 8 月推出的豆包大模型 2.2 将推迟发布。消息人士称,公司希望通过更充分的预训练和后训练,重点提升模型的编程、工具调用和 Agent 能力。2.2 被视为连接现有模型与下一代超大模型的关键补强版本。报道称,即使短期内落后竞争对手,字节跳动仍将坚持自研大模型,不依赖模型蒸馏技术。目前,字节跳动尚未正式确认延期消息。
华为云与上海瑞金医院发布了病理基础模型 RuiPath 2.0,参数规模为70亿,覆盖19种常见癌症和205项诊断任务。开发方称,该模型在59项下游诊断任务中的42项达到行业领先水平。模型新增组织学亚型、浸润深度和核分裂象等可解释性标识,提升诊断结果的透明度和可追溯性。针对罕见疾病数据不足的问题,双方利用多模态模型生成合成训练数据,并公布了96.48%的淋巴瘤诊断准确率。此外,双方还推出了拥有20
科技媒体 TestingCatalog 称,OpenAI 正通过新增的“mozaik-alpha-fdm”测试阶段,扩大内部开发模型 Astra 的测试范围。Astra 尚未被官方确认是 GPT-6,但多家媒体和业内消息认为,它可能是 GPT-6 的代号或候选名称。未经证实的信息称,Astra 在数学、物理、生物、医学、化学和网络安全等领域取得了明显进展。网友分享的测试内容显示,该模型据称只需一次
OpenAI 计划在 11 月前终止 Cursor 对其模型的访问权限。这一决定成为 OpenAI 首席执行官萨姆·奥特曼与埃隆·马斯克长期争端中的最新冲突点。
索尼音乐出版与华纳音乐出版已起诉Anthropic及其高管达里奥·阿莫代和本杰明·曼。两家音乐出版商指控,Anthropic在训练Claude大型语言模型时使用了数万首受版权保护的歌曲。
AI编程平台Cursor联合创始人迈克尔·特鲁尔表示,OpenAI仅占Cursor流量的约5%。他说,Cursor曾相信OpenAI会以中立的模型供应商身份行事。OpenAI已宣布将终止向Cursor提供AI模型的合同。另一方面,埃隆·马斯克表示,他根本不在乎这场争议。
据 TechCrunch 报道,英伟达可能以约 130 亿美元收购开放权重 AI 模型平台 Hugging Face,但交易尚未得到确认。Hugging Face 被视为“AI 时代的 GitHub”,为模型开发、分享和部署提供生态。英伟达近期持续向开放模型领域投入巨额资金,而 OpenAI 和谷歌也在研发自有 AI 芯片。若收购完成,英伟达将直接获得庞大的开发者用户群,并有望推动其模型、芯片和技
开发者 Sebastien Guillemot 表示,他在测试 AI 智能体自动清理临时文件的防护机制时,Claude 删除了约 700GB 数据,包括整个用户主目录。据称,Anthropic 的执行环境因判断任务风险较高而自动切换模型。安全测试本身正确识别出 /tmp 和主目录属于危险删除目标,但测试逻辑与清理逻辑复用了同一个变量名,导致测试结束后的清理操作意外指向主目录。Guillemot 通
并非所有 AI 模型都相同。本文介绍专有模型、开放权重模型与真正开源 AI 之间的区别。大型语言模型在能力、使用成本、可访问性和定制难度方面可能存在差异。了解这些区别,有助于用户根据自身需求选择合适的模型。
在个人电脑上安装大型语言模型,可以获得便捷的数字助手,同时更好地保护数据隐私。
OpenAI 计划停止向 Cursor 提供 AI 模型。此前,SpaceX 已收购这款编程工具背后的初创公司 Anysphere。OpenAI 称,马斯克旗下企业过去曾有违反合同的情况,因此无法确信 SpaceX 会遵守服务条款。马斯克随后在 X 上抨击 OpenAI CEO 奥尔特曼和总裁布罗克曼,指责两人“偷走了一个开源非营利组织”。Cursor 联合创始人迈克尔·特鲁埃尔表示,公司正与 O
国光量子发布了玄幂 Xenomi 大模型家族,称其将量子技术融入大语言模型的决策与推理过程。该系列面向科研和学术场景,支持科研科普、路由和智能体决策等任务。公司表示,在特定任务中,玄幂相比主流开源模型具备更稳定的专业理解、更清晰的任务判断和更短的决策路径。玄幂据称已应用于量子计算智能实验平台和多智能体系统,支持文献检索、实验策划、混合编程、量子任务调度、数据分析及报告生成。不过,公告没有提供独立基