BDH-CQ:结合循环潜在推理的上下文学习
BDH-CQ是一种将上下文学习与循环潜在处理相结合的推理模型。在推理过程中,输入会持续更新循环记忆,模型随后在高维潜在空间中通过迭代计算解决查询,而不会用语言表达中间推理过程。在公开的ARC-AGI-1评测集上,一个拥有1.5亿参数的配置以每项任务0.0007美元的计算成本取得了29.5%的pass@2成绩。该结果突破了此前公布的成本—准确率帕累托前沿,在基准测试的成本效率方面创下新的最佳水平。
AI 新闻中心 过去一年分析了 1372 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
BDH-CQ是一种将上下文学习与循环潜在处理相结合的推理模型。在推理过程中,输入会持续更新循环记忆,模型随后在高维潜在空间中通过迭代计算解决查询,而不会用语言表达中间推理过程。在公开的ARC-AGI-1评测集上,一个拥有1.5亿参数的配置以每项任务0.0007美元的计算成本取得了29.5%的pass@2成绩。该结果突破了此前公布的成本—准确率帕累托前沿,在基准测试的成本效率方面创下新的最佳水平。
RoMeRL 是一种用于管理自进化大语言模型智能体记忆的方法。它用按结果极性和记忆动态组织的固定维度任务记忆状态,取代不断扩大的轨迹索引效用空间。这样可以将反馈集中到有限的效用坐标上,并减少共同检索的无关记忆获得错误奖励更新的问题。在 ALFWorld 和 LifelongAgentBench 上的实验中,RoMeRL 提升了任务表现,使 Cold-Q 比率降低 80.0%,反馈密度提高约 6 倍
最新研究成果描绘了迄今为止最为详细的精神分裂症遗传结构图景之一。这些发现可能为该疾病的研究开辟新的方向。
Ego-OSCAR是一款低成本头戴式立体惯性采集设备,用于在日常环境中收集第一视角数据。系统结合了硬件同步的全局快门立体摄像头、六轴IMU、嵌入式Linux单板计算机和实时微控制器,每台设备的物料成本低于200美元。项目同时开源完整软件栈、硬件设计,以及约550小时带标注的立体视频和同步IMU数据。数据包含开放词汇的动作描述和逐帧三维手部重建结果。该系统不追求达到Project Aria等研究级设
据报道,Anthropic尚未公开的研究版Claude在探索黎曼猜想时,将黎曼ζ函数临界线上零点比例的已知下界从41.6%提高到67.2%。这并不意味着黎曼猜想已有67.2%得到证明。报道称,Claude协调了约60个子代理,进行文献检索、经典方法重组和结果验证。不过,这一说法尚未得到正式发表论文或独立研究的确认,因此其对未来科研流程的实际影响仍不确定。
一项新研究将视觉语言落地定义为视觉指涉文本片段与图像中实例级区域之间的双向对应。与传统方法不同,该方法不假设相关文本片段已经被预先标注。研究提出的 ConCor-1 模型利用可学习的桥接标记,预测文本掩码、图像掩码以及对应关系是否存在。研究人员还将多个落地和分割数据集转换为统一的对应格式。在实验中,ConCor-1 在长描述数据集上的对应 F1 指标较基线提升 48%;在以大型类别列表作为文本输入
在实时交互式虚拟环境中开发具备认知能力的具身智能虚拟代理,仍是一项技术挑战。本文提出 CEAA,一种面向实现的模块化架构,建立在 Sense-Think-Act 范式和 Belief-Desire-Intention 认知模型等既有框架之上。该架构旨在弥合高层推理模型与三维交互环境中实时具身执行之间的差距,为部署具备可扩展性、适应性和可解释性的虚拟代理提供可复用的模板。
一项研究发现,主要 LLM 提供商在客户端处理加密思维链数据时存在架构漏洞。这些加密区块似乎可以在同一提供商的不同会话、用户和模型之间互换。攻击者可将更强模型生成的推理轨迹注入较弱且防护较少的模型,迫使后者解码并以明文输出隐藏推理。研究人员已在 Anthropic、OpenAI 和 Google 的系统中验证这一方法。他们分析了从公开代码库获取的 315,320 个推理区块,找出 367 条个人身
A^2E 是一款面向智能体运行框架的端到端评估引擎。其智能体任务协议支持将评估任务快速接入不同框架,并通过自动插桩的监控器采集标准化执行轨迹。系统不只评估正确性,还从执行效率、工具使用、任务规划和错误恢复等多个维度衡量框架能力。实验表明,模型与框架的组合在不同任务类型上的表现差异明显,没有任何组合能在所有任务中持续领先。相关代码已在 GitHub 开源。
美国科研团队将张拉整体滚动机器人 Tribar 从5.7米高的桥上摔落至沥青路面。机器人仍保持运行,通过机载传感器识别自身姿态并自主复位,随后继续滚动。它由三根轻质刚性杆件和弹性绳索网络组成,可分散坠落冲击,在无需额外缓冲外壳的情况下保护电路板和电机。Tribar 能适应草地、砂石、冰面和沙地,攀爬最高28度的坡面,并自主完成直线或曲线导航。相关研究已发表于《自然·机器智能》,未来可能用于行星探测
一项新研究将可解释性作为训练流程中的约束,而不是在模型完成后再进行分析。研究人员在三个数量级的计算规模上,对自回归和扩散式语言模型进行了实验,结果表明,可解释性可能与模型能力同步提升。研究中的扩散式模型 Steerling-8B 能将生成的词元归因于相关输入词元、人类可理解的概念以及训练数据。这使系统能够诊断输出、检索相似训练数据,并通过概念引导修正模型行为,无需重新训练。研究称,Steerlin
Agent Memory Distillation(AMD)是一种无需训练的框架,通过分层记忆将大型教师智能体的结构化知识传递给小型语言模型。工作流记忆编码任务级策略,子任务记忆提供具体行为示例,函数记忆则记录函数调用规范和常见错误。在三个工具使用基准测试中,研究使用 GPT-5-mini 作为教师,评估了四个参数规模为 4B 至 8B 的学生模型。AMD 使平均准确率分别提升 27.2、11.2
OasisKV是一套旨在降低大语言模型推理内存需求的研究系统。在解码过程中,它只将对注意力计算最重要的KV缓存条目保留在高带宽内存(HBM)中,并从主机内存或远程内存等容量更大的存储层预取其他条目。系统利用推测解码生成的前瞻令牌,预测下一步所需的KV块。基于vLLM实现的原型在2048个令牌的KV预算下,相比完整注意力的准确率差距控制在0.7个百分点以内。与密集型vLLM相比,OasisKV在推理
研究人员提出因子化假设搜索(FHS),用于改进大型分类体系中的检索,尤其适用于输入内容仅间接表达目标概念的情况。例如,表格单元格的含义可能取决于其行、列、数据类型和上下文。FHS围绕多个命名语义维度维护部分解释,并结合结构化查询生成、多假设检索以及维度级候选验证。在金融分类体系标注和CodiEsp临床编码任务中,FHS在不依赖预知答案的方法中取得了最佳的Recall@1、平均倒数排名(MRR)和最
Ouroboros是一套智能体框架,通过经审查的提交持续改进工具、提示词、上下文组装方式和核心实现,并将这些变更用于后续运行。其演化既可以递归进行,也可以由日常工作和社会互动中发现的缺陷与低效问题推动。开发者表示,使用Opus 5的一次运行在Terminal-Bench 2.1、OSWorld-Verified和CL-Bench上取得了目前已报告的最高成绩。公开记录中的部署“Hope”已在独立分支