DCAS解耦CLI代理脚手架,将规划能力内化到模型中
一项研究分析了为何使用OpenHands轨迹数据微调的CLI软件工程代理,在其他脚手架上部署时性能会显著下降。研究人员认为,这种差距源于脚手架特有的规划行为,并区分了执行前生成的显式计划,以及贯穿代理循环的隐式结构惯例。DCAS是一种拦截层,可在不修改脚手架的情况下连接任意CLI脚手架与后端模型。实验表明,使用包含规划信息的轨迹进行微调,能够提升模型在非训练脚手架上的表现,说明规划能力可以从脚手架
AI 新闻中心 过去一年分析了 1372 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
一项研究分析了为何使用OpenHands轨迹数据微调的CLI软件工程代理,在其他脚手架上部署时性能会显著下降。研究人员认为,这种差距源于脚手架特有的规划行为,并区分了执行前生成的显式计划,以及贯穿代理循环的隐式结构惯例。DCAS是一种拦截层,可在不修改脚手架的情况下连接任意CLI脚手架与后端模型。实验表明,使用包含规划信息的轨迹进行微调,能够提升模型在非训练脚手架上的表现,说明规划能力可以从脚手架
研究人员推出 FaceVid-Forensics-100K,这是一个包含 10 万个深度伪造视频的数据集,覆盖 33 种合成方法,并提供细粒度文本标注。其 ARGUS 框架由四个专门智能体分别分析纹理、光照、运动和物理特征,再由裁决智能体整合结果并生成带解释的判断。研究人员称,该系统完全由小型开源多模态语言模型构成,在域外测试中超过了包括 GPT 和 Gemini 闭源模型在内的所有对比方法,并在
一项研究发现,当系统独立评估并选择词元、句子或文本块时,硬提示压缩可能破坏关键的指涉关系。如果答案被保留,但用于理解答案的实体被删除,就会产生“指涉悬空”。在0.30的压缩率下,多个基准测试中最多有60%的案例出现这一问题。重新插入缺失的支持段落后,准确率提高了29至34个百分点。一个用于自动判断被删除句子是否必要的小型分类器,在压缩率几乎不变的情况下,使HotpotQA准确率提升4.7个百分点。
研究人员使用 Psych-101 训练了14个模型,参数规模从1.35亿到140亿不等。Psych-101包含来自160项实验的1,070万条试次级选择数据。在与训练数据相同的分布内,模型规模影响很小:6亿至10亿参数的模型在未参与训练的受试者上,达到了700亿参数基准模型的相近表现。但在泛化到新任务结构时,更大的模型明显更具优势。诊断测试显示,屏蔽刺激和反馈内容会破坏75.7%的已学习信息,并使
Discovered Materials 已融资 900 万美元,将借助 AI 寻找能够制造出更高效、发热更低芯片的新型材料。
随着研究成果和人工智能辅助论文数量激增,志愿审稿人越来越难以应付。文章探讨现有同行评审体系能否承受由此带来的额外压力。
该综述研究内容所有者、创作者、平台和审计人员可采用的技术措施,以限制视觉内容在人工智能流程中的未经授权使用,或支持事后追责。研究涵盖防止不必要识别的隐私过滤器、阻碍未经授权训练的不可学习样本、防范恶意编辑或模仿的生成式保护机制、控制自动化访问的对抗性 CAPTCHA,以及用于流通后归属追踪的来源机制。作者从可迁移性、适应性和部署成熟度等维度比较了这些方法。研究指出,大多数保护措施主要针对静态或适应
一项实践研究提出了两种提高大语言模型知识蒸馏效率的系统技术。首先,预先缓存教师模型的 Top-K logits,可在不将教师模型保留于 GPU 内存中的情况下进行训练,同时保持与在线蒸馏几乎相同的训练损失。在单张 H200 GPU 上,每次迭代速度提升约 29%,吞吐量最高提升 41%。其次,融合式分块 KL 损失避免生成覆盖完整词表的 logits 张量,从而降低峰值内存使用,并支持在单张 GP
研究人员推出 OneEmo,这是一种用于感知、理解和交互情绪的多模态模型。研究团队构建了 EmoWorld-130K 数据集,通过人工参与流程整理显式推理轨迹;同时提出 Emo-Chord 强化学习方法,以稳定多任务奖励分配。论文实验显示,与规模相近的基线模型相比,OneEmo 在大多数基准测试中达到领先水平。尽管参数量明显少于商业模型,该模型仍取得了具有竞争力的结果。相关代码已在 GitHub
NASA火星车“毅力号”预计将在火星表面累计行驶超过45.16公里,打破由“机遇号”保持的纪录。其高效行驶的关键是车载自主导航系统:摄像头拍摄周围地形,车载计算机通过算法计算更安全的行驶路线。毅力号约90%的行驶距离由自主驾驶完成,而较早的“好奇号”只有约10%的行驶过程能够自主完成。更先进的视觉计算单元可以让探测车在行驶时同步处理图像,减少等待地球发送导航指令的时间。毅力号目前正在耶泽罗陨石坑研
AI 内幕人士 ChrisGPT 声称,OpenAI 将于 8 月发布 GPT-6,并称其就是此前暂停发布的 Astra 模型。该消息还预测,OpenAI 将在年底推出代号为 Doug、规模更大的模型。不过,关于 10 万亿参数、发布时间、英伟达下一代芯片,以及训练能力突破等说法,均未得到独立证实。文章还对 OpenAI、Anthropic 和 Google 的竞争格局,以及 Google 和 D
该研究提出 Skaling 定律,用于扩展现有的语言模型缩放定律。该方法不再假设模型规模和训练数据对损失的影响彼此独立,而是通过单一交互指数对二者进行联合建模。研究结果显示,在插值和外推场景中,平均绝对百分比误差可降低约 1.5 至 3 倍。结合仅覆盖低计算量区域的稀疏网格策略后,Skaling 还能以约为均匀扫描十分之一的计算量,准确外推完整网格的结果。
Modular TTT将测试时训练(TTT)视为一种在线学习问题,通过内部学习规则更新快速权重。该框架把内部学习器表示为有向无环图,并将快速权重网络、损失函数、学习率、权重衰减和归一化设为明确的设计维度。它可以自动将基本的训练视图和查询视图规则组合成完整的TTT计算,从而系统分析各个组件的作用。研究发现,较小的初始学习率、权重衰减和单层非线性有助于提升性能。更深的快速权重网络和归一化往往会因产生过
ReASearch是一种统一框架,由具备工具使用能力的智能体自主优化提示词、程序和机器学习工作流。智能体自行决定评估哪些方案、如何诊断失败、进行哪些修改,以及何时验证结果或重新开始。借助持久记忆,它能够在长期运行中持续改进搜索策略。在14项不同任务中,该系统的表现与专用优化系统相当,并在大多数情况下超过后者,取得了2%至40%的提升。在部分任务中,它还发现了超过此前人类已知最佳结果的解决方案。研究
该研究探讨交互式视频世界模型如何在长时间范围内保存和检索视觉信息。当生成过程超出训练时长范围后,传统键值(KV)缓存中的内容将难以可靠寻址;直接压缩旋转位置编码后的缓存也可能破坏位置信息。研究提出无需重新训练的WorldTrace记忆框架,为每个压缩记忆槽分配一个位于训练分布内的独立虚拟位置。WorldTrace-Field压缩历史信息以保持时间连贯性,WorldTrace-Landmark则在检