StepGuard:通过可扩展监督学习逐步防护AI代理
StepGuard是一种面向大语言模型代理的防护模型,既能审计已完成的代理执行轨迹,也能在工具操作执行前检查潜在风险。研究团队使用StepGen自动生成安全和不安全的轨迹:两者拥有相同上下文,但在风险步骤采取不同操作。为减少过度防御和防御不足,研究人员还提出了Balance-GRPO,根据观测到的准确率动态平衡安全与不安全操作的学习。实验显示,StepGuard在开放权重防护模型中取得最高平均准确
AI 新闻中心 过去一年分析了 1732 篇文章,发现了 0 条重要报道 (分数 ≥ 5.5)
获取从可信来源聚合的最新 AI 新闻。
StepGuard是一种面向大语言模型代理的防护模型,既能审计已完成的代理执行轨迹,也能在工具操作执行前检查潜在风险。研究团队使用StepGen自动生成安全和不安全的轨迹:两者拥有相同上下文,但在风险步骤采取不同操作。为减少过度防御和防御不足,研究人员还提出了Balance-GRPO,根据观测到的准确率动态平衡安全与不安全操作的学习。实验显示,StepGuard在开放权重防护模型中取得最高平均准确
ABot-Recon 是一种从超长视频中进行三维场景重建的流式模型。它不维护庞大的长期记忆,而只缓存前 11 帧的键值特征。模型在当前相机坐标系中预测点图,并估计相邻帧之间的相对位姿,再通过序列组合恢复全局相机位姿和场景几何。轻量级时间细化器用于减少旋转漂移,考虑组合过程的位姿损失则用于训练多步位姿组合。在 Oxford Spires 基准测试中,ABot-Recon 的绝对轨迹误差为 4.35
该研究提出了 VLAct,一种面向视觉语言动作(VLA)系统的视觉语言模型骨干。VLAct 使用来自多种机器人形态的异构机器人数据进行持续预训练,在保留视觉语言模型通用知识的同时,促进跨机器人形态的共享动作语义。在固定机器人数据量和微调预算下,VLAct 在仿真、真实环境任务以及向未见机器人形态迁移时均提升了性能。它在 LIBERO-Plus 和 RoboTwin 2.0 上分别取得 82.6%
该研究提出了 Rubric-to-Code Credit Assignment(RCCA),一种面向强化学习的框架,用于让模型根据自然语言需求生成可用的 HTML、CSS 和 JavaScript 应用。RCCA 不再将单一的序列级奖励平均应用于所有 token,而是把功能反馈对应到相关代码区域和生成 token。其分层奖励机制区分格式、源代码、运行时和功能错误。Ling-RCCA-Flash 在
GeoNeXt重新利用预训练视频生成模型,从单张图像中联合估计深度和表面法线。该方法将几何估计定义为下一帧预测任务,从而利用视频模型中结构化的视觉先验,并以远少于以往方法的标注数据学习图像与几何信息之间的关系。在多个数据集上的实验表明,GeoNeXt在零样本单目深度和表面法线估计方面优于以往的任务专用型和统一型生成方法。它的性能还接近使用超过百倍数据训练的判别式先进方法,并在多个基准测试中超过这些
PonderPounce 将多模态大语言模型(MLLM)的原生因果上下文用作机器人控制的情景记忆。系统结合了 Ponder 和 Pounce:前者是较慢的 System 2 MLLM,负责积累观测、示范和此前的推理;后者是快速的视觉—语言—动作模型,直接根据当前观测生成动作。两者端到端联合训练,无需专用记忆模块或单独的桥接预训练。经过服务优化后,系统支持 20Hz 的动作执行。在 RoboMME
该研究提出“Code-as-World”,将物理世界表示为可执行代码。代码以紧凑、可控且具有定量依据的方式描述物体构成、动态变化和视觉外观。系统通过一个智能体循环,依据自然语言描述或现实世界视频等多模态观测,提出、执行、渲染、验证并反复改进世界假设。经过验证的可执行世界表征可作为可扩展的监督信号,用于训练视觉语言模型进行定量物理推理。研究人员表示,Code-as-World-VL在QuantiPh
ContextPilot 是一个面向长期智能体任务的主动式上下文管理框架。它在现有工具基础上加入规划、长期记忆和灵活的上下文卸载功能,并提出专用强化学习方法,用于识别关键编辑决策,更准确地评估各项操作对最终结果的贡献。在长上下文问答和深度搜索实验中,ContextPilot 在使用更紧凑工作上下文的同时,在多种基础模型和基准测试上持续优于现有方法。代码已公开。
研究人员推出 ElephantBench,这是一套可复现的基准测试,用于评估大语言模型是否保留罕见事实的不同说法。数据集包含1,094个问题,通过可审计的图谱式流程,从存在自然分歧的网络文档中生成。所有答案都与原始文档及权威公开来源进行核验,并由人工标注员审查。在测试的32个模型中,即使表现最好的模型,也只在52.4%的问题上同时找回两种说法。在其余大多数情况下,模型只记住一种说法而遗漏另一种。扩
据外媒 Android Headlines 报道,微软正加强内部 Token 使用监控,以降低 AI 成本。一份泄露的内部表格据称显示,一名员工在 28 天内产生了约 2.8 万美元的 Token 费用。在约 350 名自愿提交月度使用数据的美国员工中,费用中位数约为 300 美元。CoreAI 部门的月度费用中位数最高,约为 975 美元,个人最高支出达到 1.6 万美元。微软据报将加强对异常高
据报道,字节跳动原计划于 8 月推出的豆包大模型 2.2 将推迟发布。消息人士称,公司希望通过更充分的预训练和后训练,重点提升模型的编程、工具调用和 Agent 能力。2.2 被视为连接现有模型与下一代超大模型的关键补强版本。报道称,即使短期内落后竞争对手,字节跳动仍将坚持自研大模型,不依赖模型蒸馏技术。目前,字节跳动尚未正式确认延期消息。
华为云与上海瑞金医院发布了病理基础模型 RuiPath 2.0,参数规模为70亿,覆盖19种常见癌症和205项诊断任务。开发方称,该模型在59项下游诊断任务中的42项达到行业领先水平。模型新增组织学亚型、浸润深度和核分裂象等可解释性标识,提升诊断结果的透明度和可追溯性。针对罕见疾病数据不足的问题,双方利用多模态模型生成合成训练数据,并公布了96.48%的淋巴瘤诊断准确率。此外,双方还推出了拥有20
科技媒体 TestingCatalog 称,OpenAI 正通过新增的“mozaik-alpha-fdm”测试阶段,扩大内部开发模型 Astra 的测试范围。Astra 尚未被官方确认是 GPT-6,但多家媒体和业内消息认为,它可能是 GPT-6 的代号或候选名称。未经证实的信息称,Astra 在数学、物理、生物、医学、化学和网络安全等领域取得了明显进展。网友分享的测试内容显示,该模型据称只需一次
OpenAI 计划在 11 月前终止 Cursor 对其模型的访问权限。这一决定成为 OpenAI 首席执行官萨姆·奥特曼与埃隆·马斯克长期争端中的最新冲突点。
索尼音乐出版与华纳音乐出版已起诉Anthropic及其高管达里奥·阿莫代和本杰明·曼。两家音乐出版商指控,Anthropic在训练Claude大型语言模型时使用了数万首受版权保护的歌曲。