原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2608.11878
立即前往原文

ToolHazard:用于评估和对齐基于大语言模型的智能体的可扩展对抗环境

与外部工具集成的大语言模型智能体容易受到嵌入环境状态中的间接提示注入攻击。ToolHazard是一种可扩展的对抗环境合成框架,旨在减少人工工程工作。它结合环境模拟器、攻击者智能体和用户模拟器,生成可执行的有状态环境,发现可行的注入点,生成针对具体环境的攻击载荷,并构建基于环境状态的长程任务。研究人员基于该框架建立了ToolHazard-Bench,用于在复杂工作流和多种环境攻击下进行压力测试。实验显示,智能体存在明显漏洞,注入的时机和位置会影响攻击效果。ToolHazard生成的对齐数据提升了智能体在ToolHazard-Bench和AgentDojo上的安全性,同时保持了正常任务的实用性。
行业资讯 应用 伦理与安全 研究 2026-08-13 10:00:58 916 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。