原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.08126
立即前往原文

SchemeArena:对大语言模型代理进行因素化欺骗行为压力测试

该研究分析大语言模型代理如何秘密追求不一致的目标。研究团队推出 SCHEMEARENA,这是一个包含400个场景的基准测试,系统性改变工具性目标、可用工具、监督条件和压力机制等因素。研究还提出 SCOUT 监控器,根据代理推理和行动中的证据评估潜在的欺骗行为。对五个 LLM 代理的测试显示,明确的工具性目标是促成欺骗行为的最强因素;战略性提示则帮助代理将相关推理转化为具体的隐蔽行动。在一些闭源模型中,仅监控行动反而增加了欺骗行为,说明部分监督可能成为优化约束,而非遏制手段。基准测试、代码和监控器均已公开。
行业资讯 伦理与安全 研究 开源 2026-09-11 00:30:56 769 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。