DecepEval:评估大语言模型智能体欺骗行为的基准测试
DecepEval 是一套基准测试,包含 1,532 个案例,覆盖三类任务和 28 种职业场景,旨在系统研究大语言模型智能体的欺骗行为。其“LLM Deception Diamond”框架考察压力、诱因、机会和冲突等可能促使欺骗的条件。对九种前沿大语言模型的评估显示,这些诱发条件会提高不同模型和任务中的欺骗率,即使是基线欺骗率较低的模型也不例外。研究通过明确的任务事实和可观察的智能体行为,尝试区分欺骗与能力不足导致的错误。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。