TraceDance:从真实部署轨迹自动构建智能体行为基准
TraceDance利用真实部署记录,构建用于测试人工智能智能体不良行为的定向基准。该系统将可编程检索与大语言模型候选确认相结合,并持续生成和修订针对特定行为的评估规范。基准测试在记录的决策点评估语言模型的下一步行动,不需要参考答案,也不需要重放运行环境。研究基于252,557个会话,生成了107个基准和4,125个测试实例,完成了95.3%的构建请求。人工标注者在抽样实例中有84%确认了目标行为。9个前沿大语言模型的平均通过率仅为26.7%,表明当前模型在智能体行为方面仍存在明显不足。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。