PACT:企业 AI 助手在压力下值得信赖吗?
该研究提出 PACT(Pressure-Applied Compliance Testing),用于评估大型语言模型代理在受到用户压力时,能否在受监管的企业环境中遵守规则。该基准涵盖 12 个领域、48 个真实的多轮对话场景,以及 6 项合规指标。对来自不同供应商、规模各异的 22 个常用模型进行测试后,研究发现模型在规则遵循方面存在显著差异。即使表现最好的助手,也会在 6% 至 10% 的测试项目中错误应用规则;普通用户压力则使平均违规率提高 65%。研究结果表明,企业需要更完善的安全护栏,并应谨慎选择模型。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。