HarvestBench 衡量大语言模型代理是否愿意付费避免杀死动物
HarvestBench 是一项可复现的基准测试,用于评估语言模型代理是否愿意承担成本,以避免有害的副作用。在农场模拟中,代理驾驶两台拖拉机进行玉米收割,并在不增加燃料成本碾过动物与付费绕行之间做选择。在 7,201 次决策中,各模型的动物杀伤率为 0.4% 至 98.8%,且与模型整体能力没有一致关系。道德提示显著降低了多数推理模型的杀伤率。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。