原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.04444
立即前往原文

HarvestBench 衡量大语言模型代理是否愿意付费避免杀死动物

HarvestBench 是一项可复现的基准测试,用于评估语言模型代理是否愿意承担成本,以避免有害的副作用。在农场模拟中,代理驾驶两台拖拉机进行玉米收割,并在不增加燃料成本碾过动物与付费绕行之间做选择。在 7,201 次决策中,各模型的动物杀伤率为 0.4% 至 98.8%,且与模型整体能力没有一致关系。道德提示显著降低了多数推理模型的杀伤率。
行业资讯 伦理与安全 研究 2026-09-08 01:01:04 627 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。