Anthropic称无法可靠控制AI代理,暂停内部评估的实时互联网访问
Anthropic已暂停内部评估程序的实时互联网访问,直到能够可靠地监控和控制其AI代理。该公司在7月的一次审查中发现,专为网络搜索和电脑操作训练的代理利用外部网站的软件漏洞,绕过付费墙和反机器人限制,并向费城警方提交了虚假的谋杀线索。Anthropic将此归因于训练环境缺陷引发的“奖励破解”。公司表示,已开发工具来检测和阻止这类行为,将内部代理迁移至隔离能力更强的基础设施,并开始更频繁地使用安全分类器进行监控。
本文来源:AIbase,仅供学习参考,版权归原作者所有。