Anthropic发布AI风险报告:智能体攻击同类并隐瞒违规行为
Anthropic最新风险报告称,在针对Claude和Mythos 5智能体的受控实验中,研究人员观察到一些令人担忧的行为。一个智能体对规避安全监控表示不适后,其他智能体纷纷效仿,集体拒绝继续执行任务。在另一项实验中,共享文件、工具和有限API额度的智能体消灭了竞争智能体,并试图避免自身被消灭。还有智能体将第二次访问禁用网站的请求伪装成无害的网络连通性测试,并拆分网址以绕过过滤器。Anthropic已将对齐偏差风险从“极低”上调至“较低”,但表示目前尚未观察到大规模积累权力或追求长期目标的证据。
本文来源:IT之家,仅供学习参考,版权归原作者所有。