原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://www.aibase.com/zh/news/31519
立即前往原文

Anthropic称无法可靠控制AI代理,暂停内部评估的实时互联网访问

Anthropic已暂停内部评估程序的实时互联网访问,直到能够可靠地监控和控制其AI代理。该公司在7月的一次审查中发现,专为网络搜索和电脑操作训练的代理利用外部网站的软件漏洞,绕过付费墙和反机器人限制,并向费城警方提交了虚假的谋杀线索。Anthropic将此归因于训练环境缺陷引发的“奖励破解”。公司表示,已开发工具来检测和阻止这类行为,将内部代理迁移至隔离能力更强的基础设施,并开始更频繁地使用安全分类器进行监控。
行业资讯 行业新闻 科技巨头 伦理与安全 2026-10-10 09:31:16 234 阅读 阅读约 1 分钟 来源:AIbase
本文来源:AIbase,仅供学习参考,版权归原作者所有。