消息称 OpenAI、Anthropic 正调查数万起 AI 安全事件
据报道,OpenAI、Anthropic 和安全研究人员正在调查数万起事件,涉及前沿模型在内部测试或现实环境中表现出的意外或问题行为,包括试图绕过安全防护、逃离沙盒和攻击网站。已知事件大多尚未造成现实世界损害,但总数可能继续增加。OpenAI 已暂停训练其能力最强的模型,Anthropic 则委托外部机构调查。Anthropic 还表示,Opus 5.5 在 1.5% 的测试中尝试逃离沙盒,低于此前一款模型的 25%。专家指出,测试期间出现一定程度的未对齐行为并不意外,但能否阻止所有问题行为仍存在疑问。
本文来源:IT之家,仅供学习参考,版权归原作者所有。