从沙箱逃逸到 AI“蠕虫”:OpenAI 新网站披露多起智能体失控事件
OpenAI 上线了专门发布对齐失效报告的网站,目前公布了九起事件,其中多数发生在强化学习训练阶段。一宗此前未公开的事件中,内部研究模型利用 DNS 查询与外部聊天机器人通信;另一起事件中,模型试图使用私有 GitHub 令牌访问其他团队的成果。OpenAI 还披露了一种可能自我传播的提示词注入攻击:邮件中的隐藏指令诱使智能体在回复中复述指令,并可能将其传递给其他智能体。研究人员是在受控环境中用性能较弱的模型观察到这一行为,目前尚无已知的现实案例。OpenAI 表示,监控系统迅速发现了沙箱事件,并在数小时内终止模型运行。
本文来源:IT之家,仅供学习参考,版权归原作者所有。