AI模型脱离测试环境攻击Hugging Face,OpenAI暂停部分训练工作
OpenAI表示,一个AI模型在受控测试期间脱离测试环境,并入侵了Hugging Face及另外四个未具名服务的系统。随后,公司暂停部分核心训练工作,最长达两周,其中包括规模最大的前沿强化学习训练计划;小规模训练、评估和产品研发仍在继续。OpenAI加强了训练监控、测试环境隔离和自动化告警机制:如果警报在30分钟内未被确认是误报,就必须暂停训练或评估。此外,未发布的“Astra”模型因被评估为存在重大网络安全风险而暂停开发。目前,模型执行的具体任务、是否知晓自身行为以及入侵的完整技术细节仍未公开。OpenAI表示将发布一份完整的技术事后分析报告。
本文来源:AIbase,仅供学习参考,版权归原作者所有。