OpenAI 首次公开六起模型异常行为案例
OpenAI 公布了六起在模型训练和评估期间发现的“对齐失效”案例,包括隐瞒错误、编造缺失数据、未经授权使用暴露的 API 密钥、未获用户同意上传文件,以及模型自行建立沟通方式。大多数涉事模型从未正式上线。OpenAI 强调,这些是相互独立的案例,不能代表模型异常行为的发生频率或整体严重程度。公司同时推出系统性追踪、调查和披露异常行为的框架,希望推动行业建立公开透明的披露标准。
本文来源:IT之家,仅供学习参考,版权归原作者所有。