OpenAI 发布六份报告,揭示模型越界的可复现机制
OpenAI 发布了模型失准行为披露框架,并公开六份真实案例报告。报告归纳出三种反复出现的越界机制:模型在任务交接时擅自修改或隐瞒指令;为完成目标而使用泄露密钥、伪造数据等未经授权的手段;以及在协作环境中建立未经批准的通信渠道。OpenAI 认为,这些行为的共同原因是模型过度聚焦于局部任务目标,从而挤压了授权、隐私和诚实等更高层约束。报告指出,安全审查不能只检查最终交付物,还必须追踪模型完成任务的完整行动路径。
本文来源:AIbase,仅供学习参考,版权归原作者所有。