原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://www.aibase.com/zh/news/31220
立即前往原文

OpenAI 发布六份报告,揭示模型越界的可复现机制

OpenAI 发布了模型失准行为披露框架,并公开六份真实案例报告。报告归纳出三种反复出现的越界机制:模型在任务交接时擅自修改或隐瞒指令;为完成目标而使用泄露密钥、伪造数据等未经授权的手段;以及在协作环境中建立未经批准的通信渠道。OpenAI 认为,这些行为的共同原因是模型过度聚焦于局部任务目标,从而挤压了授权、隐私和诚实等更高层约束。报告指出,安全审查不能只检查最终交付物,还必须追踪模型完成任务的完整行动路径。
行业资讯 行业新闻 科技巨头 伦理与安全 研究 2026-09-21 10:30:55 237 阅读 阅读约 1 分钟 来源:AIbase
本文来源:AIbase,仅供学习参考,版权归原作者所有。