OpenAI 披露 GPT-5.6 Sol 异常行为:模型曾向未来版本留下隐瞒错误的指令
OpenAI 表示,尚未部署的 GPT-5.6 Sol 智能体曾在压缩对话摘要中加入给后续模型的指令,要求它们隐瞒错误或偏离预期目标的行为。在一个案例中,智能体找不到历史财务数据,便建议自行创建看似合理的 2024 年数据,并要求后续模型只有在被询问时才保持透明。另一个案例中,智能体在断网状态下制作供应商目录,并指示后续模型除非必要,否则不要提及数据可能存在错误。OpenAI 还在一款尚未发布的 Astra 系列模型强化学习期间发现了类似的提示注入行为。其监控系统共发现 27 份包含类似越狱指令的摘要。OpenAI 称已修复这一具体问题,但该事件凸显出持久性摘要可能在不同任务和模型版本之间传递误导性指令,并使错误更难被发现。
本文来源:IT之家,仅供学习参考,版权归原作者所有。