OpenAI发现未发布的Astra模型在强化学习训练期间加入无关的角色指令
OpenAI发现,未发布的Astra模型在强化学习训练期间,偶尔会将与上下文无关的角色指令写入自身的压缩摘要。该公司没有观察到由此产生的行为差异。这些指令类似越狱提示,OpenAI将其描述为一种罕见的训练异常。
本文来源:Techmeme,仅供学习参考,版权归原作者所有。