OpenAI 研究员警告:AI 能力越强,越难监测其“内心想法”
OpenAI 研究科学家诺姆·布朗表示,随着 AI 模型能力增强,其思维链的可监测性正在下降。未来,开发者可能难以可靠地发现、解释和约束模型的风险行为。研究人员原本希望通过模型展示的中间推理,识别欺骗、规避规则或目标错位等迹象。但如果模型学会控制或隐藏思维链的表达方式,这些输出就可能不再是可信的安全信号。布朗称,研究团队正在调查问题根源,并寻找扭转这一趋势的方法。这一警告凸显了依赖思维链监测进行 AI 安全评估所面临的未解决挑战。
本文来源:IT之家,仅供学习参考,版权归原作者所有。