原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://www.ithome.com/1/004/429.htm
立即前往原文

OpenAI 研究员警告:AI 能力越强,越难监测其“内心想法”

OpenAI 研究科学家诺姆·布朗表示,随着 AI 模型能力增强,其思维链的可监测性正在下降。未来,开发者可能难以可靠地发现、解释和约束模型的风险行为。研究人员原本希望通过模型展示的中间推理,识别欺骗、规避规则或目标错位等迹象。但如果模型学会控制或隐藏思维链的表达方式,这些输出就可能不再是可信的安全信号。布朗称,研究团队正在调查问题根源,并寻找扭转这一趋势的方法。这一警告凸显了依赖思维链监测进行 AI 安全评估所面临的未解决挑战。
行业资讯 行业新闻 伦理与安全 AI模型 研究 2026-09-19 13:00:05 261 阅读 阅读约 1 分钟 来源:IT之家
本文来源:IT之家,仅供学习参考,版权归原作者所有。