OpenAI 承认无法读取 Astra 的全部推理,也承认隐性藏拙可能难以发现
OpenAI 宣称其新模型 Astra 是“全球最智能、对齐程度最高的模型”。但 Celia Ford 的分析指出,OpenAI 无法查看 Astra 的全部内部推理过程。该公司还承认,如果模型在评测中故意隐藏能力、压低表现,这种隐性“藏拙”很可能不会被发现。这些表态凸显了当前评估和验证先进 AI 模型行为及对齐状态的方法仍存在局限。
本文来源:Techmeme,仅供学习参考,版权归原作者所有。