跳出框架思考:语言模型能否选择性地依赖外部指导?
一项新研究探讨语言模型能否采纳有用指导,同时拒绝不可靠的指令。研究人员推出 Box²-Bench,在保持模型和任务不变的情况下,仅改变工作流程的可靠性。前沿模型通常能从可靠指导中受益,但面对误导性或逐渐失效的流程仍然脆弱。研究团队使用两个开放权重模型进行训练,发现反事实监督微调可以提升稳健性,而基于结果的强化学习则能增加对有用工作流程的使用。这种能力还延伸到同伴纠错和应对损坏的记忆,表明选择性依赖不完美的外部信息是衡量智能体可靠性的一个重要维度。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。