基础模型可借助从训练数据中学到的线索进行推理
一项研究考察了回答开头的特定 token 如何影响基础模型后续的推理。在数学和编程测试中,固定某些线索可使模型表现达到足以与经过强化学习训练的模型相比的水平。研究人员还发现,强化学习会让这些线索更容易出现;通过干预训练数据,可以将任意词语变成有效的推理线索,也可以消除已有线索的作用。不同线索还会引发不同的拒绝或配合行为。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。