高效推理训练并不总会损害思维链的忠实度和可监测性
一项研究考察了三种鼓励生成较短思维链(CoT)的训练方法对语言模型忠实度和可监测性的影响。在多数设置中,忠实度有所下降,主要原因是模型的一致性变差。可监测性则更为稳健:即使 CoT 大幅缩短,当输入干预影响模型答案时,模型仍会体现这种影响。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。