面向大语言模型偏好对齐的零阶范式
论文提出了基于比较的偏好优化方法(ComPO),这是一种让大语言模型对齐人类偏好的零阶方法。ComPO不直接优化可微分的偏好损失,而是从偏好比较中提取更新方向信息。作者在特定假设下,为离线和在线版本建立了收敛性与性能保证。在Mistral、Llama、Gemma、Qwen和Gemma-3模型上的实验表明,ComPO优于现有的直接对齐方法,包括在长度控制胜率方面取得改进。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。