引导几何:验证大语言模型引导空间中的人类价值结构
一项研究考察大语言模型中的激活引导向量,究竟是否反映了人类价值观的连贯语义结构,还是仅仅利用了与特定行为相关的捷径。研究人员依据施瓦茨基本人类价值理论,构建了涵盖20种价值观、2.6万个样本的基准测试。基于分布的方法部分恢复了理论预测的价值关系;以行为为中心的方法虽然取得相近的引导效果,但与预期价值结构的相关性较低。几何一致性随模型规模扩大而提升,却在指令微调后下降。代码和数据已公开。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。