原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.06289
立即前往原文

引导几何:验证大语言模型引导空间中的人类价值结构

一项研究考察大语言模型中的激活引导向量,究竟是否反映了人类价值观的连贯语义结构,还是仅仅利用了与特定行为相关的捷径。研究人员依据施瓦茨基本人类价值理论,构建了涵盖20种价值观、2.6万个样本的基准测试。基于分布的方法部分恢复了理论预测的价值关系;以行为为中心的方法虽然取得相近的引导效果,但与预期价值结构的相关性较低。几何一致性随模型规模扩大而提升,却在指令微调后下降。代码和数据已公开。
行业资讯 伦理与安全 AI模型 研究 2026-09-09 12:01:41 597 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。