原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.21094
立即前往原文

价值几何:通过任务向量组合对齐语言模型的伦理偏好

一项研究提出了一个包含12,000个二选一困境的数据集,涵盖诚实、公正与自主性之间的两两价值冲突,并提供印地语、阿拉伯语、西班牙语和中文译本。在未指定政策时,GPT-5-mini在测试的五种语言中都稳定地偏好诚实而非自主性。小型Llama-3.2模型则明显偏向第一个选项;但普通微调和直接偏好优化能够有效消除这一偏差,使准确率提升至98%以上。研究人员还将任务向量与通用指令遵循向量进行正交化,以分离特定价值偏好,并通过任务算术反转其方向。
行业资讯 伦理与安全 AI模型 研究 2026-09-21 17:31:04 142 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。