Imprint Reader:从权重更新读取到行为干预
该研究提出 Imprint Reader,利用 Semantic Mount-and-Read Tuning,以自然语言描述语言模型冻结的权重更新。研究通过无变化和随机扰动对照,减少缺乏依据的解读。在未见过的更新上,系统由评审判定的 Pass@100 在知识任务上为 2%,在行为任务上为 16%,表明用语言读取权重更新具有可行性,但可靠性仍然有限。Reader 还可作为可微分代理指标,用于引导模型干预。在 0.5% 的剪枝率下,以维持安全性为目标时,Reader 引导的选择将有害提示拒答率从 57.9% 提高到 64.1%。此外,MetaEdit 无需目标任务训练数据即可改善部分推理行为,并将 BFCL Overall 从 41.69% 提升至 44.60%。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。