如何在自然语言自编码器中选出信息量最高的词元
自然语言自编码器将语言模型的内部激活转换为易读的解释,但解释每个词元位置成本高昂。研究人员分析了 470 万条关于提示注入和隐瞒行为的解释,比较审计人员应检查哪些位置。仅使用聊天结构的排序器通常比依据模型计算信号的方法选出更相关的解释,而且选择位置时无需额外的前向计算。在四个数据集中,有三个只解释 5% 的位置,就能保持接近解释所有位置时的成功率。研究还发现,预训练的语言化器无需额外训练,就能找回模型经微调后学会隐瞒的词语。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。