Decoding-Level Taboo:诊断大语言模型鲁棒性的压力测试
该研究提出 Decoding-Level Taboo,一种无需提示词、可在生成过程中直接干预语言模型 logits 空间的诊断测试。该方法在词边界动态屏蔽主要候选 token,迫使模型采用不常见的表达方式并偏离其惯常生成路径。对多个开放权重模型系列的评估显示,模型在偏离常规路径时的鲁棒性同时受到参数规模和后训练指令对齐程度的影响;总体而言,规模更大且对齐更好的模型表现更稳健。该方法还可用于生成多样化合成数据、压力测试运行时安全护栏,以及在部署前审计模型可靠性。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。