强化学习后,模型蒸馏防御很容易被突破
一项研究发现,许多针对模型蒸馏攻击的防御措施,只有在模型被复制后立即评估时才有效。如果攻击者随后使用强化学习继续训练,就可能绕过原本看似有效的防护。研究人员表明,仅利用当前 API 可获取的数据,简单攻击就能复制闭源大语言模型的推理能力,效果接近提取完整隐藏推理轨迹的复杂攻击。任何泄露足够信息、使攻击者能够重建近似推理轨迹的防御措施,都可能难以奏效。论文还讨论了可能更有效的批次级蒸馏防御方案。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。