原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.35699
立即前往原文

强化学习后,模型蒸馏防御很容易被突破

一项研究发现,许多针对模型蒸馏攻击的防御措施,只有在模型被复制后立即评估时才有效。如果攻击者随后使用强化学习继续训练,就可能绕过原本看似有效的防护。研究人员表明,仅利用当前 API 可获取的数据,简单攻击就能复制闭源大语言模型的推理能力,效果接近提取完整隐藏推理轨迹的复杂攻击。任何泄露足够信息、使攻击者能够重建近似推理轨迹的防御措施,都可能难以奏效。论文还讨论了可能更有效的批次级蒸馏防御方案。
行业资讯 伦理与安全 AI模型 研究 2026-09-30 07:31:06 787 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。