DiSCO:通过分布引导的对比式提示词优化防御文本生成图像
DiSCO是一种面向文本生成图像模型的零样本安全防御方法,完全以黑盒方式在提示词层面运行。该方法无需重新训练、微调或访问模型内部,因此可以应用于专有模型。DiSCO通过束搜索扩展提示词后缀,并利用目标模型自行生成的安全和不安全图像池进行对比评分,再根据反馈迭代调整,直到生成安全内容。在I2P基准测试中,研究人员报告称,该方法使未部署防御的模型攻击成功率降低37.7%,使已有防御的模型降低25.13%。研究还显示,DiSCO保持了语义一致性,并改善了图像连贯性。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。