UCF-Net融合CLIP与DINO,提升深度伪造图像检测的泛化能力
研究人员提出UCF-Net,这是一种面向篡改和生成式人脸检测的不确定性感知融合网络。该方法结合CLIP的语言对齐语义特征与DINO通过自监督学习获得的视觉结构特征,并从Transformer的多个深度提取层级特征,通过专家聚合进行自适应组合,再依据熵推导的不确定性对不同表示加权融合。在约400万张图像构成的统一基准上,UCF-Net在域内和跨域评测中均取得了参评方法最高的平均AUC。在包含来自八种近期生成器的8000多张人脸图像的独立测试集上,模型仅使用有限目标域数据也能有效适应。不过,完全零样本迁移仍然面临挑战。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。