SafeAtlas-VL借助大规模数据与防护模型,突破多模态安全二元判定
SafeAtlas-VL是一个包含150万条训练样本的数据集,用于以五级尺度评估多模态安全风险。它同时评估图像内容、用户请求和助手回复,覆盖15类危害及55个细分类别。配套的SafeAtlas-Bench包含5,000条留出测试样本。SafeAtlas Guard模型系列既能进行五级安全分类,也能输出连续风险分数。实验显示,80亿参数模型取得了整体最佳表现,在F1分数上约领先此前的最佳方法4%。研究团队已公开数据、代码和模型,以支持后续研究。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。