SpanCalib-VLM:视觉语言模型中的校准式幻觉片段检测
SpanCalib-VLM是一种用于定位和评估大型视觉语言模型生成的幻觉文本片段的混合系统。该系统将由XLM-RoBERTa-Large和SigLIP视觉编码器组成的多模态序列标注器,与经过微调的生成模型Qwen3.5-4B-SHROOM-SFT结合。通过Union-Calibrated Fusion策略,系统利用序列标注器校准后的概率,对生成模型提出的候选片段重新评分。在SHROOM-Visions英语评测集上,该集成系统取得了0.41的Pearson校准相关系数、0.39的整体IoU、0.91的干净响应IoU,以及70.7%的整体检测准确率。模型权重和代码已公开。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。