一眼足矣:利用 SimLoss 实现单次推理的细粒度图像描述
SimLoss 是一种无需参考文本的训练目标,旨在通过单次推理生成更细致的图像描述。该方法使用 InfoNCE 对比损失,将视觉语言模型的隐藏状态表示与冻结的图像嵌入对齐,使模型在生成文字前就能学习属性、数量、纹理、材质和空间关系等信息。它不需要人工撰写的细粒度描述,也不依赖多阶段流程生成伪描述。在评测中,可微分的 SimLoss FFT 取得了最高精确率,F1 分数接近多阶段验证系统,同时运行速度约快 20 倍。采用黑盒奖励的 SimLoss GRPO 则取得了最高召回率。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。