Ovis-Embedding 推进通用全模态嵌入技术
该报告介绍了 Ovis-Embedding,这是一系列全模态嵌入模型,利用统一的多模态骨干网络,将文本、图像、视频和音频编码到共同的表示空间中。该方法以预训练的 Qwen-Omni 模型为基础,结合对比学习、覆盖多种模态的高质量数据集,以及聚焦损失和基于相似度的嵌入蒸馏等专用技术。低秩特征分解能够在性能损失有限的情况下生成维度灵活的紧凑嵌入。报告中的评测显示,Ovis-Embedding 在 MMEB-v3、MMEB-v2、MVEB、MAEB 和 RTEB 上取得领先结果,展现了跨文本、图像、视频和音频的检索能力。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。