原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.16591
立即前往原文

FLAT将图像和文本重采样为用于检索与生成的灵活一维多模态Token

FLAT是一种多模态表征学习框架,将图像和文本映射到共享的连续一维序列空间中。不同于依赖冻结视觉嵌入的传统流程,FLAT联合训练多模态编码器,以及文本到图像和图像到文本解码器。通过使用长度可变的前缀Token,模型能够灵活调整表征长度。FLAT支持跨模态检索与生成,在文本到图像生成任务中取得83.1的GenEval得分,在图像描述任务中取得40.5的BLEU-4和138.6的CIDEr,并在MS-COCO和Flickr30K上获得较高的Recall@5。定性评估还显示,该表征支持线性插值、潜空间算术运算以及零样本组合概念检索。
行业资讯 应用 AI模型 研究 2026-09-17 02:01:05 729 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。