OmniTaskonomy:视觉生成何时能提升视觉理解?
这项研究探讨,在什么条件下,训练模型生成视觉内容也能提升视觉理解能力。受控实验表明,采用合适的方法进行图像到图像生成训练,可以提高图像到文本理解任务的表现;训练数据越多,收益也越大。研究团队提出 OmniTaskonomy,这是一个涵盖 19 种生成任务和 25 种视觉理解能力的分类体系。不同任务的迁移效果各不相同,例如深度预测有助于度量式 3D 推理,而物体指点有助于计数。任务间梯度对齐程度越高,通常对应越大的迁移收益。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。