原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.38079
立即前往原文

OmniTaskonomy:视觉生成何时能提升视觉理解?

这项研究探讨,在什么条件下,训练模型生成视觉内容也能提升视觉理解能力。受控实验表明,采用合适的方法进行图像到图像生成训练,可以提高图像到文本理解任务的表现;训练数据越多,收益也越大。研究团队提出 OmniTaskonomy,这是一个涵盖 19 种生成任务和 25 种视觉理解能力的分类体系。不同任务的迁移效果各不相同,例如深度预测有助于度量式 3D 推理,而物体指点有助于计数。任务间梯度对齐程度越高,通常对应越大的迁移收益。
行业资讯 研究 2026-09-30 10:31:09 793 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。