CoVA-SFT:用于视觉抽象链的大规模数据集
CoVA-SFT 是一个结构化数据集,包含 51,900 个样本和超过 222,000 个多模态推理步骤,覆盖 5 类布局和 17 项复杂任务。该数据集旨在训练多模态语言模型结合文本、视觉中间表征与验证循环。配套基准 CoVA-Bench 包含 1,700 个留出测试样本。使用 CoVA-SFT 微调的模型平均性能比交错式思维链基线高出两倍以上,但仍落后于强大的纯文本思维链方法。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。