原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2608.28958
立即前往原文

CoVA-SFT:用于视觉抽象链的大规模数据集

CoVA-SFT 是一个结构化数据集,包含 51,900 个样本和超过 222,000 个多模态推理步骤,覆盖 5 类布局和 17 项复杂任务。该数据集旨在训练多模态语言模型结合文本、视觉中间表征与验证循环。配套基准 CoVA-Bench 包含 1,700 个留出测试样本。使用 CoVA-SFT 微调的模型平均性能比交错式思维链基线高出两倍以上,但仍落后于强大的纯文本思维链方法。
行业资讯 AI模型 研究 2026-09-02 02:00:58 906 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。