面向视觉语言模型的程序验证式自我进化
VQS是一种利用未标注图像自我改进视觉语言模型的方法。它不再通过多数投票或模型评审为生成答案打标签,而是将图像解析为场景图、图表数据表或示意图图结构等结构化记录。固定程序根据这些记录生成问题并计算答案,模型则逐条核验视觉事实。人工评估显示,VQS答案的正确率为94%,高于多数投票方法的76%。在十项基准测试中,VQS使2B、4B和8B规模的Qwen3-VL最多提升3.18分。经过三轮训练后,2B模型的提升达到3.84分。相关代码已公开。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。