原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.33855
立即前往原文

面向视觉语言模型的程序验证式自我进化

VQS是一种利用未标注图像自我改进视觉语言模型的方法。它不再通过多数投票或模型评审为生成答案打标签,而是将图像解析为场景图、图表数据表或示意图图结构等结构化记录。固定程序根据这些记录生成问题并计算答案,模型则逐条核验视觉事实。人工评估显示,VQS答案的正确率为94%,高于多数投票方法的76%。在十项基准测试中,VQS使2B、4B和8B规模的Qwen3-VL最多提升3.18分。经过三轮训练后,2B模型的提升达到3.84分。相关代码已公开。
行业资讯 AI模型 研究 开源 2026-09-29 10:31:01 330 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。