原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.04720
立即前往原文

知道哪些内容不该回答:视觉语言模型的选择性不遵从

该研究提出 KoNA,一项用于评估视觉语言模型选择性不遵从能力的基准。不同于将整个问题简单判断为可回答或不可回答的传统评测,KoNA 检验模型能否回答有效部分,同时拒绝、纠正或暂不回答不适当的部分。该基准涵盖错误前提、视觉上无法获取的信息、普遍未知的信息、任务可行性和安全性五个类别。对多种模型的评估显示,模型经常无法正确处理这些情况,尤其是在同时包含可回答和不可回答内容的复合问题中。使用 KoNA 示例进行微调后,模型的不遵从准确率显著提升,同时基本保持了在完全可回答任务上的表现。
行业资讯 伦理与安全 AI模型 研究 2026-09-08 00:30:57 403 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。