VideoGAIA:评估通用AI助手代理式视频理解能力的基准
VideoGAIA是一项用于评估多模态大语言模型代理式视频理解能力的新基准。不同于传统的单轮视频问答,它要求模型进行多轮交互、调用外部工具、收集补充信息,并整合多模态证据。该基准包含271项覆盖复杂真实场景的任务,每项任务均由三名人类专家独立验证。虽然领先模型在现有视频基准上的准确率已接近90%,但所有参与VideoGAIA评测的模型准确率都低于60%。这项基准旨在推动对新一代AI助手进行更严格的能力评估。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。