OmniAssistBench:面向 Omni-LLM 的助手式交互基准
OmniAssistBench 是一个用于评估多模态大语言模型作为实时视频助手能力的基准。与静态数据集不同,它测试模型能否在多轮交互中结合视觉状态、用户目标、先验知识和对话历史。研究人员通过逆向分析互联网上的现有视频,推导用户的逻辑目标,并构建沿预设交互路径进行的多轮视频片段。该数据集的建设耗费了超过 1,000 小时的专家工时。Gemini-3-Pro 得分为 66.4 分(满分 100 分),开源模型 Qwen3-Omni-Instruct 得分为 51.2 分。结果显示,当前模型虽然通常能理解用户输入,但经常给出错误或不完整的回答,尤其难以识别手势等视觉提示、保持多轮上下文,以及等待目标事件发生后再作出回应。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。