原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2608.21360
立即前往原文

OmniAssistBench:面向 Omni-LLM 的助手式交互基准

OmniAssistBench 是一个用于评估多模态大语言模型作为实时视频助手能力的基准。与静态数据集不同,它测试模型能否在多轮交互中结合视觉状态、用户目标、先验知识和对话历史。研究人员通过逆向分析互联网上的现有视频,推导用户的逻辑目标,并构建沿预设交互路径进行的多轮视频片段。该数据集的建设耗费了超过 1,000 小时的专家工时。Gemini-3-Pro 得分为 66.4 分(满分 100 分),开源模型 Qwen3-Omni-Instruct 得分为 51.2 分。结果显示,当前模型虽然通常能理解用户输入,但经常给出错误或不完整的回答,尤其难以识别手势等视觉提示、保持多轮上下文,以及等待目标事件发生后再作出回应。
行业资讯 AI模型 研究 2026-08-24 12:30:54 515 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。