OneStreamer整合流式视频中的感知、记忆与主动响应
OneStreamer是一种面向流式视频语言模型的方法,将持续感知、可复用的事实记忆和及时响应结合起来。模型生成带有时间信息的局部细节描述,以及已完成事件的摘要,供后续回答问题时作为上下文。其训练方法旨在更有效地识别重要状态变化,并减少重复输出。研究团队还推出了包含超过一百万条记录的数据集OneStreamer-1M。作者称,该4B模型在评估的全部八项基准测试中均优于对比方法。消融实验显示,保留生成的描述可以改善对历史事件的问答,同时不损害实时感知能力。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。