AVA-Encoder:面向智能体原生视频表征学习
AVA-Encoder 是一个研究框架,可将视频转换为包含结构化文本的知识图谱,并关联图像、音频和视频资产,随后再将其重建为视频。该方法旨在帮助 AI 智能体理解、查询和编辑电影级内容。系统利用视频重建差异生成的自然语言反馈来优化编码策略,并可在测试阶段进一步细化知识图谱表征。实验显示,AVA-Encoder 比最强外部基线提升了 20.7 个百分点。在受控策略设置中,经过伪训练的镜头级智能体视频编码策略也超过了经过人工调优的策略,同时减少了 74.3% 的系统提示词元使用量。研究团队将发布完整框架、视频重建基准,以及高质量电影知识图谱数据集。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。