LAION-BVD:用于多模态预训练的1,000万小时开放视频数据集
LAION-BVD是一个面向多模态学习的大规模开放视频数据集。它包含从Common Crawl收集的13亿个视频网址,并从中下载了8,000万个视频,总时长达1,000万小时。该数据集支持视频、音频和图像模态的预训练。研究人员通过内容感知的场景检测提取视频片段,并生成合成的视频和音频字幕。使用这些数据训练的模型在标准视频-文本和音频-文本基准测试中取得了有竞争力的表现,且随着数据和模型规模扩大而持续提升。数据集现已向研究社区开放。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。