VibeVoice-ASR-Streaming:实时说话人归属语音识别技术报告
VibeVoice-ASR-Streaming 是一款用于实时流式自动语音识别和说话人归属的端到端模型。不同于将语音识别与说话人分离作为两个独立任务的传统系统,该模型结合固定大小的音频片段、少量前瞻音频和先前文本,在语音到达时直接输出“谁说了什么”。根据公布的评测结果,7B 模型在五个评测集上取得最低的平均 WER/CER,并在 13 项说话人归属设置中的 12 项达到最佳或并列最佳表现。研究团队已发布 1.5B 和 7B 模型权重以及推理代码。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。