DEFINE:通过语音示例控制零样本 TTS 口音
零样本文本转语音(TTS)可根据一段简短录音复现未见过的说话者,但通常会将说话者身份与口音混为一体。DEFINE 使用不同的音频示例分别指定说话者身份和目标口音,并可在推理时通过单一权重调节口音强度,无需重新训练。该方法基于 F5-TTS,采用参数高效的 LoRA 适配;推理时无需口音标签,也无需合成后的波形转换。在已见口音上,增强引导使口音检测器准确率从 6.5% 提升至 19.6%。对于已见及训练分布外的口音,DEFINE 的口音迁移表现与由两个模型组成的 TTS 和语音转换级联系统相当,同时说话者相似度更高,预测语音质量相近。但它未能泛化到训练时留出的口音。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。