原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.38157
立即前往原文

EmoRES-TTS:通过残差增强向量引导生成情感语音

情绪条件语音合成模型有时无法稳定表达指定情绪。EmoRES 是一种无需训练的方法,可调整冻结模型的内部表示,而不必重新训练基础模型。该方法将情绪向量分解为使语音偏离中性表达的共享成分,以及引导生成指定情绪的残差成分,并分别进行控制。在 IEMOCAP 上,使用 IndexTTS-2 和 CosyVoice2 时,EmoRES 在四项客观情绪指标上均优于 CoCoEmo。人工评估也显示情绪识别和忠实度有所提升;在自然度的成对比较中,最多有 63.8% 的听众偏好 EmoRES。
行业资讯 应用 研究 2026-10-01 04:31:05 248 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。