AudioPaLM:谷歌语音理解和生成AI大模型

AudioPaLM:谷歌语音理解和生成AI大模型

AudioPaLM 是一个大型语言模型,专为理解和生成语音而设计。AudioPaLM 将基于文本的和基于语音的语言模型,即 PaLM-2 和 AudioLM,融合到一个统一的多模态架构中,可以处理和生成文本和语音。

访问官网
产品详情
产品截图

AudioPaLM是什么?

AudioPaLM 是一个大型语言模型,专为理解和生成语音而设计。它由 Google 的研究团队开发,包括 Paul Rubenstein、Chulayuth Asawaroengchai、Duc Dung Nguyen 等人。AudioPaLM 将基于文本的和基于语音的语言模型,即 PaLM-2 和 AudioLM,融合到一个统一的多模态架构中,可以处理和生成文本和语音。这种模型的应用包括语音识别和语音到语音的翻译。

论文:https://huggingface.co/papers/2306.12925

演示 demo:https://google-research.github.io/seanet/audiopalm/examples/

AudioPaLM能力

AudioPaLM 继承了 AudioLM 的能力,可以保留诸如说话者身份和语调等副语言信息,同时也继承了只存在于大型文本语言模型(如 PaLM-2)中的语言知识。通过使用文本只读大型语言模型的权重初始化 AudioPaLM,可以改善语音处理,成功利用预训练中使用的大量文本训练数据来辅助语音任务。

AudioPaLM 的性能显著优于现有的语音翻译系统,并且具有执行许多语言的零样本语音到文本翻译的能力,即使在训练中没有看到输入/目标语言组合。AudioPaLM 还展示了音频语言模型的特性,例如根据短语音提示在语言之间转换声音。

主要功能

功能说明
工具名称AudioPaLM:谷歌语音理解和生成AI大模型
所属分类AI音频
标签AudioPaLM
收录时间2026-08-10 22:37:25
浏览次数908 次

扫码手机访问

二维码

使用手机扫描上方二维码访问

在当前页面打开