AI 语音与转录 精选AI Agent技能库
AI 语音与转录分类下的高质量技能
火山引擎 AI 音频 TTS
一款基于 AI 的文本转语音技能,利用火山引擎的字节跳动语音服务提供高质量、多语言的旁白和语音合成。
EachLabs 语音与音频
一个全面的 AI 音频套件,通过 EachLabs Predictions API 提供文本转语音、转录、语音转换和音频工具。
语音聊天
一种为 AI 智能体提供的双向语音通信技能,利用集成的 Openclaw Skills STT 和 TTS 工具通过语音进行交互。
Faster Whisper GPU
一款利用 NVIDIA GPU 加速进行本地语音转文字转录的高性能、隐私优先工具。
智谱 AI 文本转语音 (GLM-TTS)
一款由智谱 AI GLM-TTS 模型驱动的高质量文本转语音引擎,专注于自然的中文语音合成。
语音识别 (Whisper)
一款基于 OpenAI Whisper 的本地高精度语音转文字工具,支持 100 多种语言的转录、翻译和摘要。
Parakeet 本地 ASR
一个采用 NVIDIA Parakeet 的本地、隐私优先的语音识别引擎,为 Openclaw Skills 提供兼容 OpenAI 的转写服务。
海螺语音合成与设计
一款由 Minimax API 驱动的专业级音频合成技能,用于高保真文本转语音、声音克隆和自然语言语音设计。
免费 Groq 语音识别
一种高性能、免费的语音识别技能,利用 Groq 的 Whisper API 实现 50 多种语言的近乎瞬时的语音转文本。
Sarvam AI
一个用于印度语言处理的综合工具包,包括语音转文本、文本转语音、翻译和聊天功能。
CloneV AI 声音克隆
一款高保真声音克隆技能,可根据短小的参考音频样本生成 14 种以上语言的自然语音。
音频处理
一套基于 Whisper 和 Librosa 的音频摄取、分析、转换和生成的综合工具集。
VibeVoice TTS
一个高性能的本地文本转语音引擎,专门针对西班牙语语音合成和移动即时通讯进行了优化。
ElevenLabs 语音与转录
一款由 ElevenLabs 驱动的双用途语音解决方案,提供高保真文本转语音合成和精准的语音转文本转录。
Qwen3-TTS 本地推理
一个高性能的本地 Python 引擎,利用 Qwen3-TTS 生成语音、设计声音和克隆音频,无需外部 API 依赖。
Whisper Transcribe
一款多功能的语音转文本工具,利用 OpenAI Whisper 将音频和视频文件转录为多种字幕和文本格式。
voiceclaw-jp
一个为 OpenClaw 设计的语音优先界面,支持通过唤醒词、流式 LLM 响应和 VOICEVOX 文本转语音实现实时语音对话。
SiliconFlow TTS 生成
一个利用 SiliconFlow API 和 CosyVoice2 模型实现逼真语音合成的高性能文本转语音技能。
TogetherAI TTS
一种高性能的文本转语音集成,利用 TogetherAI API 和 MiniMax 模型实现逼真的音频合成。
Groq Whisper API
通过简化的 curl 接口利用 Groq 专用 ASR 模型实现高速音频转录。