AI 语音与转录 精选AI Agent技能库
AI 语音与转录分类下的高质量技能
vwu.ai TTS Models
为 vwu.ai 文本转语音模型提供的专业集成,提供高清晰度和性能优化的音频合成。
STT Simple: 本地语音转文字
一个由 OpenAI Whisper 提供支持的本地语音转文字工具,专为 AI 智能体的私密、多语言转录及会话隔离而设计。
Voice Clone
一款由 CosyVoice v3.5 Plus 模型和 AI Artist API 驱动的专业级 AI 语音克隆与文本转语音引擎。
MiniMax Speech Skill
一个强大的音频生成工具,使用 MiniMax speech-2.8-hd 模型进行高保真文本转语音和专业声音克隆。
Gipformer ASR
一个高性能的越南语语音转文本技能,利用 Gipformer-RNNT 进行高效的长音频转录。
Moark-TTS Gitee AI 套件
一个为 Gitee AI 提供的全面文本转语音(TTS)和语音特征提取技能,支持超过 15 种最先进的语音模型。
Aliyun Speech Transcriber
一个强大的 AI 插件,利用 Aliyun DashScope 服务将公开访问的音频或视频 URL 转录为文本和 JSON。
本地语音转文字 (Whisper)
一个注重隐私、零成本的本地语音转文字技能,由 faster-whisper 驱动,实现即时音频转录。
ChatTTS 语音生成器
一款本地 AI 驱动的文本转语音引擎,针对对话真实感进行了优化,支持情感触发和稳定的语音生成。
AI 文本转语音 (TTS) 语音生成器
一款由 MiniMax 提供支持的尖端 AI 驱动语音合成工具,用于高质量多语言音频生成和语音克隆。
SenseAudio Voice Picker
一个智能推荐引擎,将特定的情感语调和场景映射到理想的 SenseAudio 语音 ID。
SenseAudio TTS
一个全面的开发人员工具包,用于在多个协议中构建、调试和优化 SenseAudio 文本转语音集成。
SenseAudio 开放平台
将 SenseAudio 开放平台 API 集成到您的开发工作流中,实现文字转语音、语音识别和实时 AI 智能体。
MOSS Voice Generator
一款革命性的文本转语音引擎,根据自然语言指令而非固定预设生成独特的语音风格。
阿里云 CosyVoice 语音设计
使用阿里云 CosyVoice 模型,通过自然语言描述创建自定义 AI 语音。
阿里云实时 ASR (Qwen)
一个利用阿里云百炼 Qwen ASR 模型进行流式音频处理的低延迟实时语音识别技能。
语音识别与转录
一个高性能音频转录工具,旨在利用先进的 AI 模型将 AMR 和 SILK 格式转换为可搜索的文本。
语音转录
一个基于 AI 的语音转文本技能,通过 SiliconFlow API 支持多种语言和中国方言。
Speech to Text API
一个高性能的语音转文本集成,通过单个 API key 提供零供应商加价的 OpenAI Whisper 功能。
Text to Speech API (SkillBoss)
一个统一的 API,提供对 ElevenLabs 和 OpenAI 等高级文本转语音引擎的直接访问,且零价格加价。