AI 语音与转录 精选AI Agent技能库
AI 语音与转录分类下的高质量技能
OmniVoice
OmniVoice 是一个为 AI 代理打造的全方位语音身份工具包,具有独特的说话人识别和高保真语音克隆功能。
语音克隆 & TTS
一个强大的音频工程技能,用于克隆声纹并在多个 AI 后端生成高保真语音。
Fish Audio
一个专业级 AI 音频生成技能,通过 Fish Audio API 提供文本转语音和语音克隆功能。
Kai MiniMax TTS
一个专业级技能,用于使用 MiniMax API 和 Whisper 生成语音音频及转录语音。
Neomano TTS
一个由 ElevenLabs 提供支持的高保真文本转语音集成,用于在 AI agent 工作流中生成逼真的音频响应。
ListenClaw Voice Gateway
ListenClaw 是一个专业的语音网关技能,旨在优化 AI 智能体的响应,使其符合自然口语并实现无缝的 TTS 交付。
SenseAudio Voice Chatbot
一个用于构建具有情感识别和可定制个性化实时语音 AI 聊天机器人的高级集成方案。
SenseAudio ASR
一个全面的 AI 技能,用于通过 SenseAudio 构建强大的语音识别、说话人识别和实时音频分析集成。
SenseAudio Voice
一个全面的语音交互技能,通过基于语言的智能引擎选择提供高保真文本转语音和语音转文本功能。
Video to Text Online Free
一个高性能的 AI 代理技能,用于通过云端 GPU 处理将视频语音转换为可编辑的文本转录稿。
OpenAI Whisper STT
由 SkillBoss API Hub 提供支持的高性能 Whisper 语音转文本技能,用于无缝音频转录和翻译。
Discord Voice
在 Discord 语音频道中直接与 Claude AI 进行实时、低延迟的语音对话。
通过 SkillBoss 使用 OpenAI Whisper
一种利用 SkillBoss API Hub 的云端语音转文本集成,无需本地模型开销即可提供高精度的 Whisper 转录。
Google Chirp 3 HD TTS
一种高清生成式语音合成技能,利用 Google Cloud Chirp 3 HD 模型实现超逼真、富有情感表现力的音频输出。
语音模式
一种专门用于将 AI 智能体回复转换为针对文本转语音引擎优化的自然、具有情感意识的中文口语的技能。
Fun-ASR-File
一个强大的端到端语音识别技能,使用阿里巴巴 DashScope 将本地音频文件转换为准确的文本。
Edge TTS Skill
一种经济高效的 Openclaw 文本转语音解决方案,利用 Microsoft Edge 神经语音提供逼真的音频合成,无需 API key。
MiMo TTS
这是一个由 Xiaomi MiMo v2 模型驱动的复杂文本转语音引擎,使 AI 智能体能够生成具有情感和方言细微差别的表现力音频。
MiMo Voice Assistant
一套高性能语音套件,为 AI 智能体提供情感感知文本转语音 (TTS) 和转录功能。
本地 TTS 工作流
一个用于配置、调试和优化本地兼容 OpenAI 的文本转语音服务器的综合框架。