AI 语音与转录 精选AI Agent技能库
AI 语音与转录分类下的高质量技能
Audio Tools
一套全面的媒体处理工具包,用于通过 AI 驱动的工作流提取、剪辑、播放和转录音频/视频文件。
TTS (Text-to-Speech)
一个精简的工具,用于使用专业级语音模型将文本转换为自然流畅的语音。
文字转语音 (TTS)
一个由 AI 驱动的工具,通过 SkillBoss API Hub 将文本字符串转换为高质量的 MP3 音频文件。
Edge TTS Auto
一个为 Openclaw Skills 设计的零配置文本转语音技能,自动处理依赖并生成高质量神经网络音频。
Whisper 语音转写
一款私有、本地的语音转文字实用工具,利用 whisper.cpp 在 Openclaw Skills 中进行高性能音频转写。
minimax-tts
一款先进的文本转语音技能,可将文本转换为具有自动情绪检测和飞书集成的自然普通话音频。
LAS 音频提取与分割
一款利用 Volcengine LAS 从视频文件中提取高质量音频轨道并将其分割为固定长度片段的专业工具。
Gemini TTS
一款专用的音频生成工具,利用 Gemini 2.5 Flash 创建高质量、人格驱动的文本转语音输出。
OpenAI Text-to-Speech (TTS)
一款高性能技能,使用 OpenAI 先进的 TTS 模型将文本转换为自然、逼真的音频。
有声书创作技能
一个综合工具,支持多 TTS 提供商,旨在将 Web 内容和文本文件转换为专业级有声书。
gTTS (Google Text-to-Speech)
一个功能强大的基于 Python 的 skill,利用 Google 的 Text-to-Speech API 将书面内容转换为语音音频,且无需 API key。
字幕翻译技能
一款用于提取、转录并将音频/视频内容翻译为双语 SRT 字幕的专业自动化工具。
Audiobook Skill
一个全面的本地流水线,利用智能 AI 选角和 StepFun TTS 技术将原始文本转换为多角色有声书。
jarvis-vocal
一种神经文本转语音(TTS)技能,为您的 AI 智能体和 Android 设备带来逼真、电影级的 J.A.R.V.I.S. 语音。
MiniMax TTS 文字转语音
一个专业级的文字转语音技能,利用 MiniMax 先进的 AI 模型从文本生成高保真音频。
xia-zhuan-audio
一个由 FFmpeg 和 Whisper AI 驱动的综合音视频处理工具包,用于格式转换、音频提取和自动化转录。
Groq Whisper
一款极速的云端转录工具,利用 Groq 的 whisper-large-v3 模型在几秒钟内将音频转换为文本。
Xiaomi MiMo TTS Proxy
一个本地代理服务,通过集成的 FFmpeg 转码功能,将 OpenAI TTS API 请求转换为 Xiaomi MiMo 平台调用。
MAI Transcribe
通过 Azure AI Speech 集成的 Microsoft MAI-Transcribe-1 模型实现高精度音频转录。
MAI-Voice-1
一项通过 Azure AI Speech REST API 使用 Microsoft MAI-Voice-1 模型生成高保真语音的专业技能。