AI 语音与转录 精选AI Agent技能库
AI 语音与转录分类下的高质量技能
TTS Responder
一种 AI 代理技能,利用本地神经合成技术将文本回复转换为 Telegram 的高质量 OGG 语音消息。
openai-whisper
一个由 OpenAI Whisper 和 SkillBoss API Hub 驱动的 API 驱动型语音转文字和翻译技能。
Voice Agent
一个自主语音层,可克隆用户声音以生成高质量音频内容,并通过 ElevenLabs 和 Twilio 管理实时电话呼叫。
Douyin Content Tracker
一个专业的自动化流水线,用于抓取抖音创作者视频、提取高质量音频,并使用 OpenAI Whisper 生成精确的文本转录。
Media Processor
一款用于视频转码、编辑和语音转文本转录的企业级多媒体处理工具。
Web Video Transcribe Docx
一个优先考虑离线的作业流程,用于提取 Web 媒体并生成高质量的中文转录稿及 Word 文档。
Subtitle Generator Extension Chrome
一种 AI 驱动的视频处理技能,可利用云端 GPU 渲染生成、同步并将精确的字幕嵌入视频文件。
byted-kickart-subtitle-extractor
一个自动化的 AI 工具,可从 MP4 或 MOV 视频中提取嵌入的字幕,并将其转换为标准的 SRT 和 JSON 格式。
OpenClaw 语音 STT & TTS
一个全栈语音集成方案,使 AI 代理能够转录输入的音频并以高质量的合成语音进行回复。
edge-tts-uvx
一款利用 Microsoft Edge 神经语音技术的高保真文本转语音引擎,用于生成自然流畅的音频。
本地语音转文字 (Parakeet / Whisper)
一款高性能本地语音转文字工具,利用 Parakeet 和 Whisper 后端实现超快速、离线的音频转录。
VoiceClaw
VoiceClaw 使用 Whisper 和 Piper 为 Openclaw Skills 提供完全本地、离线的语音转文本和文本转语音功能。
speechall-cli
由多家领先 AI 供应商提供支持的专业语音转文字转录跨平台命令行工具。
Speak
一款由 Kokoro 驱动、为 AI 智能体设计的高性能本地文本转语音引擎。
Kokoro 文本转语音 (Speak)
一款由 Kokoro TTS 驱动的高质量本地文本转语音引擎,用于将文本、文件和书籍转换为自然流畅的音频。
mm-easy-voice
一个高性能的 Openclaw Skills 文本转语音工具,利用 MiniMax Voice API 将文本转换为自然的音频。
语音转文本 (Yandex SpeechKit)
一个为 Openclaw 设计的可扩展语音转文本集成,利用 Yandex SpeechKit 和 FFmpeg 将语音消息准确地转换为文本。
视频语音转文字工具
一个强大的实用程序,用于从视频 URL 中提取音频,并使用本地模型或云服务将其转换为准确的文本或字幕。
Edge TTS 英语
一款为 AI 智能体打造的高保真文本转语音引擎,利用 Microsoft Edge TTS 生成自然流畅的英语音频。
歌曲识别
利用先进的讯飞 ACRCloud 技术,通过哼唱、唱歌或录制的音频文件识别歌曲。