AI 语音与转录 精选AI Agent技能库
AI 语音与转录分类下的高质量技能
Whisper ASR 本地语音转文字
一个强大的本地语音识别技能,可将来自飞书和 Telegram 等平台的音频消息转换为文字,无需外部 API。
mp4-to-srt
一个自动化的 CLI 工具,利用 Whisper AI 将视频转录为高质量的 SRT 字幕文件,并内置繁体中文支持。
Whisper (CLI) 本地语音转文字
一个强大的本地语音转文字引擎,使用 OpenAI 的 Whisper 模型转录音频,无需外部 API key。
winmsg-tts: 本地 Windows 文本转语音
一款利用窗口消息实时朗读 AI 响应的本地 Windows TTS 引擎,实现零 Token 成本。
久马免费声音克隆
一个由 AI 驱动的声音克隆和语音合成技能,利用久马 AI API 从文本生成高质量音频。
Coze ASR
一个利用 Coze API 将 MP3、WAV 和 OGG 音频文件转录为结构化 JSON 文本的自动语音识别工具。
Coze 文本转语音 (TTS)
一个强大的 CLI 工具,利用 Coze API 和 Openclaw Skills 架构将文本转换为自然听感的语音。
MiMo TTS & ASR
一款专业级语音工具包,提供高保真文本转语音(TTS)、语音克隆和自动语音识别(ASR),并具备强大的缓存和故障转移机制。
OpenClaw ASR
一款先进的转录与终端日志解析工具,旨在将媒体和会话录制转换为结构化的 AI 就绪数据。
FunASR 本地语音识别
一个针对内存优化的本地语音识别技能,利用阿里巴巴达摩院的 FunASR 实现高精度的多语言转录。
Xeon TTS
Xeon TTS 为 OpenClaw 提供高性能、本地化的语音克隆和情感语音合成,采用经过 OpenVINO 优化的 Qwen3-TTS 模型。
新闻摘要语音
一个跨平台的自动化工具,聚合全球 RSS 订阅源的新闻并生成合成语音摘要。
video-to-text
一个免费的、由 API 驱动的技能,用于将视频和音频文件转换为纯文本或 SRT 字幕,无需本地下载。
Smallest AI - 超快速语音套件
一个高性能语音处理技能,提供闪电般的文本转语音和准确的语音转文本,支持 30 多种语言。
LMNT
一个强大的集成工具,用于通过 Membrane 生态系统管理从语音合成到资产管理的 LMNT Speech AI 工作流。
阿里云外呼机器人
一个强大的自动化技能,连接到阿里云外呼机器人,用于管理大规模语音通话活动和实时任务跟踪。
SenseAudio Polyphone TTS
一个专业工具,通过自定义词典应用精确的拼音标注,解决 TTS 中中文多音字的发音错误问题。
SenseVoice Transcribe
一种高性能转录技能,使用 SenseVoice-Small 和 FSMN-VAD 将音频转换为带有时间戳的文本,具有卓越的准确性且无幻觉。
Deepgram Voice Workflow
一个全面的端到端语音自动化技能,使用 Deepgram 处理语音转文本和文本转语音工作流。
MOSI Studio Audio Suite
一个专为 AI 智能体优化的全面音频工具包,涵盖语音转文本、文本转语音及语音克隆功能。