AI 语音与转录 精选AI Agent技能库
AI 语音与转录分类下的高质量技能
MiniMax TTS AI 语音合成
一个命令行工具和集成脚本,使用高性能 MiniMax HTTP REST API 合成超逼真、多语言的文字转语音。
钉钉闪记会议纪要提取器
一个面向 AI 的命令行自动化技能,用于从钉钉闪记中提取会议纪要、摘要和转写文本。
音频设备诊断
一款旨在列出、验证和调试用于录音和转录工作流的硬件麦克风及音频输入配置的系统工具。
EVEZ Machine Voice Synthesizer
一个零成本的本地 DSP 引擎,可通过纯数学方程合成机器人引擎声音、齿轮磨损声和金属呼吸模式。
Supertonic TTS
一款超高速、本地化的多语言文本转语音引擎,由 Supertone 的 Supertonic ONNX 模型驱动,无需云端依赖即可在设备上生成语音。
QClaw Speaker
一个高效的、多引擎 CPU 文字转语音广播系统,旨在为本地 AI 编程助手提供自然的人声,且完全无需 GPU。
lx-whisper-transcribe
一个完全本地、离线的 Openclaw Skills 语音转文字工具,利用 whisper.cpp 在无需 API 密钥的情况下进行音频转写。
Videosays
一款 AI 驱动的视频转文本转录技能,旨在从各大短视频和视频托管平台中无缝提取口语文本、说明和字幕。
Xiaomi MiMo TTS Chapter Converter
一款人工智能驱动的命令行工具,旨在利用 Xiaomi MiMo TTS API 将 markdown 和文本章节批量转换为优质有声书。
ElevenLabs TTS
一款用于 ElevenLabs 的高性能文本转语音工具,专为安全的 API key 处理、实时语音列表检索、HTTP 流式传输及延迟优化音频生成而设计。
Fish Speech TTS
一款用于 Openclaw Skills 的高性能本地文本转语音(TTS)智能体技能,专为富有表现力的语音克隆、智能情感标记和多段合成而设计。
tts-qwen3
一个先进的本地语音合成引擎,利用 Qwen3-TTS 1.7B 模型支持声音克隆、自定义语音设计和多角色对话合成。
Edge 文本转语音 (tts-cosyvoice)
一个开源、无需订阅的文本转语音工具,可直接从您的命令行环境利用 Microsoft Edge 的逼真神经语音。
mimo-asr
一个零依赖的语音转文字技能,通过免费的 Gradio API 封装器利用小米官方 MiMo-V2.5-ASR 模型。
Audio Transcribe
一个注重隐私的本地音频转录技能,使用 OpenAI 的 Whisper 模型将语音转换为文本、字幕 (SRT) 或 JSON。
Subtitle SRT Export
一个轻量级、无需 API 的 CLI 工具,用于将精细的逐词音频时间轴转换为整洁、平台兼容的 SRT 字幕文件。
视频转录 TXT
将一个或多个本地视频转换为整洁、带时间戳的 TXT 转录文本,不修改原始媒体。
Mobayilo Voice
一种安全优先的语音自动化技能,使 AI 代理能够拨打外呼电话进行预订和随访。
语音转录器
一款为 Openclaw Skills 用户打造,由 Deepgram Nova-3 提供支持的高性能音频转录和语音笔记归档工具。
audio-summary
一款专门用于从视频文件中提取音频并生成自动化 AI 驱动转录和摘要的工具。