AI 模型与 LLM 精选AI Agent技能库
AI 模型与 LLM分类下的高质量技能
MiniMax 音乐生成
一个强大的 AI 技能,通过 MiniMax music-2.6 模型生成自定义器乐和人声歌曲。
AI 算命师
一款智能玄学助手,结合了中国传统八字分析、塔罗占卜与先进的 AI 可视化技术。
Oatda Vision Analysis
一个统一的接口,用于使用 GPT-4o、Claude 和 Gemini 等最先进的视觉模型进行图像分析和 OCR。
OneABC AI 模型访问
一个通用的 skill,用于通过 OneABC API 访问广泛的 AI 模型,包括聊天、图像、视频和音乐生成。
Aliyun Qwen VL
一个专业级多模态技能,使 AI 智能体能够使用阿里巴巴云 Qwen VL 模型分析图像、读取图表并执行结构化视觉数据提取。
阿里云通义千问 OCR
一种专为 AI 智能体设计的 OCR 技能,利用阿里云通义千问模型执行高精度文档解析、表格提取和多语言文本识别。
阿里云 QVQ 视觉推理
一种使用阿里云 QVQ 模型执行复杂视觉推理和多步问题求解的专业技能。
Step3-VL-10B 微调技能
一种在 GPU 集群上使用 LoRA 或全参数方法对 Step3-VL-10B 视觉语言模型进行微调的技术工作流。
Kimi K2.5 视觉集成
这是一个专门的视觉技能,旨在为 OpenClaw 生态系统中的 Alibaba DashScope GLM 用户提供 Kimi K2.5 图像识别能力。
Zeelin Script Gen Skill V4
一款专业的 AI 驱动技能,可将文本文档转换为结构化的电影剧本、角色档案和逐场分镜脚本。
Gemini Integration for OOMOL (oo-gemini)
一种安全的、服务器端凭据注入 skill,用于与 Google Gemini 模型交互,支持文本生成、嵌入、图像创建和 Veo 视频操作。
OpenAI Skill for OpenClaw
一个综合工具集,允许 OpenClaw 代理通过安全的 ClawLink 代理管理 OpenAI assistants、files、vector stores、fine-tuning 和媒体生成。
AI Compute (ai-compute-x402)
一个拥有 27 个端点的 AI 计算智能体,提供无缝的 LLM 推理、图像/视频生成、语音合成、链上智能,以及由 x402 微支付驱动的 Bittensor 去中心化 AI。
多模态图像理解技能
一项桥接技能,使纯文本 AI 模型能够通过 OpenAI 或 Anthropic 协议对图像进行分析、OCR 和细节提取。
Prompt Engineering Plus
一个先进的多模态 Prompt Engineering 工具包,旨在优化领先的 LLM、图像生成引擎和视频 AI 模型的输入。
Flower Care AI 识别与养护
一款 AI 驱动的园艺助手,可通过图像识别植物,并生成专业的、多维度的养护指南及交互式 HTML 报告。
PaddleOCR-VL GPU OCR 与文档解析器
通过 PaddleOCR-VL 在安全、临时的 Docker 容器中实现高性能 GPU 加速文本提取与文档布局解析。
AI 漫画与剧本改编审查专家
一个先进的脚本诊断引擎,通过 25 个叙事维度审查分镜、网漫和微短剧,确保作品具备病毒式传播的改编潜质。
TokenLab API Integration
一个旨在将 TokenLab 聊天、图像、音频和视频 API 系列集成至应用程序中的系统,具有动态模型发现和自动恢复路径。
Bring Your Own Model
将自定义 safetensors 模型(包括 LoRA 和 checkpoint)导入 Runware,以便使用唯一的 AIR 句柄执行服务器端图像推理。