AI 模型与 LLM 精选AI Agent技能库
AI 模型与 LLM分类下的高质量技能
GLMV-Grounding
一种强大的空间推理技能,利用 GLM-V 原生 grounding 来识别、追踪并可视化图像和视频中的对象坐标。
volc-vision
一个专业级的视觉分析技能,利用 Volcengine ARK API 进行图像描述和视觉问答。
MiniMax Coding Plan Tool
一个通过 MiniMax Coding Plan API 提供实时 Web Search 和 Vision Language Model (VLM) 能力的高性能实用工具。
GLM-V Caption
一个强大的多模态工具,通过智谱 GLM-V 模型为视觉媒体和文档生成详细的说明与解读。
Vultr Inference
一个全面的 AI 技能,通过 Vultr 优化的全球推理基础设施生成逼真的图像和高性能的文本补全。
VLM Image Helper
一个专门的视觉辅助工具,旨在预处理和增强图像,以确保 Vision Language Models 和 OCR 工作流的最高准确性。
Grounding 多模态目标检测
一种多模态 Grounding 技能,利用 GLM-4.7V 以精确的边界框检测并定位图像中的物体、文本或 UI 元素。
SGLang-Diffusion 视频生成
一个功能强大的本地视频生成技能,供 AI 智能体使用 SGLang-Diffusion 和 Openclaw Skills 从文本或图像渲染内容。
腾讯云 FaceID 人脸检测
一款专业级的人脸检测技能,利用腾讯云 IAI API 从图像中提取精确的人脸坐标、属性和质量指标。
MiniMax
一个用于编排 MiniMax 多模态 API 的专业集成技能,涵盖文本、语音、视频和音乐生成,并具备高级模型路由功能。
Ollama Vision Skill
一种本地视觉分析技能,使 AI 智能体能够在不依赖云端的情况下,使用 Ollama 模型执行 OCR 和图像描述。
GLM-4.6V Connector
智谱 AI GLM-4.6V 多模态模型的专业集成,支持先进的视觉理解和长文档分析。
Video Editing AI Gemini
一款基于云端的 AI 视频编辑器,使用 Gemini AI 和远程 GPU 渲染自动完成剪辑、转场和字幕制作。
计算机视觉专家
一位专注于利用 2026 年最先进模型进行实时检测、可提示分割和 3D 空间推理的高级视觉系统架构师。
火15漫画剧本与分镜生成器
一个专门的 AI 代理技能,可将单句主题转换为用于专业制作的全面、结构化 JSON 漫画剧本和分镜。
Minimax Vision Skill
一个基于 CLI 的技能,旨在赋能 AI Agent,使其能够利用 MiniMax 平台执行高级图像分析和视觉理解任务。
MMX: MiniMax 多模态 CLI
一个全面的多模态接口,可通过 MiniMax CLI 生成和分析文本、图像、视频、语音和音乐。
MiniMax MMX-CLI
一个全面的命令行界面,供 AI 智能体访问 MiniMax 的全套多模态功能,包括视频、音频和图像生成。
Volcengine AI
一款全面的多模态 AI 技能,提供字节跳动 Volcengine Ark 能力,用于生成和理解图像与视频。
Vision Analyzer
一款先进的视觉智能工具,利用 Kimi K2.5 多模态能力,通过 Ollama Cloud API 对图像进行描述和解读。