一键导入
vision-universal
通用识图工具,支持本地图片和远程URL。原生多模态端点优先,兼容所有OpenAI格式的多模态API(GPT-4o、MiMo、Claude等)。当用户需要分析图片、提取图中文字、识别图片内容时使用。
用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。
菜单
通用识图工具,支持本地图片和远程URL。原生多模态端点优先,兼容所有OpenAI格式的多模态API(GPT-4o、MiMo、Claude等)。当用户需要分析图片、提取图中文字、识别图片内容时使用。
用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。
基于 SOC 职业分类
通用下载编排器。下载公开可访问、开源授权或用户本人授权的数字资源;提供 inspect_download_url、download_direct_file、download_video、list_downloads 四个工具。
本地双层知识库检索与问答。用户要求从知识库、资料目录或本地文档中查信息、总结、核对来源时使用。先按 data_structure.md 分层导航,再渐进检索候选文件;遇到 PDF/Excel 时先读取本 Skill 的 references 处理指南。
双模式记忆管理:保存、读取、搜索、删除、审阅和清理用户记忆。被动模式只处理临时层;主动审阅读取临时+永久并将有价值内容晋升到永久层。用户要求记住、忘记、搜索记忆、审阅记忆、清理记忆时使用。
VOTX Agent run_command tool usage guide for safe local command execution.
创建或更新 VOTX Agent Skill 的指导技能。用于设计 SKILL.md、工具型或指令型 Skill、scripts/references/assets 资源、触发描述、渐进式披露结构,以及验证现有 Skill 是否适配框架。
将复杂用户请求自动分解为可执行步骤计划,可视化进度,支持暂停/继续/中止。受用户 config.json 中 task_plan.accept_task 控制。
| name | vision_universal |
| description | 通用识图工具,支持本地图片和远程URL。原生多模态端点优先,兼容所有OpenAI格式的多模态API(GPT-4o、MiMo、Claude等)。当用户需要分析图片、提取图中文字、识别图片内容时使用。 |
| version | 1.2 |
| category | multimodal |
| enabled | true |
| tags | ["multimodal","vision","image-analysis"] |
使用多模态模型分析图片内容,支持多图和单图。
plugins/vision_universal/
直接调用 provider.respond() 将图片注入 chat messages,走多模态模型的 Chat Completions API,无需额外配置。
vision_model(config.json 专用配置)> 默认聊天模型 model
如配置 "vision_model": "xiaomi/mimo-v2.5",识图使用 MiMo;不配则使用聊天模型自动检测。
| 工具名 | 描述 |
|---|---|
vision_analyze | 分析单张或多张图片,支持本地文件和远程 URL |
vision_universal | 兼容旧名,功能同 vision_analyze,优先使用 images 参数 |
image 参数为兼容旧调用保留,实际调用时优先使用 images(列表)。
| 参数 | 类型 | 必需 | 默认值 | 说明 |
|---|---|---|---|---|
images | string[] | 否 | — | 图片路径列表(本地文件路径或 http/https URL)。优先使用此参数 |
image | string | 否 | — | 单张图片路径(兼容旧参数,优先使用 images) |
prompt | string | 否 | "描述这些图片的内容" | 分析提示词 |
detail | string | 否 | "auto" | 图片解析精度。常见值:auto / low / high。仅 OpenAI 系列支持此参数,其他厂商忽略 |
ERROR: 前缀的错误信息vision_model 或确认当前模型支持多模态jpg、png、gif、webp、bmp(本地自动转 base64)、远程 http/https URL
qwen/qwen2.5-vl、xiaomi/mimo-v2.5)| 场景 | prompt 示例 |
|---|---|
| 描述图片 | (默认)"描述这些图片的内容" |
| OCR 提取 | "提取图片中的所有文字" |
| 图表分析 | "分析这个图表的数据趋势" |
| 内容问答 | "图片中有几个人?他们在做什么?" |
| 多图对比 | images=["before.jpg", "after.jpg"] + "对比这两张图片的差异" |
prompt 越具体分析结果越精准vision_model 指定支持多模态的模型detail 参数仅 OpenAI 系列生效,其他厂商会忽略此参数image 和 images 同时传入时,优先使用 images 列表