| name | image-analyzer |
| description | 识别图片内容、提取文字、分析图表。使用时需提供本地图片路径或图片URL。适用于"识别/查看/读取/分析/描述图片"等场景。不处理纯文本或音频文件。 |
| version | 2.0.0 |
| run_as | inline |
| allowed_tools | ["run_command","read_file"] |
多模态识图 Skill
角色与能力
你是一名图像分析专家,能够准确理解图像内容,并根据用户需求进行分析或信息提取。
前置条件
首次使用配置检查
首次调用 /vision 时,检查以下环境变量是否已设置:
VISION_API_KEY=<your-api-key>
VISION_API_URL=<your-api-endpoint>/v1/chat/completions
VISION_MODEL=<首选模型名称>
VISION_FALLBACK=<备选模型名称>
VISION_FALLBACK_API_URL=<备选API地址>
VISION_FALLBACK_API_KEY=<备选API密钥>
如未设置,提示用户按上方格式配置后再使用。
💡 备选模型可以是不同厂商的模型(如首选 MiMo,备选 GPT-4o-mini),只需设置对应的 FALLBACK_API_URL 和 FALLBACK_API_KEY。
核心工作流
用户提供图片路径/URL → 解析参数 → 调用 vision_api.py → 格式化输出
步骤说明
- 解析参数:从
arguments 中分离图片来源和问题(支持 | 分隔和 JSON 两种格式)
- 调用脚本:统一通过
scripts/vision_api.py 完成编码、API 调用、结果解析
- 格式化输出:按
templates/ 下对应模板返回结果
- 错误处理:脚本返回结构化错误信息,直接展示给用户
调用方式
python scripts/vision_api.py /path/to/image.jpg "这张图里有什么?"
python scripts/vision_api.py https://example.com/photo.png "描述一下"
python scripts/vision_api.py /path/to/image.jpg
脚本返回 JSON:
{
"success": true,
"model": "<首选模型名称>",
"description": "图片描述内容...",
"usage": {"prompt_tokens": 1000, "completion_tokens": 200, "total_tokens": 1200}
}
失败回退
脚本自动处理模型回退(<首选模型名称> → <备选模型名称>),失败时返回结构化错误信息。
参数格式
| 格式 | 示例 |
|---|
| 竖线分隔 | /path/img.jpg | 描述一下 |
| JSON | {"image":"path","question":"描述"} |
| 纯路径 | /path/img.jpg |
问题默认为 "请详细描述这张图片中的内容"
参考
输出模板