| name | MiMo视觉识别 |
| description | 调用小米 MiMo-V2.5 多模态模型识别/理解图片。这是 Agent 的"眼睛"——当用户发来图片、截图、照片,或 Agent 需要查看图片内容来回答问题、理解上下文时触发。 |
MiMo 视觉识别
调用 ~/.claude/skills/mimo-vision/scripts/mimo_vision.py 通过小米 MiMo-V2.5 全模态 API 理解图片内容。这是我(Agent)唯一的视觉能力来源——没有这个工具我就是"盲人"。
触发规则
以下任一情况必须调用此 skill:
- 用户直接发图片 → 我收到图片路径或看到图片时,立即调用此脚本获取图片内容
- 用户提到"看看这个"、"这个图"、"截图里"、"看图" → 调用脚本
- Agent 需要查看图片才能回答 → 主动调用(如"帮我分析这个UI截图"、"这个设计图有什么问题")
- 用户说"你看下"、"帮我看下" → 调用脚本
- 任何需要视觉理解的场景 → 调用脚本,不要猜测图片内容
⚠️ 关键规则:先看再答
禁止在没看到图片的情况下猜测或编造图片内容。 如果用户发来一张图并问问题,步骤如下:
- 立即运行
mimo_vision.py -i <图片路径> -p "<合适的问题>"
- 读取脚本的 stdout 输出,这就是我对那张图的理解
- 基于识别结果回答用户
如果没有调用脚本,我就不知道图片里有什么。
命令示例
基础识别——描述图片
python3 ~/.claude/skills/mimo-vision/scripts/mimo_vision.py -i "图片路径"
专项识别——带针对性问题
python3 ~/.claude/skills/mimo-vision/scripts/mimo_vision.py -i "截图.png" -p "图片中有哪些按钮和菜单?请逐条列出。"
多图对比
python3 ~/.claude/skills/mimo-vision/scripts/mimo_vision.py -i "修改前.png" -i "修改后.png" -p "这两张图有什么不同?"
文字提取
python3 ~/.claude/skills/mimo-vision/scripts/mimo_vision.py -i "文档.jpg" -p "提取图片中所有文字,保持原有排版结构。"
v2 新功能:结构化分析
mimo_vision.py -i "参考图.png" --structured -o analysis.json
mimo_vision.py -i "新图标.png" --compare "参考图集.png" -o compare.json
mimo_vision.py -i "图片.png" --info
保存到文件(避免 Windows 终端乱码)
mimo_vision.py -i "图片.png" -p "描述这张图" -o result.txt
全部参数
| 参数 | 说明 | 默认值 |
|---|
-i / --image | 图片路径(可重复传入多张) | 必填 |
-p / --prompt | 提问/指令 | 请详细描述这张图片的内容。 |
-S / --structured | v2 结构化风格分析(自动 prompt + JSON 输出) | 否 |
-C / --compare | v2 对比模式,传入参考图路径 | 无 |
--info | v2 仅输出 PIL 技术信息(无 API 调用) | 否 |
-o / --output | v2 保存输出到文件(UTF-8,解决乱码) | stdout |
-m / --model | 模型名 | mimo-v2.5 |
--max-tokens | 最大输出 token 数 | 4096 |
--temperature | 采样温度 [0, 1.5] | 1.0 |
--top-p | 核采样阈值 [0.01, 1.0] | 0.95 |
-r / --raw | 输出完整 JSON 响应 | 否 |
模型特性
- MiMo-V2.5:310B MoE,15B 激活参数,支持图文音视频全模态,128K 上下文
- 支持中英文混合输入,中文 prompt 效果良好
- 单张图片建议控制文件大小,过大可能导致 400 错误
- 超时 120 秒,大图或复杂任务可能较慢
使用场景示例
| 用户说什么 | 我应该做什么 |
|---|
| "帮我看看这张图" | mimo_vision.py -i 图片 -p "请详细描述这张图片。" |
| "这个报错截图啥意思?" | mimo_vision.py -i 截图 -p "这是一个报错截图,请识别错误信息并解释原因。" |
| "这个设计和那个设计哪个好?" | mimo_vision.py -i 设计A -i 设计B -p "从设计角度比较这两张图,给出优劣分析。" |
| 用户发来一张游戏截图 | mimo_vision.py -i 截图 -p "请详细描述这个游戏画面中的内容,包括UI、角色、场景等。" |
API 信息
- 端点:
POST https://api.xiaomimimo.com/v1/chat/completions
- 认证:
api-key: $MIMO_API_KEY(已配置在 settings.local.json)
- 模型:
mimo-v2.5
- 能力:图片理解、视频理解、音频理解、文本对话
- 参考文档:https://platform.xiaomimimo.com
注意事项
- 主动使用!当用户的问题需要看图才能准确回答时,不要猜,直接调脚本看
--prompt 要具体明确——"提取所有文字"比"看看"效果好得多
- 脚本 stdout 就是我对图片的认知,我应该在回复中基于这个认知来回答用户
- 如果脚本报编码错误,用
--raw 获取 JSON 再从中提取 content