| name | ms-qwen-vl |
| description | 调用魔搭社区(ModelScope)Qwen3-VL 多模态 API 进行视觉解析。使用 OpenAI SDK 兼容方式调用,支持图片内容描述、OCR 文字提取、视觉问答、对象检测等功能。用户提到"魔搭"、"ModelScope"、"Qwen-VL"、"多模态视觉"、"解析图片"等关键词时应触发。 |
MS-Qwen-VL Skill
基于 ModelScope Qwen3-VL 系列模型的多模态视觉识别技能,使用 OpenAI SDK 兼容方式调用。
功能特点
- OpenAI SDK 兼容:使用标准 OpenAI SDK 调用 API
- 多种任务支持:图像描述、OCR、视觉问答、目标检测、图表解析
- 双模型模式:默认快速模型(30B)+ 精细高精度模型(235B)
- 灵活输入:支持本地图片和 URL
安装与配置
pip install -r requirements.txt
cp .env.example .env
编辑 .env 文件,填入从 https://modelscope.cn/my/myaccesstoken 获取的 API Key:
MODELSCOPE_API_KEY=your_api_key_here
Claude Code 使用方式
重要:处理本地图片
当用户提供本地图片路径时(如桌面截图),必须使用 Python 脚本处理:
python scripts/ms_qwen_vl.py "<图片路径>" --task <任务类型>
脚本会自动将本地文件转换为 ModelScope API 需要的 base64 格式。
处理 URL 图片
当用户提供网络 URL 时,同样使用上述命令,脚本会自动识别:
python scripts/ms_qwen_vl.py "<URL>" --task <任务类型>
Claude Code 对话示例
场景 1:分析桌面截图
用户: 请帮我描述这张图片 C:\Users\...\Desktop\screenshot.png
助手: [执行] python scripts/ms_qwen_vl.py "C:\Users\...\Desktop\screenshot.png"
场景 2:OCR 识别本地图片
用户: 识别这张图中的文字: D:\Documents\invoice.jpg
助手: [执行] python scripts/ms_qwen_vl.py "D:\Documents\invoice.jpg" --task ocr