| name | vision-analyzer |
| description | Analyze image content with multi-language output and comprehensive type detection. Use when user mentions image analysis, analyze picture, photo analysis, visual inspection, 图片分析, 图像识别, 看图, 分析图片, 截图, 图表. |
| user-invocable | true |
| model | sonnet |
| trigger-keywords | ["图片","图像","截图","照片","图标","图表","视觉","分析图片","描述图片","识别图片","图片内容","图像分析","看图说话","图片描述","image","picture","photo","screenshot","chart","graph","diagram","analyze image","describe image","what's in this image",".png",".jpg",".jpeg",".gif",".webp",".bmp"] |
视觉分析技能
基于 Qwen-VL 的自动图片分析系统,为 OpenCode 提供强大的视觉能力。
核心功能
- 自动触发图片分析:当检测到图片路径、URL或相关关键词时自动分析
- 多语言支持:中文、英文、日文、韩文、法文、西班牙文、德文
- 综合类型分析:对象识别、场景理解、文本提取、颜色分析、布局分析
- 详细程度控制:简要、普通、详细、全面四种分析级别
技术特性
- 使用 DashScope 国际区的 Qwen-VL-Plus 模型
- 支持本地图片文件和网络图片URL
- 智能图片预处理和格式转换
- 结果缓存(1小时TTL)以提高性能
- 完整的错误处理和用户友好提示
- 统计信息和性能监控
自动检测规则
当以下情况出现时自动触发图片分析:
- 文件路径检测:消息中包含
.png、.jpg、.jpeg、.gif、.webp、.bmp等扩展名
- URL检测:消息中包含
http://或https://的图片链接
- 关键词触发:用户明确请求图片分析、描述或识别
- 上下文感知:在讨论图片相关内容时自动提供分析
使用方法
自动模式(推荐)
只需在对话中提到图片或相关关键词,系统会自动分析:
用户:帮我看看这个截图 C:\Users\曾金昌\Pictures\Screenshots\test.png
AI: [自动分析图片并提供详细描述]
手动调用
可以直接请求图片分析:
用户:请分析这张图片
用户:描述一下这个截图的内容
用户:这是什么图片?
用户:分析图片:https://example.com/image.jpg
多语言支持
系统会自动检测或根据用户请求使用相应语言:
用户:用英文分析这张图片
用户:Describe this image in English
用户:この画像を分析してください(日文)
配置说明
技能使用以下默认配置:
- API模型:
qwen-vl-plus
- 基础URL:
https://dashscope.aliyuncs.com/compatible-mode/v1
- 缓存目录:
~/.ds_cache/view_image/
- 最大图片大小:10MB
依赖要求
确保以下Python包已安装:
pip install openai httpx pillow
示例输出
[视觉分析结果] (耗时2.3秒 | 详细程度: 详细)
------------------------------------------------------------
这张图片显示了一个软件的代码编辑界面。界面分为左右两个主要部分:
左侧是一个文件浏览器,显示目录结构,包含多个文件夹如"src"、"tests"、"docs"等。
右侧是代码编辑器,显示Python代码,内容是关于数据处理的函数定义。
界面顶部有菜单栏,包含"File"、"Edit"、"View"等选项。代码编辑区域使用深色主题,
语法高亮显示关键字、字符串和注释。底部状态栏显示行号、列号和文件编码信息。
整体布局整洁专业,是典型的IDE(集成开发环境)界面。
------------------------------------------------------------
高级功能
详细程度控制
可以通过上下文指定分析详细程度:
- 简要(brief):简洁描述主要内容
- 普通(normal):标准详细描述(默认)
- 详细(detailed):包含更多细节
- 全面(comprehensive):完整分析,包括对象、场景、文本、颜色、布局等
多语言输出
支持以下语言代码:zh(中文)、en(英文)、ja(日文)、ko(韩文)、fr(法文)、es(西班牙文)、de(德文)
问题定制
可以指定特定的分析问题:
- "这张图片里有什么文字?"
- "图片的主要颜色是什么?"
- "分析图片中的人物和场景"
- "这是什么类型的图表?"
错误处理
系统会优雅处理各种错误情况:
- 文件不存在或无法访问
- 不支持的图片格式
- 文件过大(>10MB)
- 网络连接问题
- API调用失败
所有错误都会提供友好的中文提示和解决方案建议。
性能优化
- 缓存系统:相同图片的相同分析结果会被缓存1小时
- 图片预处理:自动调整过大图片尺寸,优化编码格式
- 并发支持:支持异步API调用提高响应速度
- 统计监控:跟踪成功率、平均响应时间等指标
集成提示
本技能设计为与OpenCode无缝集成:
- 自动检测对话中的图片引用
- 与现有工具和技能协同工作
- 保持OpenCode的对话风格和用户体验
- 提供有价值的上下文增强