Skip to main content

vision

You **MUST** use the vision skill when when the your model is text-only (e.g. glm-5.2, deepseek-v4-pro) AND: (1) the user's message contains images; (2) OR the user's message contains URLs or paths to images; (3) OR the user asks to visually verify/check something ("visually verify", "screenshot shows", "centered/visible/hidden", "looks right", "matches the design"); (5) OR a tool result contains an image attachment the current model cannot see (attachments[].mime = "image/png", url = "data:image/png;base64,..."); (4) OR you think it is necessary to READ any visual contents; Triggers on screenshots from chrome-devtools_take_screenshot, playwright_browser_take_screenshot, cua-driver_get_window_state/zoom/take_screenshot and cannot see images itself. Extracts the visual intent from context, designs a prompt-local JSON response template for that specific task, delegates, and parses the returned JSON.

Ir para a instalação

Informações da origem

Repositório
WeZZard/opencode-vision
Última atividade na origem
23 de julho de 2026 às 22:22
Idioma detectado do SKILL.md
inglês
Estrelas
26
Forks
0

Opções de instalação

Por padrão, está selecionado o prompt que primeiro revisa a origem. Você pode mudar para um comando direto ou baixar uma cópia local.

Revise os arquivos de origem

Leia o SKILL.md e os arquivos complementares exibidos pelo SkillsMP antes de decidir se vai instalar.