Skip to main content

vision-language-models

Vision-language models, multimodal AI, and visual reasoning

Ir a la instalación

Datos de origen

Repositorio
NeuralBlitz/Mito
Última actividad en el origen
22 de marzo de 2026 a las 13:29
Idioma detectado de SKILL.md
inglés
Estrellas
0
Forks
0

Opciones de instalación

De forma predeterminada está seleccionado el prompt que primero revisa el origen. Puedes cambiar a un comando directo o descargar una copia local.

Revisa los archivos de origen

Lee SKILL.md y los archivos complementarios que muestra SkillsMP antes de decidir si quieres instalarlo.

Mostrando SKILL.md

SKILL.md
Instrucciones de origen · Vista previa de solo lectura
name
vision-language-models
description
Vision-language models, multimodal AI, and visual reasoning
license
MIT
compatibility
opencode
metadata
{"audience":"researchers","category":"machine-learning"}
## What I do - Build vision-language models - Work with CLIP, BLIP, LLaVA - Perform visual question answering - Create multimodal chatbots ## When to use me When building systems that combine vision and language. ## Key Concepts - CLIP - BLIP and BLIP-2 - LLaVA - Visual instruction tuning - Cross-modal attention - Image-text matching - Multimodal reasoning
Ver en GitHub