Skip to main content

vision-language-models

Vision-language models, multimodal AI, and visual reasoning

معلومات المصدر

المستودع
NeuralBlitz/Mito
آخر نشاط في المصدر
٢٢ مارس ٢٠٢٦ في ١٣:٢٩
لغة SKILL.md المكتشفة
الإنجليزية
النجوم
٠
التفرعات
٠

خيارات التثبيت

يُحدَّد Prompt الذي يراجع المصدر أولًا بشكل افتراضي. يمكنك التبديل إلى أمر مباشر أو تنزيل نسخة محلية.

مراجعة ملفات المصدر

اقرأ SKILL.md وأي ملفات مرافقة يعرضها SkillsMP قبل أن تقرر التثبيت.

عرض SKILL.md

SKILL.md
تعليمات المصدر · معاينة للقراءة فقط
name
vision-language-models
description
Vision-language models, multimodal AI, and visual reasoning
license
MIT
compatibility
opencode
metadata
{"audience":"researchers","category":"machine-learning"}
## What I do - Build vision-language models - Work with CLIP, BLIP, LLaVA - Perform visual question answering - Create multimodal chatbots ## When to use me When building systems that combine vision and language. ## Key Concepts - CLIP - BLIP and BLIP-2 - LLaVA - Visual instruction tuning - Cross-modal attention - Image-text matching - Multimodal reasoning
عرض على GitHub