Skip to main content

multimodal-learning

Multi-modal learning, vision-language models, and cross-modal representation

الانتقال إلى التثبيت

معلومات المصدر

المستودع
NeuralBlitz/Mito
آخر نشاط في المصدر
٢٢ مارس ٢٠٢٦ في ١٣:٢٩
لغة SKILL.md المكتشفة
الإنجليزية
النجوم
٠
التفرعات
٠

خيارات التثبيت

يُحدَّد Prompt الذي يراجع المصدر أولًا بشكل افتراضي. يمكنك التبديل إلى أمر مباشر أو تنزيل نسخة محلية.

مراجعة ملفات المصدر

اقرأ SKILL.md وأي ملفات مرافقة يعرضها SkillsMP قبل أن تقرر التثبيت.

عرض SKILL.md

SKILL.md
تعليمات المصدر · معاينة للقراءة فقط
name
multimodal-learning
description
Multi-modal learning, vision-language models, and cross-modal representation
license
MIT
compatibility
opencode
metadata
{"audience":"researchers","category":"machine-learning"}
## What I do - Build models that process multiple modalities - Work with vision-language models - Align different data types - Fuse multimodal representations ## When to use me When working on multimodal AI or vision-language systems. ## Key Concepts - Vision-language models - Cross-modal attention - Representation learning - CLIP - Image captioning - Visual question answering - Audio-visual learning
عرض على GitHub