Skip to main content

qwen-mm-plugins-api

Cloud MCP tools for understanding media, by model family. VL model: vision_chat (caption/VQA), ocr, grounding (detect/locate objects). Omni model (reads frames + audio together): timestamped captioning, ASR (plain / controllable / multi-speaker diarized), temporal grounding, event counting, music captioning. Plus transcribe_audio (ASR) and segmentation (SAM3). Use when a question about an image/video/audio needs an external model, not just local reading.

الانتقال إلى التثبيت

معلومات المصدر

المستودع
QwenLM/Qwen-MM-Plugins
آخر نشاط في المصدر
١١ أغسطس ٢٠٢٦ في ٠٥:١٥
لغة SKILL.md المكتشفة
الإنجليزية
النجوم
٢٬٢١٤
التفرعات
١١٥

خيارات التثبيت

يُحدَّد Prompt الذي يراجع المصدر أولًا بشكل افتراضي. يمكنك التبديل إلى أمر مباشر أو تنزيل نسخة محلية.

مراجعة ملفات المصدر

اقرأ SKILL.md وأي ملفات مرافقة يعرضها SkillsMP قبل أن تقرر التثبيت.