Skip to main content

qwen-mm-plugins-api

Cloud MCP tools for understanding media, by model family. VL model: vision_chat (caption/VQA), ocr, grounding (detect/locate objects). Omni model (reads frames + audio together): timestamped captioning, ASR (plain / controllable / multi-speaker diarized), temporal grounding, event counting, music captioning. Plus transcribe_audio (ASR) and segmentation (SAM3). Use when a question about an image/video/audio needs an external model, not just local reading.

Ir a la instalación

Datos de origen

Repositorio
QwenLM/Qwen-MM-Plugins
Última actividad en el origen
11 de agosto de 2026 a las 05:15
Idioma detectado de SKILL.md
inglés
Estrellas
2214
Forks
115

Opciones de instalación

De forma predeterminada está seleccionado el prompt que primero revisa el origen. Puedes cambiar a un comando directo o descargar una copia local.

Revisa los archivos de origen

Lee SKILL.md y los archivos complementarios que muestra SkillsMP antes de decidir si quieres instalarlo.