Skip to main content

qwen-mm-plugins-api

Cloud MCP tools for understanding media, by model family. VL model: vision_chat (caption/VQA), ocr, grounding (detect/locate objects). Omni model (reads frames + audio together): timestamped captioning, ASR (plain / controllable / multi-speaker diarized), temporal grounding, event counting, music captioning. Plus transcribe_audio (ASR) and segmentation (SAM3). Use when a question about an image/video/audio needs an external model, not just local reading.

Ir para a instalação

Informações da origem

Repositório
QwenLM/Qwen-MM-Plugins
Última atividade na origem
11 de agosto de 2026 às 05:15
Idioma detectado do SKILL.md
inglês
Estrelas
2.214
Forks
115

Opções de instalação

Por padrão, está selecionado o prompt que primeiro revisa a origem. Você pode mudar para um comando direto ou baixar uma cópia local.

Revise os arquivos de origem

Leia o SKILL.md e os arquivos complementares exibidos pelo SkillsMP antes de decidir se vai instalar.