Skip to main content
Ejecuta cualquier Skill en Manus
con un clic

multimodal-structured-extraction

Estrellas0
Forks0
Actualizado23 de mayo de 2026 a las 12:34

Use this skill when extracting structured data from images (receipts, menus, statements, IDs, business cards, forms, screenshots) using a vision-capable LLM. Covers schema-first design with zod, validation gates and retry, locale handling (currency / dates / romanization), confidence signalling, and the anti-patterns that cause silent garbage extraction. Triggers on "extract from image", "OCR with structure", "vision model JSON", "Gemini multimodal", "GPT-4 vision extraction", "parse receipt", "parse business card", "image to schema", "structured output from image".

Instalación

Instalar con Codex o Claude Copia este prompt, pégalo en Codex, Claude u otro asistente, y deja que revise la página de la skill y la instale por ti.

SKILL.md
readonly