| name | comprehensive-visual-extraction |
| description | Habilidad SOTA 2026 para extracción visual exhaustiva y sin alucinaciones usando Cadena de Pensamiento Fundamentada (GCoT), mapeo de coordenadas y reenganche de atención visual. |
| category | visual-extraction |
| version | 1.0.0 |
| lang | es |
| direction | ltr |
| source_version | 1.0.0 |
| translated_at | 2026-06-29T00:00:00.000Z |
Habilidad de Extracción Visual Integral (CVE) — Edición 2026
Resumen
Esta habilidad equipa al agente con metodologías de vanguardia 2026 (SOTA) para convertir entradas visuales en representaciones de texto exhaustivas, estructuradas y espacialmente fundamentadas. Va más allá de los modelos heredados de "describe lo que ves" al imponer la Cadena de Pensamiento Fundamentada (GCoT) y la regresión precisa de coordenadas. El resultado actúa como un proxy textual perfecto y verificable de la imagen original, diseñado para ser consumido por otros agentes LLM.
Capacidades Principales y Cambio de Paradigma 2026
- Cadena de Pensamiento Fundamentada (GCoT): Tienes prohibido enunciar hechos visuales sin primero anclarlos a coordenadas espaciales específicas
[x1, y1, x2, y2]. Esto previene la alucinación visual.
- Regresión Nativa de Coordenadas (PBD): Utiliza tu capacidad multimodal nativa (o Decodificación Paralela de Cajas) para estimar cuadros delimitadores para cada elemento extraído, estableciendo un mapa semántico 2D/3D preciso.
- Reenganche de Atención Visual (RoI Dinámico): En lugar de un solo escaneo estático, "acerca" lógicamente las Regiones de Interés (RoI), forzando un remuestreo de tokens visuales para extraer perfectamente detalles microscópicos (como colores hexadecimales exactos o texto diminuto).
- Fundamentación a Nivel de Píxel: Confía en tus capacidades nativas para extraer valores precisos de color Hex/RGB directamente del espacio de embedding de la imagen.
El Protocolo de Extracción
Cuando se te invoque para analizar una imagen, debes seguir estrictamente este protocolo de extracción GCoT de múltiples capas.
Fase 1: Fundamentación Global y Estrategia
- Define el Lienzo: Mapea mentalmente el espacio de la imagen como un plano de coordenadas desde
[0, 0] (superior-izquierda) hasta [100, 100] (inferior-derecha). Todos los cuadros delimitadores futuros deben usar esta escala basada en porcentajes.
- Determina la Topología de la Imagen: Clasifica la imagen (ej., Maqueta de UI, Escena Natural, Diagrama, Documento) para establecer la estrategia de extracción principal.
- Resumen de Metadatos Globales: Proporciona un resumen de 2 oraciones sobre el tema general, iluminación y ambiente de la imagen.
Fase 2: El Proceso de Extracción Profunda GCoT
Genera la salida usando un formato fuertemente estructurado. Para cada objeto distinto, bloque de texto o componente de UI, debes seguir el Bucle GCoT.
El Bucle GCoT (Obligatorio para cada elemento)
Para cada elemento que identifiques, sigue esta secuencia exacta:
- Anclar (Coordenada): Indica el cuadro delimitador estimado
[x1, y1, x2, y2].
- Identificar: ¿Qué es el objeto/elemento?
- Reenganchar (Zoom): Indica explícitamente: (Acercando a RoI) para enfocar la atención en este cuadro específico.
- Extraer Atributos:
- Color: Código hexadecimal preciso (ej.,
#FF5733) o tono exacto derivado de la fundamentación a nivel de píxel.
- Texto/Datos: Transcripción exacta (si aplica).
- Estado/Forma Geométrica: (ej., "botón activo", "círculo perfecto").
- Relación Espacial: Describe su relación geométrica con anclas vecinas (ej., "Alineado a lo largo del eje Y con el Ancla
[10, 20, 30, 40]").
Desglose Categórico (Aplicando el Bucle GCoT)
Debes aplicar el bucle GCoT de manera integral en estas categorías:
- 1. Diseño Estructural y Elementos de UI: Mapea la cuadrícula macroscópica. ¿Dónde están los encabezados, barras laterales, imágenes principales o sujetos principales?
- 2. Inventario Exhaustivo de Objetos (Grafo de Escena): Identifica cada objeto discreto, su estado y su relación geométrica con el fondo.
- 3. Transcripción Total de Texto y Datos: Extrae todo el texto jerárquicamente. Reconstruye cualquier tabla en formato Markdown perfecto. Para gráficos, proporciona estimaciones de puntos de datos basadas en el mapeo de coordenadas.
- 4. Datos Matemáticos/Geométricos: Si hay ecuaciones, líneas arquitectónicas o proporciones geométricas, extráelas exactamente usando análisis estructural.
Fase 3: Verificación Espacial y Validación
- La Verificación Topológica: Revisa tus anclas generadas. ¿Las coordenadas se superponen o alinean lógicamente como se describió? Si un objeto se indica como "dentro" de otro, sus
[x1, y1, x2, y2] deben ser un subconjunto de las coordenadas del padre.
- La Prueba del Agente Ciego: Confirma que otro agente, que posea solo este texto estructurado GCoT con coordenadas, podría reconstruir perfectamente la jerarquía lógica, espacial y visual de la imagen.
Especificación del Formato de Salida
La salida final debe formatearse en Markdown limpio. Usa bloques de código para arrays JSON si estás generando el grafo de escena de cuadros delimitadores, y tablas/encabezados Markdown estándar para la transcripción de texto. Cada bloque descriptivo principal DEBE estar precedido por su ancla espacial [x1, y1, x2, y2].
Fin de la Definición de la Habilidad