| name | data-extractor |
| description | Delegación de investigación a agentes Extractor y Scout. Prompts predefinidos por fase del pipeline y referencia completa al arsenal de herramientas en web-research.
|
Skill: Data Extractor para Planitor
Descripción
Coordina la extracción de datos reales delegando a Extractor (rápido) y Scout (profundo).
No ejecuta scraping directamente — prepara prompts y delega vía sessions_spawn.
Ver skills/web-research/SKILL.md para el arsenal completo de herramientas disponibles.
Arsenal de Investigación (resumen)
| Categoría | Herramientas | Qué obtienes |
|---|
| Búsqueda | Tavily, SearXNG, Jina AI | Información general, URLs, artículos |
| Scraping | Lightpanda, Scrapling, Camoufox | Datos de webs protegidas, reseñas |
| Empresas ES | registro-empresas-es, company-research | CIF, cuentas, administradores, BORME |
| Redes | twitter-extract, reddit-readonly, Google Reviews | Actividad competidores, opinión |
| Tendencias | trends-checker, market-analysis | Demanda Google Trends |
| OSINT | Sherlock, theHarvester | Perfiles sociales, emails, dominios |
| Subvenciones | subvencion-watcher | Ayudas disponibles |
Fallback chain: curl → Jina AI → SearXNG → Lightpanda → Scrapling stealthy
Extracciones por Fase
Fase 2: Ground Truth
Delegar a Extractor (3 queries rápidas):
1. "INE padrón municipal [ciudad] población hecho derecho"
→ Herramienta: Tavily / SearXNG
2. "competidores [tipo negocio] en [ciudad] URLs precios"
→ Herramienta: SearXNG (URLs verificables) + Google Reviews (reseñas)
→ Complementar con: registro-empresas-es (datos societarios)
3. "precio alquiler local comercial [m2] [ciudad] idealista fotocasa"
→ Herramienta: Tavily / SearXNG + Jina AI (artículos)
Delegar a Scout (investigación profunda):
"Benchmarks revenue [tipo negocio]: ticket medio, ocupación media,
márgenes típicos, costes estándar"
→ Herramientas: SearXNG + web research + fuentes sectoriales
Fase 3: Market Analysis
Delegar a Extractor:
1. SearXNG: "[tipo negocio] [ciudad]" → URLs competidores
2. trends-checker: Google Trends para demanda del sector
3. reddit-readonly: "[sector] [ciudad] opiniones" → insights del sector
4. subvencion-watcher: subvenciones disponibles
Delegar a Scout si competidor clave necesita investigación profunda:
"Investiga [competidor nombre] usando company-research pipeline"
→ 8 fases: BRIEF → IDENTITY → STRUCTURE → OPERATIONS → FINANCIAL → HISTORY → RED FLAGS → SYNTHESIS
Fase 4: Financials
1. Tavily/SearXNG: "tarifas [tipo negocio] [ciudad] precios 2024"
2. registro-empresas-es: Cuentas depositadas de competidores (facturación, rentabilidad)
3. Jina AI: Artículos sectoriales sobre costes y márgenes
Fase 5: Strategy
1. reddit-readonly: Estrategias que funcionan en el sector
2. twitter-extract: Actividad marketing de competidores
3. SearXNG: Canales de captación efectivos
Formato de Salida
Cada extracción genera un JSON en datos/extract-{topic}-{timestamp}.json:
{
"topic": "...",
"phase": 2,
"sources": ["url1", "url2"],
"data": {},
"confidence": "high|medium|low",
"tools_used": ["tavily", "searxng", "google_reviews"],
"extracted_at": "ISO date"
}
Cómo Delegar
A Extractor (rápido, datos puntuales):
sessions_spawn(agentId="extractor", task:
"Extrae datos sobre {topic} para un negocio de {sector} en {ubicación}.
Contexto: Fase {N} del pipeline de plan de negocio.
Datos específicos necesarios: {lista}
Herramientas sugeridas: {tavily/searxng/jina/google-reviews}
Formato: JSON con sources y confidence.
Archivo de salida: {proyecto}/datos/extract-{topic}-{timestamp}.json")
A Scout (investigación profunda):
sessions_spawn(agentId="scout", task:
"Investiga a fondo {topic}.
Contexto: Fase {N} del pipeline de plan de negocio.
Usa company-research pipeline si es una empresa concreta.
Herramientas disponibles: ver skills/web-research/SKILL.md
Formato: JSON + markdown con fuentes.
Archivo de salida: {proyecto}/research-scout-{topic}.json")
Reglas
- Extractor para datos puntuales (INE, precio, URL, reseña) — modelo rápido
- Scout para investigación compleja (análisis sector, empresa completa) — modelo potente
- Máximo 3 extracciones por fase a Extractor, 1-2 a Scout
- Priorizar fuentes primarias (INE, registro mercantil) sobre secundarias
- Si no se encuentran datos, marcar confidence: low — NUNCA inventar
- Si Extractor falla 2 veces → reportar al orchestrator, no reintentar
- Google Reviews requiere
xvfb-run (headless display)
Ver También
skills/web-research/SKILL.md — Arsenal completo de herramientas con comandos
skills/data-crosscheck/SKILL.md — Verificación cruzada de datos
skills/pipeline-orchestrator/SKILL.md — Coordinación de fases