| name | firecrawl-web-scraping |
| description | API open-source para convertir cualquier página web en datos limpios (Markdown o JSON estructurado) optimizados para AI agents — scraping, crawling, batch processing. |
| version | 1.0.0 |
| tags | ["scraping","web","AI","agents","markdown","data-extraction","crawler"] |
Firecrawl — API de Scraping Web para AI Agents
Resumen
Firecrawl convierte cualquier página web en datos limpios (Markdown o JSON estructurado) optimizados para AI agents. 142K⭐.
Instalación
docker pull firecrawl/firecrawl
docker run -p 3000:3000 firecrawl/firecrawl
pip install firecrawl-py
npm install @mendable/firecrawl-js
Uso Básico
Python SDK
from firecrawl import FirecrawlApp
app = FirecrawlApp(api_key="fc-xxx")
data = app.scrape_url("https://ejemplo.com", params={"formats": ["markdown"]})
crawl = app.crawl_url("https://ejemplo.com", params={
"limit": 100,
"scrapeOptions": {"formats": ["markdown", "html"]}
})
batch = app.batch_scrape_urls(["https://a.com", "https://b.com"],
{"formats": ["json"]})
Node.js SDK
import FirecrawlApp from '@mendable/firecrawl-js';
const app = new FirecrawlApp({apiKey: 'fc-xxx'});
const data = await app.scrapeUrl('https://ejemplo.com', {formats: ['markdown']});
Patrones Clave
- HTML → Markdown: Limpieza automática de HTML a texto limpio
- JSON Structured Output: Extraer datos con schema definido
- Crawling con límites:
limit, maxDepth, ignoreSitemap
- Batch processing: Múltiples URLs en paralelo
- Webhook support: Para crawls largos asíncronos
Integración con Mastermind
- Reemplaza
curl + BeautifulSoup para scraping web
- Ideal para government data pipelines (BOE, BORME, etc.)
- Complementa
government-cms-scraping (Firecrawl genérico, CMS scraping específico)
- Útil para static-digest-pipeline
Referencia