Skip to main content

firecrawl-web-scraping

API open-source para convertir cualquier página web en datos limpios (Markdown o JSON estructurado) optimizados para AI agents — scraping, crawling, batch processing.

설치로 이동

소스 정보

저장소
Ntizar/NtizarBrainMasterMind
최근 소스 활동
2026년 7월 1일 13:07
감지된 SKILL.md 언어
스페인어
스타
2
포크
0

설치 방법

기본적으로 소스를 먼저 확인하는 Prompt가 선택됩니다. 직접 명령으로 전환하거나 로컬 사본을 다운로드할 수도 있습니다.

소스 파일 검토

설치 여부를 결정하기 전에 SKILL.md와 SkillsMP에 표시된 보조 파일을 읽어 보세요.

SKILL.md 표시 중

SKILL.md
소스 지침 · 읽기 전용 미리보기
name
firecrawl-web-scraping
description
API open-source para convertir cualquier página web en datos limpios (Markdown o JSON estructurado) optimizados para AI agents — scraping, crawling, batch processing.
version
1.0.0
tags
["scraping","web","AI","agents","markdown","data-extraction","crawler"]
# Firecrawl — API de Scraping Web para AI Agents ## Resumen Firecrawl convierte cualquier página web en datos limpios (Markdown o JSON estructurado) optimizados para AI agents. 142K⭐. ## Instalación ```bash # Docker (recomendado) docker pull firecrawl/firecrawl docker run -p 3000:3000 firecrawl/firecrawl # Python SDK pip install firecrawl-py # Node.js SDK npm install @mendable/firecrawl-js ``` ## Uso Básico ### Python SDK ```python from firecrawl import FirecrawlApp app = FirecrawlApp(api_key="fc-xxx") # Scraping simple → Markdown data = app.scrape_url("https://ejemplo.com", params={"formats": ["markdown"]}) # Crawling completo de un sitio crawl = app.crawl_url("https://ejemplo.com", params={ "limit": 100, "scrapeOptions": {"formats": ["markdown", "html"]} }) # Lote de URLs batch = app.batch_scrape_urls(["https://a.com", "https://b.com"], {"formats": ["json"]}) ``` ### Node.js SDK ```javascript import FirecrawlApp from '@mendable/firecrawl-js'; const app = new FirecrawlApp({apiKey: 'fc-xxx'}); const data = await app.scrapeUrl('https://ejemplo.com', {formats: ['markdown']}); ``` ## Patrones Clave 1. **HTML → Markdown**: Limpieza automática de HTML a texto limpio 2. **JSON Structured Output**: Extraer datos con schema definido 3. **Crawling con límites**: `limit`, `maxDepth`, `ignoreSitemap` 4. **Batch processing**: Múltiples URLs en paralelo 5. **Webhook support**: Para crawls largos asíncronos ## Integración con Mastermind - Reemplaza `curl` + `BeautifulSoup` para scraping web - Ideal para government data pipelines (BOE, BORME, etc.) - Complementa `government-cms-scraping` (Firecrawl genérico, CMS scraping específico) - Útil para static-digest-pipeline ## Referencia - Repo: https://github.com/firecrawl/firecrawl - Docs: https://docs.firecrawl.dev - API: https://api.firecrawl.dev
GitHub에서 보기