Skip to main content

scrapy-web-scraping

Framework de scraping web más popular de Python — extensible, asíncrono, con middleware, pipelines y scraping a escala.

설치로 이동

소스 정보

저장소
Ntizar/NtizarBrainMasterMind
최근 소스 활동
2026년 7월 16일 08:02
감지된 SKILL.md 언어
판별 불가
스타
2
포크
0

설치 방법

기본적으로 소스를 먼저 확인하는 Prompt가 선택됩니다. 직접 명령으로 전환하거나 로컬 사본을 다운로드할 수도 있습니다.

소스 파일 검토

설치 여부를 결정하기 전에 SKILL.md와 SkillsMP에 표시된 보조 파일을 읽어 보세요.

SKILL.md 표시 중

SKILL.md
소스 지침 · 읽기 전용 미리보기
name
scrapy-web-scraping
description
Framework de scraping web más popular de Python — extensible, asíncrono, con middleware, pipelines y scraping a escala.
version
1.0.0
tags
["scraping","web","python","async","crawler","middleware"]
# Scrapy — Framework de Scraping Web ## Resumen Framework de scraping web más popular de Python — extensible, asíncrono, con middleware y pipelines. 62k⭐. ## Repo de referencia - **GitHub:** `github.com/scrapy/scrapy` - **Lenguaje:** Python - **Licencia:** BSD ## Instalación ```bash pip install scrapy pip install scrapy-splash # para JavaScript rendering pip install scrapy-redis # para distributed scraping ``` ## Uso Básico ```python # spider.py import scrapy class ExampleSpider(scrapy.Spider): name = "example" start_urls = ["https://example.com"] def parse(self, response): for href in response.css("a::attr(href)").getall(): yield response.follow(href, self.parse) yield { 'title': response.css('h1::text').get(), 'text': response.css('p::text').getall(), } ``` ## Ejecutar ```bash # Salida JSON scrapy crawl example -o results.json # Salida CSV scrapy crawl example -o results.csv # Con logging detallado scrapy crawl example -s LOG_LEVEL=DEBUG ``` ## Patrones Clave 1. **Middlewares:** Rotación de user-agents, proxies, headers 2. **Pipelines:** Guardar en SQLite, MongoDB, PostgreSQL 3. **Item Loaders:** Transformación y validación de datos 4. **Distributed:** Scrapy-Redis para scraping distribuido 5. **Headless browser:** Splash o Playwright para JS rendering ## Integración con Mastermind - Reemplaza `BeautifulSoup` + `requests` para scraping a escala - Ideal para government data pipelines (BOE, BORME, etc.) - Complementa `firecrawl-web-scraping` (scrapy programable, firecrawl API-based) - Útil para static-digest-pipeline ## Pitfalls - **JavaScript:** Scrapy no ejecuta JS. Usa Splash o Playwright para contenido dinámico. - **Rate limiting:** Configurar `DOWNLOAD_DELAY` para no saturar servidores. - **Robots.txt:** Respetar robots.txt con `ROBOTSTXT_OBEY = True`. - **Memory:** Para sitios grandes, usar `itemproc` con pipelines asíncronos. ## Referencias - [GitHub: scrapy/scrapy](https://github.com/scrapy/scrapy) - [Docs](https://docs.scrapy.org)
GitHub에서 보기