Skip to main content

autoscraper

Usa al scrapear con AutoScraper (aprende patrones).

跳到安装

来源信息

仓库
Ntizar/MasterMind
最近来源活动
2026年9月5日 21:13
检测到的 SKILL.md 语言
西班牙语
星标
2
分支
0

安装方式

默认使用会先检查来源的 Prompt;你也可以切换为直接命令,或下载本地副本。

检查来源文件

决定是否安装前,请先阅读 SKILL.md,以及 SkillsMP 当前展示的配套文件。

正在显示 SKILL.md

SKILL.md
来源说明 · 只读预览
name
autoscraper
description
Usa al scrapear con AutoScraper (aprende patrones).
version
2.0.0
tags
["scraping","autoscraper","python","aprieta","ml","web","patrones"]
related_skills
["adaptive-web-scraping","scrapy-web-scraping","crawlee-web-scraping","google-maps-scrapper"]
# AutoScraper — scraping que aprende patrones por ti > ⚠️ Corrección 2026-09-05 (auditoría stars-explorer): la v1 usaba `scraper.run(texto)` — **inexistente**. La API real para re-extraer de una página nueva es `get_result_similar()`/`get_result()`. **Repo upstream:** `https://github.com/alirezamika/autoscraper` (MIT, Python, ~7.9K⭐). ## When to Use - Cuando pidas **scrapear** una web sin escribir selectores a mano: le das ejemplos de lo que quieres y aprende el patrón. - Para sitios con estructura estable donde el selector cambia poco; ideal para prototipos rápidos. ## Uso ```python import requests from autoscraper import AutoScraper url = 'https://ejemplo.com' # Pasas ejemplos de lo que quieres extraer y la página de donde aprender wanted_list = ['ejemplo de texto a extraer'] scraper = AutoScraper() result = scraper.build(url, wanted_list) # aprende el patrón # Re-extraer de una página nueva (misma estructura): req = requests.get('https://ejemplo.com/otra-pagina') scraper.get_result_similar(req.text) # <- API real (NO scraper.run) ``` - `build(url, wanted_list)` acepta el HTML/código de la página. - Para extracción exacta: `get_result()` / `get_result_exact()`. ## Pitfalls - La API es **`get_result_similar()`** (o `get_result`/`get_result_exact`); **no existe `scraper.run()`**. - Importar `requests` al usar `requests.get(...)`. - Solo aprende patrones de sitios con estructura repetitiva; webs dinámicas (JS) necesitan browser automation. ## Verificación - `scraper.build(url, wanted_list)` → `get_result_similar(req.text)` y comprobar que devuelve el mismo tipo de datos en una página distinta del mismo sitio.
在 GitHub 查看