ワンクリックで
crawl
Web crawling and extraction scripts for HTML pages, JS-rendered pages, links, tables, robots policy, and site crawling.
Codex または Claude でインストール この Prompt をコピーして Codex、Claude、または他のアシスタントに貼り付けると、Skill ページを確認してインストールできます。
メニュー
Web crawling and extraction scripts for HTML pages, JS-rendered pages, links, tables, robots policy, and site crawling.
Codex または Claude でインストール この Prompt をコピーして Codex、Claude、または他のアシスタントに貼り付けると、Skill ページを確認してインストールできます。
SOC 職業分類に基づく
Event API helper for create/get/list/update operations against the AI Agents events API. Requires DATALAYER_API_KEY.
GitHub API scripts for repository discovery and inspection. Use this skill when listing your repos, inspecting one repo, or listing issues/PRs. Requires GITHUB_TOKEN.
PDF form-processing toolkit for checking fillable forms, extracting form field metadata, validating bounding boxes, converting pages to images, and filling forms.
Summarize text from a file or inline input. Use for concise summaries and key-point extraction.
| name | crawl |
| description | Web crawling and extraction scripts for HTML pages, JS-rendered pages, links, tables, robots policy, and site crawling. |
| license | Proprietary. LICENSE.txt has complete terms |
| version | 1.0.0 |
| tags | ["web","scraping","crawling","http"] |
| author | Datalayer |
run_skill_script with:
skill_name: crawlscript_name: one of fetch_page, fetch_js_page, extract_links, extract_tables, crawl_site, check_robotsargs.kwargs using the keys listed below.args (not kwargs).script_name: fetch_pageargs: ["<url>"]kwargs: timeout, outputscript_name: fetch_js_pageargs: ["<url>"]kwargs: wait, selector, timeout, output--html: pass via args as "--html"script_name: extract_linksargs: ["<url>"]kwargs: filter, timeout, output--absolute is enabled by default.script_name: extract_tablesargs: ["<url>"]kwargs: format, timeout, outputformat: json | csvscript_name: crawl_siteargs: ["<start_url>"]kwargs: max_pages, max_depth, timeout, output--same-domain is enabled by default.script_name: check_robotsargs: ["<url>"]kwargs: user_agentrun_skill_script Examples{
"skill_name": "crawl",
"script_name": "fetch_js_page",
"args": ["https://example.com"],
"kwargs": {
"wait": 1200,
"selector": "main",
"timeout": 45000
}
}
{
"skill_name": "crawl",
"script_name": "fetch_js_page",
"args": ["https://example.com", "--html"]
}
Notes:
fetch_js_page requires Playwright + Chromium in the execution environment.python agent_skills/skills/crawl/scripts/fetch_page.py https://example.com --timeout 20
python agent_skills/skills/crawl/scripts/fetch_js_page.py https://example.com --wait 1200 --selector main
python agent_skills/skills/crawl/scripts/extract_links.py https://example.com --filter /docs
python agent_skills/skills/crawl/scripts/extract_tables.py https://example.com --format csv --output tables.csv
python agent_skills/skills/crawl/scripts/crawl_site.py https://example.com --max-pages 20 --max-depth 2 --output crawl.json
python agent_skills/skills/crawl/scripts/check_robots.py https://example.com --user-agent "DataBot/1.0"