ワンクリックで
xcrawl
网页抓取与搜索工具。当用户说"抓取网页"、"scrape"、"爬取"、"xcrawl"、"搜索网页"、"web search"、"站点地图"、"sitemap"、"crawl"时使用。
Codex または Claude でインストール この Prompt をコピーして Codex、Claude、または他のアシスタントに貼り付けると、Skill ページを確認してインストールできます。
メニュー
网页抓取与搜索工具。当用户说"抓取网页"、"scrape"、"爬取"、"xcrawl"、"搜索网页"、"web search"、"站点地图"、"sitemap"、"crawl"时使用。
Codex または Claude でインストール この Prompt をコピーして Codex、Claude、または他のアシスタントに貼り付けると、Skill ページを確認してインストールできます。
SOC 職業分類に基づく
Twitter/X 一站式工具:读推文、搜索话题、发帖、发 thread。触发词:"读推文"、"搜Twitter"、"发推"、"发thread"、"twitter post"、"twitter search"、"read tweet"、"post tweet"。
英语单词查询与学习助手,基于 GPT-4 生成的 8000 词词典。当用户说"单词 <word>"、"查 <word>"、"look up <word>"、"vocab <word>",或通过 Telegram 发来英语单词查询时使用。首次使用自动下载词库,无需额外配置。
Harness 方法论工具箱(基于 Anthropic 研究)。当用户说"harness"、"harness build"、"harness qa"、"harness plan"、"用harness构建"、"独立评估"、"评估一下"、"qa check"、"规划一下"、"分解为sprint"时使用。包含三种模式:构建(Planner→Generator→Evaluator)、QA(独立评估)、规划(Sprint 分解)。
Claude Certified Architect (CCA) 完整学习套件。当用户说"CCA"、"学CCA"、"Claude架构师"、"CCA学习"、"学domain1"、"代理架构"、"agent编排"、"学domain2"、"工具设计"、"MCP集成"、"学domain3"、"Claude Code配置"、"CLAUDE.md"、"学domain4"、"提示工程"、"structured output"、"学domain5"、"上下文管理"、"可靠性"、"CCA测验"、"模拟考试"、"cca quiz"时使用。
Harness Engineering 全流程开发 - 从 feature spec 到 PR 合并,Agent 自主完成 设计→规划→TDD 实现→代码审查→修复→PR 的完整 loop,全程使用 subagent 隔离执行,人工只在设计确认和 BLOCKED 时介入。
自主迭代优化任务。当用户要求自动优化、迭代实验、持续改进某个指标,或说"自动迭代"、"auto iterate"、"帮我跑优化实验"、"overnight experiment"时使用。
| name | xcrawl |
| description | 网页抓取与搜索工具。当用户说"抓取网页"、"scrape"、"爬取"、"xcrawl"、"搜索网页"、"web search"、"站点地图"、"sitemap"、"crawl"时使用。 |
| allowed-tools | Bash, Read |
通过 xcrawl CLI 提供四大能力:单页抓取(scrape)、网页搜索(search)、站点地图(map)、深度爬取(crawl)。
每次执行前先确认 xcrawl 可用:
which xcrawl || echo "ERROR: xcrawl 未安装,请运行 npm install -g @xcrawl/cli"
如果未安装,提示用户执行安装和登录:
npm install -g @xcrawl/clixcrawl login --browserxcrawl status 确认额度根据用户意图选择对应命令:
| 意图 | 命令 | 典型场景 |
|---|---|---|
| 抓取单个/多个网页内容 | scrape | "帮我抓取这个页面"、"读取这个网址的内容" |
| 搜索关键词 | search | "搜一下 XX"、"web search XX" |
| 获取网站所有链接 | map | "列出这个网站的页面"、"sitemap" |
| 深度爬取整站 | crawl | "爬取整个网站"、"crawl this site" |
抓取一个或多个 URL 的内容,默认输出 markdown 格式。
# 单个 URL
xcrawl scrape "https://example.com" --format markdown
# 多个 URL
xcrawl scrape "https://a.com" "https://b.com" --format markdown
# 输出为 JSON(含结构化元数据)
xcrawl scrape "https://example.com" --format json --json
# 截图
xcrawl scrape "https://example.com" --format screenshot --output screenshot.png
# 等待动态内容加载
xcrawl scrape "https://example.com" --wait-for ".content-loaded"
# 从文件批量读取 URL
xcrawl scrape --input urls.txt --format markdown --output ./results/ --concurrency 3
输出格式选项: markdown(默认推荐)、json、html、screenshot
--output 保存到文件,再用 Read 工具读取搜索关键词,返回搜索结果列表。
# 基本搜索
xcrawl search "Claude Code skills" --json
# 限制结果数量
xcrawl search "site:github.com xcrawl" --limit 5 --json
# 指定语言和地区
xcrawl search "最新AI新闻" --language zh --country CN --json
搜索技巧:
--json 获取结构化结果(含 URL、标题、摘要)--limit 控制结果数量,节省额度site:、intitle: 等)常见模式:先搜索找到目标 URL,再抓取详细内容。
# Step 1: 搜索
xcrawl search "topic" --limit 5 --json --output search_results.json
# Step 2: 从结果中选择 URL 抓取
xcrawl scrape "https://found-url.com" --format markdown
列出一个网站的所有可达链接。
# 基本用法
xcrawl map "https://example.com" --json
# 限制深度和数量
xcrawl map "https://docs.example.com" --max-depth 2 --limit 50 --json
用途: 了解网站结构、找到所有文档页面、为批量抓取准备 URL 列表。
异步爬取整个网站,适合大规模数据采集。
# 启动爬取任务(异步)
xcrawl crawl start "https://example.com" --max-pages 20 --json
# 启动并等待完成
xcrawl crawl start "https://example.com" --max-pages 10 --wait --json
# 查询任务状态
xcrawl crawl status <job-id> --json
注意: crawl 是异步任务,用 --wait 可阻塞等待完成,或用 crawl status 轮询。
xcrawl 按调用次数消耗额度。执行前可检查剩余额度:
xcrawl status
search(消耗少)而非 crawl(消耗多)--concurrency 控制并发但不减少总消耗--output 保存到临时文件,再用 Read 工具按需读取| 错误 | 处理 |
|---|---|
xcrawl: command not found | 提示安装:npm install -g @xcrawl/cli |
| 认证失败 | 提示登录:xcrawl login --browser |
| 额度不足 | 运行 xcrawl status 查看额度,提示用户充值 |
| 超时 | 加 --timeout 30000 重试 |
| 页面需要 JS 渲染 | 加 --wait-for 等待特定元素 |