| name | web-scraper |
| description | 使用 Playwright 爬取小红书热门内容。支持首页热门推荐的爬取,保存为 JSON 格式。 |
| allowed-tools | Bash(python:*) |
Web Scraper
使用 Playwright 爬取小红书热门内容的爬虫工具。
功能
- 爬取小红书首页热门推荐
- 自动滚动加载更多内容
- 提取标题、正文、点赞数、评论数等信息
- 保存为结构化 JSON 文件
使用方法
被调用时,使用 Bash tool 运行爬虫脚本:
python .claude/skills/web-scraper/scripts/xhs_scraper.py xiaohongshu_trending 20 workspace/xhs-factory/raw_data
参数说明:
- 第1个参数:爬取目标(固定为
xiaohongshu_trending)
- 第2个参数:爬取数量(如
20)
- 第3个参数:输出目录(如
workspace/xhs-factory/raw_data)
输出格式
脚本会在输出目录创建多个 JSON 文件:
raw_data/
├── note_0.json
├── note_1.json
└── ...
每个文件包含一篇笔记的信息:
{
"title": "笔记标题",
"content": "笔记正文",
"likes": "1.2w",
"comments": "456",
"html": "原始HTML"
}
注意事项
- 首次使用需要安装 Playwright 浏览器:
playwright install chromium
- 爬取速度不宜过快,避免触发反爬虫机制
- 如果遇到验证码或登录要求,可能需要手动处理