| name | spide-deep-crawl |
| description | 深度采集 — 通过 MediaCrawler 从小红书/抖音/快手/B站/微博/贴吧/知乎 采集详细内容、评论和创作者信息。当用户需要深度抓取特定平台内容时使用。
|
| category | data_collection |
Spide Deep Crawl — 深度采集
触发条件
用户要求深度采集特定平台的内容、评论、创作者信息时自动激活。
用法
spide deep-crawl -p xhs -m search -k "AI编程"
spide deep-crawl -p dy -m search -k "新能源,汽车"
spide deep-crawl -p bili -m detail -u "video_id1,video_id2"
spide deep-crawl -p wb -m creator -c "user_id1,user_id2"
spide deep-crawl -p xhs -m search -k "AI" --save
spide deep-crawl -p xhs -m search -k "AI" --max 50
支持的平台
| 平台 | 标识 | 说明 |
|---|
| 小红书 | xhs | 笔记内容、评论 |
| 抖音 | dy | 短视频、评论 |
| 快手 | ks | 短视频、评论 |
| B站 | bili | 视频、评论 |
| 微博 | wb | 微博内容、评论 |
| 百度贴吧 | tieba | 帖子、评论 |
| 知乎 | zhihu | 问答、评论 |
采集模式
| 模式 | 标识 | 用途 |
|---|
| 搜索 | search | 按关键词搜索内容 |
| 详情 | detail | 采集指定内容的详细信息 |
| 创作者 | creator | 采集指定创作者的内容 |
工作流程
- 确认目标平台和采集模式
- 根据模式准备参数(关键词/URL/创作者ID)
- 运行
spide deep-crawl 命令
- 查看采集结果(内容数、评论数、创作者数)
- 根据需要保存或导出数据
注意事项
- 深度采集需要浏览器环境(Playwright)
- 首次使用需要登录对应平台(Cookie)
- 建议使用
--headless 模式(默认开启)
- 采集大量数据时注意平台限制
通过 MCP 调用
深度采集在 MCP 层对应 deep_crawl_hot_topics 工具,支持 7 平台 × 3 模式:
from spide.mcp.client import MCPClient
async with MCPClient(server_command="spide", args=["mcp-serve"]) as client:
result = await client.call_tool("deep_crawl_hot_topics", {
"platform": "xhs",
"mode": "search",
"keywords": "AI编程,Python",
"max_notes": 20,
"enable_comments": True,
})
data = json.loads(result[0].text)
print(f"内容数: {data['contents_count']}, 评论数: {data['comments_count']}")
for c in data["contents"][:5]:
print(f"- {c['title']} (👍{c['like_count']}, 💬{c['comment_count']})")
result = await client.call_tool("deep_crawl_hot_topics", {
"platform": "bili",
"mode": "detail",
"content_ids": "video_id_1,video_id_2",
"max_notes": 10,
"enable_comments": True,
})
result = await client.call_tool("deep_crawl_hot_topics", {
"platform": "wb",
"mode": "creator",
"creator_ids": "user_id_1,user_id_2",
"max_notes": 30,
})
MCP 工具 vs CLI 对比:
| 维度 | CLI (spide deep-crawl) | MCP 工具 (deep_crawl_hot_topics) |
|---|
| 平台参数 | -p xhs | platform: "xhs" |
| 模式参数 | -m search | mode: "search" |
| 关键词 | -k "AI,Python" | keywords: "AI,Python"(逗号分隔) |
| 数量 | --max 50 | max_notes: 50 |
| 评论 | --comments / 默认开 | enable_comments: true(默认 true) |
| 超时 | CLI 进程无超时 | 60s(Claude Desktop MCP 默认) |
完整配置:docs/integration/claude-desktop-config.md