用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。
直接命令不会经过审查 Prompt;运行前请先检查来源。
npx skills add https://github.com/CNife/crawl-zhihu --skill zhihu-crawler命令会保持在同一行。复制前请横向滚动并检查完整内容。
想先保存到本地?可下载 SkillsMP 当前能够提供的文件。
基于 SOC 职业分类
正在显示 SKILL.md
| name | zhihu-crawler |
| description | 爬取知乎用户的所有文章和回答,生成 Markdown 和 PDF 报告。当用户提及知乎内容爬取、文章导出、回答备份、生成 PDF 报告、批量下载知乎内容时立即使用此技能 |
爬取知乎用户的所有文章和回答,保存为按类型分组的 Markdown 文件,并转换为 PDF 报告。
特点:
# 1. 检查环境
uv run python skills/zhihu-crawler/scripts/check_env.py
# 2. 收集 URL 列表
uv run python skills/zhihu-crawler/scripts/collect_urls.py mr-dang-77 --type all
# 3. 批量爬取内容
uv run python skills/zhihu-crawler/scripts/batch_crawl.py --username mr-dang-77
# 4. 转换为 Markdown
uv run python skills/zhihu-crawler/scripts/convert_to_md.py --input output/mr-dang-77
# 5. 生成索引
uv run python skills/zhihu-crawler/scripts/generate_index.py output/mr-dang-77
# 6. 转换 PDF
uv run python skills/zhihu-crawler/scripts/convert_to_pdf.py --input output/mr-dang-77
✅ 应该触发:
❌ 不应触发:
collect_urls.py 爬取文章/回答 URL 列表batch_crawl.py(自动调用 crawl_item.py)convert_to_md.pygenerate_index.pyconvert_to_pdf.pyuv run python skills/zhihu-crawler/scripts/check_env.py
确保:
browser_profiles/zhihu_profile/ 存在(保存登录状态)常见问题:
chrome://version 确认调试端口# 爬取全部(文章 + 回答)
uv run python skills/zhihu-crawler/scripts/collect_urls.py mr-dang-77 --type all
# 仅爬取文章 URL
uv run python skills/zhihu-crawler/scripts/collect_urls.py mr-dang-77 --type articles
# 仅爬取回答 URL
uv run python skills/zhihu-crawler/scripts/collect_urls.py mr-dang-77 --type answers
说明:
agent-browser --cdp 9222 滚动加载用户主页output/<username>/urls/常见问题:
agent-browser --cdp 9222 open https://www.zhihu.com/signin 手动登录--max-scrolls 参数# 爬取全部(文章 + 回答)
uv run python skills/zhihu-crawler/scripts/batch_crawl.py --username mr-dang-77
# 仅爬取文章
uv run python skills/zhihu-crawler/scripts/batch_crawl.py --username mr-dang-77 --type articles
# 仅爬取回答
uv run python skills/zhihu-crawler/scripts/batch_crawl.py --username mr-dang-77 --type answers
说明:
crawled-urls.txt)--delay)--max-retries)crawl_item.py 爬取单项内容常见问题:
crawled-urls.txt 以便下次续爬references/css-selectors.mduv run python skills/zhihu-crawler/scripts/convert_to_md.py --input output/mr-dang-77
说明:
metadata.json 和 content.htmlhtml2text 转换 HTML 为 Markdown<YYYY-MM-DD>_<title>.md 文件uv run python skills/zhihu-crawler/scripts/generate_index.py output/mr-dang-77
说明:
README.mduv run python skills/zhihu-crawler/scripts/convert_to_pdf.py --input output/mr-dang-77
说明:
bunx mdpdf 转换github-markdown.css 样式rm -rf output/mr-dang-77/articles/*/
rm -rf output/mr-dang-77/answers/*/
output/<username>/
├── urls/
│ ├── articles-urls.txt
│ ├── answers-urls.txt
│ └── crawled-urls.txt
├── articles/
│ ├── 2024-01-15_article-title.md
│ ├── 2024-01-15_article-title.pdf
│ └── ...
├── answers/
│ ├── 2024-01-15_question-title.md
│ ├── 2024-01-15_question-title.pdf
│ └── ...
├── images/
│ ├── article-001-img-001.jpg
│ ├── answer-001-img-001.jpg
│ └── ...
└── README.md
| 脚本 | 功能 | 输入 | 输出 |
|---|---|---|---|
check_env.py | 检查并启动 Chrome Debug 模式 | 无 | Chrome 运行在端口 9222 |
collect_urls.py | 爬取文章/回答 URL 列表 | 用户名、类型 | URL 文件 |
crawl_item.py | 爬取单项内容 | URL、输出目录 | metadata.json + 图片 |
batch_crawl.py | 批量爬取 | 用户名、类型 | 多个 item 文件夹 |
convert_to_md.py | HTML 转 Markdown | 输出目录 | Markdown 文件 |
generate_index.py | 生成索引 | 输出目录 | README.md |
convert_to_pdf.py | Markdown 转 PDF | 输出目录 | PDF 文件 |
在 skills/zhihu-crawler/ 目录下:
uv add html2text beautifulsoup4 requests aiohttp
需要安装 Bun:
curl -fsSL https://bun.sh/install | bash
使用 skills/zhihu-crawler/assets/github-markdown.css 作为 PDF 样式文件。
登录状态由 browser_profiles/zhihu_profile/ 自动维护,无需手动 save/load。
首次使用需手动登录:
agent-browser --cdp 9222 open https://www.zhihu.com/signin
登录失效处理:
references/css-selectors.md - CSS 选择器详解references/page-structure.md - 页面结构分析assets/github-markdown.css - PDF 样式文件