| name | book-core-concept-extraction |
| description | Extracts full text from book PDFs (no page limit) and generates or updates the 核心概念 (core concepts) section in book _框架.md files. Use when the user asks to extract core concepts from books, to use full book text for concept extraction, or to improve or populate the 核心概念 section in books/ framework files. |
书籍核心概念提取
用户级使用说明:本 Skill 已作为用户级提供,路径指当前工作区。若当前项目无 books/ 或 scripts/,需先创建或改为项目内实际路径(如 book/、docs/书籍/ 等)。
对 books/ 下电子书做全文提取并生成/更新 核心概念(写入对应 *_框架.md 的 ## 核心概念 小节),以便基于完整正文正确提炼核心概念,而非仅前 50 页。
流程概览
- 全文提取:对目标 PDF 运行
extract_book_full_text.py,在 books/ 下生成 *_全文.txt(不限制页数)。
- 核心概念生成:基于
*_全文.txt 运行 extract_core_concepts.py 得到结构化概念列表,并可选写回 *_框架.md。
- 可选:若自动抽取不够准确,由 Agent 阅读
_全文.txt(可分段)后人工撰写或润色 核心概念,再更新 _框架.md。
步骤 1:全文提取
在项目根执行:
python scripts/extract_book_full_text.py
或只处理一本(文件名可带路径,相对于项目根或 books/):
python scripts/extract_book_full_text.py books/深度工作.pdf
- 输出:
books/<书名>_全文.txt,为该书全部页的提取文本。
- 依赖:
pip install pypdf。
步骤 2:核心概念生成并写回 _框架.md
基于某书的 _全文.txt 生成 核心概念 并可选更新对应 _框架.md:
python scripts/extract_core_concepts.py books/某书_全文.txt
python scripts/extract_core_concepts.py books/某书_全文.txt --update books/某书_框架.md
- 脚本会从正文中抽取章节/标题式行作为概念候选,输出为
## 核心概念 下的列表。
- 若该书尚无 _框架.md,需先用
book_pdf_to_framework.py 生成;本脚本只更新「核心概念」小节。
步骤 3:由 Agent 润色(可选)
若自动抽取结果粗糙或遗漏重点:
- 打开或 @ 该书的
books/*_全文.txt(过长时可分段读取)。
- 根据全书内容撰写「核心概念」:每条为概念名 + 一两句说明,并注明与 Human 3.0 层次/象限的对应(可参考 books/资料索引.md)。
- 用撰写结果替换该书
*_框架.md 中的 ## 核心概念 小节(保留该节标题与前后结构)。
路径与约定
- 电子书目录:
books/(项目内唯一权威位置)。
- 全文提取输出:
books/<书名>_全文.txt;不与 *_提取.txt(前 50 页)混淆。
- 框架文件:
books/*_框架.md;核心概念小节为 ## 核心概念,可含列表与「在 Human 3.0 框架中」「发展阶段」等说明。
脚本位置
| 脚本 | 作用 |
|---|
scripts/extract_book_full_text.py | PDF 全文 → *_全文.txt(无页数限制) |
scripts/extract_core_concepts.py | *_全文.txt 或 *_提取.txt → 核心概念 Markdown,可选 --update 写回 _框架.md |
scripts/book_pdf_to_framework.py | PDF 前 50 页 → _提取.txt + _框架.md(若尚无 _框架,先跑此脚本再跑本 Skill 流程) |
先全文提取再提核心概念,可避免仅凭前 50 页导致的遗漏或偏差。
更多说明
- 与 book_pdf_to_framework 的区分、核心概念小节建议结构、大书分段策略:见 reference.md。