| name | kb-ingest |
| description | 预处理 raw/ 中的新文件并登记到索引。当用户说"导入文件"、"处理新文件"、"ingest"、"kb ingest"时触发。
支持 PDF、Excel、图片 OCR、Word 文档的自动提取。
|
| user-invocable | true |
导入新文件
将 raw/ 中的新文件进行预处理(提取文本)并登记到 RAW-REGISTRY.md。
执行步骤
Step 1: 定位知识库
- 从当前目录向上查找
index/RAW-REGISTRY.md 文件,确定知识库根目录
- 如果找不到,提示用户先运行
/kb-init
Step 2: 运行预处理脚本
- 执行
python3 scripts/ingest.py {kb_root}
- 脚本会自动:
- 扫描 raw/ 中未登记的新文件
- 按文件类型提取文本到
raw/.extracted/ 目录
- 输出处理摘要
- 如果脚本报错缺少依赖,提示用户运行
pip install -r scripts/requirements.txt
Step 3: 登记到 RAW-REGISTRY.md
- 读取脚本输出的 INGEST SUMMARY
- 对每个新文件,读取提取的文本(如有),生成一句话摘要
- 在
index/RAW-REGISTRY.md 表格中添加新行:
- 文件:相对路径(如
raw/paper.pdf)
- 类型:文件后缀
- 摘要:一句话描述文件内容
- 状态:
pending(待编译)
- 编译产物:
—
Step 4: 输出摘要
- 报告处理结果:导入了 N 个文件,M 个待编译
- 提示下一步:运行
/kb-compile 将新文件编译为 wiki 文章