用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。
直接命令不会经过审查 Prompt;运行前请先检查来源。
npx skills add https://github.com/AuditAIH/audit-tool-skills --skill document-parsing命令会保持在同一行。复制前请横向滚动并检查完整内容。
想先保存到本地?可下载 SkillsMP 当前能够提供的文件。
正在显示 SKILL.md
基于 SOC 职业分类
| name | document-parsing |
| description | 文档解析技能。当用户需要从 PDF、Word、Excel、图片(OCR)等文档中提取文本与结构化内容时使用。 |
将各类文档转换为可处理的文本与结构化数据,典型用途包括:单据/凭证提取、报表解析、合同条款抽取、扫描件数字化等。
| 类型 | 扩展名 | 说明 |
|---|---|---|
.pdf | 文本型 / 扫描型均支持 | |
| Word | .docx | 段落、表格、样式 |
| Excel | .xlsx / .xls | 工作表、单元格、表格 |
| 图片 | .png / .jpg / .tif 等 | 通过 OCR 识别 |
pdftotext(poppler):快速提取文本型 PDFpdfplumber:精细表格与版面提取PyMuPDF (fitz):高性能文本 / 图片 / 元数据python-docx:段落、表格、样式openpyxl:单元格级读写pandas:表格批量转 DataFrameTesseract(pytesseract):通用 OCRPaddleOCR:中文与复杂版面效果更佳使用前先检测工具是否已安装(
which/python -c "import …"),缺失时提示安装或回退方案。
输出建议采用 JSON 或 Markdown,按以下结构组织:
paragraphs:段落文本列表tables:表格(二维数组 / Markdown 表格)key_values:键值对(适用于表单、凭证)metadata:文件名、页数、解析工具、时间chi_sim)本工具自带脚本,位于 scripts/ 下,按需安装依赖后即可运行:
| 文件 | 作用 |
|---|---|
scripts/parse.py | 解析主脚本:自动识别 PDF/Word/Excel/图片,统一输出 JSON(paragraphs/tables/key_values/metadata) |
scripts/requirements.txt | 依赖清单(按实际用到的文档类型按需安装) |
# 按需安装依赖(解析哪类装哪类)
pip install -r scripts/requirements.txt
# OCR 还需系统安装 Tesseract 引擎,中文需 chi_sim 语言包
# 自动识别类型并解析,结果输出到 stdout(JSON)
python scripts/parse.py --input 报销台账.xlsx
# 指定类型 + 输出到文件
python scripts/parse.py --input 发票.pdf --type pdf --output result.json
# OCR 解析扫描件 / 图片
python scripts/parse.py --input 扫描发票.png --type ocr
输出 JSON 结构:
{
"metadata": {"file": "...", "type": "...", "tool": "...", "pages": 3},
"paragraphs": ["..."],
"tables": [[...]],
"key_values": {"k": "v"}
}
缺哪种依赖会明确提示安装命令;脚本优先用已安装的库(如 PDF 优先 PyMuPDF,回退 pdftotext)。