소스 정보
- 저장소
- AuditAIH/audit-tool-skills
- 최근 소스 활동
- 2026년 6월 25일 04:15
- 감지된 SKILL.md 언어
- 중국어
- 스타
- 7
- 포크
- 0
설치 방법
기본적으로 소스를 먼저 확인하는 Prompt가 선택됩니다. 직접 명령으로 전환하거나 로컬 사본을 다운로드할 수도 있습니다.
소스 파일 검토
설치 여부를 결정하기 전에 SKILL.md와 SkillsMP에 표시된 보조 파일을 읽어 보세요.
메뉴
기본적으로 소스를 먼저 확인하는 Prompt가 선택됩니다. 직접 명령으로 전환하거나 로컬 사본을 다운로드할 수도 있습니다.
설치 여부를 결정하기 전에 SKILL.md와 SkillsMP에 표시된 보조 파일을 읽어 보세요.
Codex 또는 Claude로 설치 이 Prompt를 복사해 Codex, Claude 또는 다른 어시스턴트에 붙여 넣으면 Skill 페이지를 검토하고 설치를 진행할 수 있습니다.
직접 명령은 검토 Prompt를 거치지 않습니다. 실행하기 전에 소스를 확인하세요.
npx skills add https://github.com/AuditAIH/audit-tool-skills --skill document-parsing명령은 한 줄로 유지됩니다. 복사하기 전에 가로로 스크롤해 전체 내용을 확인하세요.
로컬 사본을 원하시나요? SkillsMP에서 현재 제공할 수 있는 파일을 다운로드하세요.
SOC 직업 분류 기준
SKILL.md 표시 중
| name | document-parsing |
| description | 文档解析技能。当用户需要从 PDF、Word、Excel、图片(OCR)等文档中提取文本与结构化内容时使用。 |
将各类文档转换为可处理的文本与结构化数据,典型用途包括:单据/凭证提取、报表解析、合同条款抽取、扫描件数字化等。
| 类型 | 扩展名 | 说明 |
|---|---|---|
.pdf | 文本型 / 扫描型均支持 | |
| Word | .docx | 段落、表格、样式 |
| Excel | .xlsx / .xls | 工作表、单元格、表格 |
| 图片 | .png / .jpg / .tif 等 | 通过 OCR 识别 |
pdftotext(poppler):快速提取文本型 PDFpdfplumber:精细表格与版面提取PyMuPDF (fitz):高性能文本 / 图片 / 元数据python-docx:段落、表格、样式openpyxl:单元格级读写pandas:表格批量转 DataFrameTesseract(pytesseract):通用 OCRPaddleOCR:中文与复杂版面效果更佳使用前先检测工具是否已安装(
which/python -c "import …"),缺失时提示安装或回退方案。
输出建议采用 JSON 或 Markdown,按以下结构组织:
paragraphs:段落文本列表tables:表格(二维数组 / Markdown 表格)key_values:键值对(适用于表单、凭证)metadata:文件名、页数、解析工具、时间chi_sim)本工具自带脚本,位于 scripts/ 下,按需安装依赖后即可运行:
| 文件 | 作用 |
|---|---|
scripts/parse.py | 解析主脚本:自动识别 PDF/Word/Excel/图片,统一输出 JSON(paragraphs/tables/key_values/metadata) |
scripts/requirements.txt | 依赖清单(按实际用到的文档类型按需安装) |
# 按需安装依赖(解析哪类装哪类)
pip install -r scripts/requirements.txt
# OCR 还需系统安装 Tesseract 引擎,中文需 chi_sim 语言包
# 自动识别类型并解析,结果输出到 stdout(JSON)
python scripts/parse.py --input 报销台账.xlsx
# 指定类型 + 输出到文件
python scripts/parse.py --input 发票.pdf --type pdf --output result.json
# OCR 解析扫描件 / 图片
python scripts/parse.py --input 扫描发票.png --type ocr
输出 JSON 结构:
{
"metadata": {"file": "...", "type": "...", "tool": "...", "pages": 3},
"paragraphs": ["..."],
"tables": [[...]],
"key_values": {"k": "v"}
}
缺哪种依赖会明确提示安装命令;脚本优先用已安装的库(如 PDF 优先 PyMuPDF,回退 pdftotext)。