用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。
直接命令不会经过审查 Prompt;运行前请先检查来源。
npx skills add https://github.com/davidtoby/agent-skills --skill pdf-content-extractor-annotator命令会保持在同一行。复制前请横向滚动并检查完整内容。
想先保存到本地?可下载 SkillsMP 当前能够提供的文件。
基于 SOC 职业分类
正在显示 SKILL.md
| name | PDF Content Extractor & Annotator |
| version | 1.0.0 |
| author | xiexikang |
| description | 提取与分析 PDF:文本、表格、元数据、图片;支持合并、注释与去水印,提供 OCR 兜底与综合报告 |
| triggers | ["extract pdf","pdf 提取","合并 pdf","annotate pdf","pdf 注释","提取图片","pdf 图片","去水印","移除水印"] |
| dependencies | ["PyPDF2","pdfplumber","reportlab","pandas","openpyxl","Pillow","PyMuPDF","pytesseract"] |
| tags | ["pdf","extraction","annotation","data-processing","ocr","image-extraction","watermark-removal"] |
此技能提供完整的 PDF 处理能力:
output/<文件名>/imagesoutput/<文件名>/<文件名>_images.jsonpattern(按文本规则)、heuristic(启发式统计)、both(联合)resources/watermark_patterns.json(可选)--dry-run,生成去水印后的 PDFoutput/<文件名>/images,并生成 output/<文件名>/<文件名>_images.json 清单pytesseract)兜底,ocr_lang 指定语言,tesseract_cmd 指定可执行路径fitz)的 redaction/编辑引擎resources/watermark_patterns.json 中的 text_patterns 命中后遮盖pattern(规则匹配)、heuristic(启发式统计)、both(联合使用)Stamp、FreeText 等注释类型text_patterns 支持 contains、icontains、regexheuristics 包含 min_font_size、repeat_threshold_percent、min_text_lengthremove_annotations 与 annotation_types 控制注释清理范围min_width / min_height)避免噪声both 或增补配置词典--tesseract-cmd 指定路径、--ocr-lang 指定语言