Skip to main content
Run any Skill in Manus
with one click

pdf-ocr

Stars66
Forks9
UpdatedMay 10, 2026 at 09:50

PDF → JSONL,會先判斷是文字型還是掃描型: - 文字型:直接用 PyMuPDF 抽文字(不浪費 token) - 掃描型:用 LLM 視覺能力(Read / view_image)逐頁辨識 嚴禁任何傳統 OCR 引擎(Tesseract / PaddleOCR / EasyOCR)、雲端 OCR API、MCP 圖像工具。 一次只做一本書(單機鎖),完成後清除所有暫存(PNG 與 progress 檔)。 每次最多處理一個 batch(預設 8 頁),支援 --resume;長時間任務必須採用低上下文 append-only 流程。 觸發時機: - 使用者說「OCR 這個 PDF」 - 使用者說「把掃描 PDF 做成 JSONL」 - 使用者說「/pdf-ocr <path>」 - 使用者說「用 LLM 視覺辨識這個 PDF」 典型呼叫: - /pdf-ocr /path/to/book.pdf - /pdf-ocr /path/to/book.pdf /path/to/output.jsonl - /pdf-ocr /path/to/book.pdf --resume - /pdf-ocr /path/to/book.pdf --batch 8 --dpi 120

Installation

Install with Codex or Claude Copy this prompt, paste it into Codex, Claude, or another assistant, and let it review the skill page and install it for you.

File Explorer
4 files
SKILL.md
readonly