用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。
直接命令不会经过审查 Prompt;运行前请先检查来源。
npx skills add https://github.com/vamseeachanta/workspace-hub --skill pdf-large-reader命令会保持在同一行。复制前请横向滚动并检查完整内容。
想先保存到本地?可下载 SkillsMP 当前能够提供的文件。
基于 SOC 职业分类
正在显示 SKILL.md
| name | pdf-large-reader |
| version | 1.0.0 |
| category | data |
| description | Memory-efficient PDF processing library for large files exceeding 100MB and 1000 pages |
| type | reference |
| capabilities | [] |
| requires | [] |
| see_also | [] |
| tags | [] |
Memory-efficient PDF processing library for large files (100MB+, 1000+ pages).
/mnt/github/workspace-hub/pdf-large-readercd /mnt/github/workspace-hub/pdf-large-reader
pip install -e .
from pdf_large_reader import process_large_pdf, extract_text_only
# Simple text extraction
text = extract_text_only("large_document.pdf")
# Full processing with options
result = process_large_pdf(
"document.pdf",
output_format="generator", # "generator", "list", or "text"
extract_images=True,
extract_tables=True
)
# Stream pages for memory efficiency
for page in result:
print(f"Page {page['page_num']}: {page['text'][:100]}...")
# Extract text
pdf-large-reader extract document.pdf
# Extract with options
pdf-large-reader extract document.pdf --output-format text --extract-images
# Get PDF info
pdf-large-reader info document.pdf
| Feature | Description |
|---|---|
| Streaming | Generator output for memory efficiency |
| Auto Strategy | Intelligent chunk sizing based on file size |
| Multi-format | Text, images, tables, metadata extraction |
| Progress | Built-in progress callbacks |
| AI Fallback | Claude integration for complex extraction |
for page in process_large_pdf("doc.pdf", output_format="generator"):
# Process one page at a time - memory efficient
handle_page(page)
pages = process_large_pdf("doc.pdf", output_format="list")
# All pages in memory - use for smaller files
text = process_large_pdf("doc.pdf", output_format="text")
# Plain text concatenation
from pdf_large_reader import process_large_pdf
from pathlib import Path
def process_pdf_directory(directory: str):
"""Process all PDFs in a directory efficiently."""
pdf_dir = Path(directory)
for pdf_file in pdf_dir.glob("*.pdf"):
print(f"Processing: {pdf_file.name}")
# Stream pages to avoid memory issues
for page in process_large_pdf(str(pdf_file)):
# Index, analyze, or store each page
yield {
"file": pdf_file.name,
"page": page["page_num"],
"text": page["text"],
"images": len(page.get("images", []))
}
from pdf_large_reader import process_large_pdf
from pdf_large_reader.exceptions import PDFProcessingError
try:
result = process_large_pdf("document.pdf")
except PDFProcessingError as e:
print(f"PDF processing failed: {e}")
except FileNotFoundError:
print("PDF file not found")
file-org-standards - Where to store extracted contentlogging-standards - Logging PDF processing operations