Codex 또는 Claude로 설치 이 Prompt를 복사해 Codex, Claude 또는 다른 어시스턴트에 붙여 넣으면 Skill 페이지를 검토하고 설치를 진행할 수 있습니다.
직접 명령은 검토 Prompt를 거치지 않습니다. 실행하기 전에 소스를 확인하세요.
npx skills add https://github.com/landingbj/LinkMind --skill extract-content-with-image명령은 한 줄로 유지됩니다. 복사하기 전에 가로로 스크롤해 전체 내용을 확인하세요.
로컬 사본을 원하시나요? SkillsMP에서 현재 제공할 수 있는 파일을 다운로드하세요.
SOC 직업 분류 기준
SKILL.md 표시 중
| name | extract_content_with_image |
| description | 将本地 PDF、TXT、Word、PPT 文件分割为文本和图片chunk。 |
| version | 1.0.0 |
| author | lagi |
| tags | ["extract","pdf","chunks","images"] |
执行脚本前请先激活环境
scripts/extract_content_with_image.pyargv[1] 为待处理文件的本地绝对路径.pdf、.txt、.doc、.docx、.ppt、.pptxjson.loads / parseJsonObject{"status":"success","filepath":"...pdf","data":[...]}{"status":"failed","msg":"<具体异常信息>"}data 中每个元素形如:{"text":"...", "image":"<图片列表的 JSON 字符串或空串>"}PyMuPDF(fitz)和 Pillowsoffice,用于 .doc/.docx/.ppt/.pptx/.txt 转 PDF;可用环境变量 SOFFICE_PATH 指定soffice 时:
.txt 会直接用 fitz 生成 PDF,并基于原始文本做分块.doc/.docx/.ppt/.pptx 会返回失败 JSONtransformers + TOKENIZER_DIR 或 MODEL_DIR
CHUNK_SIZE=512SKILL_OUTPUT_DIR/extract_content_with_image/<run_id>/files/filepath 返回转换后的 PDF 路径image 字段中以绝对路径返回page_dir 会在结束时清理,保留裁剪后的图片文件