用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。
直接命令不会经过审查 Prompt;运行前请先检查来源。
npx skills add https://github.com/InternScience/ChemClaw --skill literature-parsing命令会保持在同一行。复制前请横向滚动并检查完整内容。
想先保存到本地?可下载 SkillsMP 当前能够提供的文件。
基于 SOC 职业分类
正在显示 SKILL.md
| name | literature-parsing |
| description | 将 PDF 文献转换为 Markdown 文件,并提取所有图表图片。使用 MinerU (opendatalab) 进行工业级高质量解析。 |
| trigger | ["PDF 转 Markdown","PDF 转换","文献解析","提取图片","PDF to Markdown","convert PDF","extract figures","PDF 转 markdown","解析文献","PDF 提取","PDF 转文字"] |
将 PDF 文献完整转换为 Markdown 文件,并自动提取所有图表和图片。使用 MinerU (opendatalab) 进行工业级高质量解析。
| 组件 | 用途 |
|---|---|
| MinerU | 工业级 PDF 解析引擎 (opendatalab) |
| Pipeline Backend | 文本提取、布局分析 |
| OCR | 扫描版 PDF 文字识别 |
转换后的目录结构:
output_folder/
├── document.md # 主 Markdown 文件
├── images/ # 提取的图片
│ ├── xxx.jpg
│ ├── yyy.jpg
│ └── ...
└── document_metadata.json # 文档元数据
将这个 PDF 转换为 Markdown
解析这篇文献,提取所有图片
PDF to Markdown with figures
批量转换这些 PDF 文件
# 基本转换(自动模式)
python3 scripts/literature_parsing.py -i paper.pdf -o ./output
# 文本 PDF(速度快)
python3 scripts/literature_parsing.py -i paper.pdf -o ./output -m txt
# 扫描版 PDF(使用 OCR)
python3 scripts/literature_parsing.py -i paper.pdf -o ./output -m ocr
# 指定语言(提高 OCR 准确率)
python3 scripts/literature_parsing.py -i paper.pdf -o ./output -l en
# 使用 GPU 加速
python3 scripts/literature_parsing.py -i paper.pdf -o ./output -d cuda
# 基本用法
mineru -p paper.pdf -o ./output
# 文本模式(无图片,速度快)
mineru -p paper.pdf -o ./output -m txt
# OCR 模式(扫描版)
mineru -p paper.pdf -o ./output -m ocr
# 指定语言
mineru -p paper.pdf -o ./output -l ch
# 指定设备
mineru -p paper.pdf -o ./output --device cpu
| 参数 | 简写 | 说明 | 默认值 |
|---|---|---|---|
--input | -i | 输入 PDF 文件路径 | - |
--output | -o | 输出目录 | ~/.openclaw/media/literature-parsing |
--method | -m | 解析方法:auto/txt/ocr | auto |
--lang | -l | OCR 语言:ch/en 等 | ch |
--device | -d | 设备:cpu/cuda | cpu |
--quiet | -q | 安静模式(输出 JSON) | false |
$ python3 scripts/literature_parsing.py -i paper.pdf -o ./output
✓ 开始处理:paper.pdf
输出目录:./output
解析方法:auto
设备:cpu
✓ 处理完成:paper.pdf
Markdown: paper.md
图片数量:12 张
✓ 文件已整理到:./output/paper
✅ 转换完成!
📄 Markdown: ./output/paper/paper.md
🖼️ 图片:./output/paper/images (12 张)
📊 元数据:./output/paper/paper_metadata.json
# 处理目录中所有 PDF
for pdf in *.pdf; do
python3 scripts/literature_parsing.py -i "$pdf" -o ./output
done
生成的 Markdown 文件结构:
# 论文标题
作者信息
# Abstract
摘要内容...
# 1. Introduction
正文内容,保留 LaTeX 公式:$E = mc^2$

## 2. Methods
### 2.1 Data Collection
| Column 1 | Column 2 |
|----------|----------|
| Data A | Data B |

# References
[1] Author A, et al. Title. Journal, 2023.
# 安装 MinerU
pip install 'mineru[all]'
# 如果遇到 numpy 版本问题
pip install 'numpy<2.0' 'pandas<3.0'
$...$ 和显示公式 $$...$$-m ocr 模式| 错误 | 说明 | 解决方案 |
|---|---|---|
File not found | PDF 文件不存在 | 检查文件路径 |
Invalid PDF | PDF 格式损坏 | 尝试修复或重新下载 |
Permission denied | 无读取权限 | 检查文件权限 |
No images found | 未找到图片 | PDF 可能使用矢量图形 |
Timeout | 处理超时(>10 分钟) | 尝试 -m txt 模式或减小文件 |
处理化学文献时,可以:
生成高质量论文:
# 转换单篇 PDF
python3 scripts/literature_parsing.py -i nature_paper.pdf -o ./papers/nature
# 查看结果
ls -la ./papers/nature/
# paper.md
# images/xxx.jpg ...
# paper_metadata.json
# 批量转换
mkdir -p ~/papers/library
for pdf in ~/downloads/*.pdf; do
python3 scripts/literature_parsing.py -i "$pdf" -o ~/papers/library
done
# 使用 MinerU 直接处理
mineru -p paper.pdf -o ./output -s 0 -e 9 # 只处理前 10 页
# 使用 txt 模式,速度更快
python3 scripts/literature_parsing.py -i paper.pdf -o ./output -m txt
# 使用 OCR 模式
python3 scripts/literature_parsing.py -i scanned.pdf -o ./output -m ocr
# 指定语言提高准确率
python3 scripts/literature_parsing.py -i scanned.pdf -o ./output -m ocr -l en
# 使用 CPU(兼容性好)
python3 scripts/literature_parsing.py -i paper.pdf -o ./output -d cpu
# 使用 GPU(速度快,需要 CUDA)
python3 scripts/literature_parsing.py -i paper.pdf -o ./output -d cuda
重要:为了能在飞书等平台上发送生成的文件,输出目录必须在白名单内:
~/.openclaw/media/~/.openclaw/workspace/~/.openclaw/agents/本 skill 默认输出到 ~/.openclaw/media/literature-parsing/,可以直接分享!
MinerU 是 opendatalab 开源的工业级 PDF 解析工具:
| 特性 | PyMuPDF | MinerU |
|---|---|---|
| 文本提取 | ⭐⭐⭐ | ⭐⭐⭐⭐⭐ |
| 公式保留 | ❌ | ✅ |
| 表格识别 | ⭐⭐ | ⭐⭐⭐⭐ |
| 布局分析 | ⭐⭐ | ⭐⭐⭐⭐⭐ |
| OCR 支持 | ❌ | ✅ |
| 扫描版支持 | ❌ | ✅ |