一键导入
batch-paper-pdf-to-markdown
当用户提供本地论文 PDF 文件、PDF 目录或 PDF 路径清单,并希望批量解析为 Markdown 与同名图片目录时使用本 Skill。适合科研论文阅读、知识库入库和批量预处理;不负责论文摘要、翻译、引用元数据抽取、远程 URL 下载或非 PDF 文档处理。
用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。
菜单
当用户提供本地论文 PDF 文件、PDF 目录或 PDF 路径清单,并希望批量解析为 Markdown 与同名图片目录时使用本 Skill。适合科研论文阅读、知识库入库和批量预处理;不负责论文摘要、翻译、引用元数据抽取、远程 URL 下载或非 PDF 文档处理。
用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。
基于 SOC 职业分类
| name | batch-paper-pdf-to-markdown |
| description | 当用户提供本地论文 PDF 文件、PDF 目录或 PDF 路径清单,并希望批量解析为 Markdown 与同名图片目录时使用本 Skill。适合科研论文阅读、知识库入库和批量预处理;不负责论文摘要、翻译、引用元数据抽取、远程 URL 下载或非 PDF 文档处理。 |
当用户需要把一个或多个本地论文 PDF 转成可编辑 Markdown,并保留版面中的图片资源时,使用本 Skill。
适用于以下场景:
本 Skill 基于 PaddleOCR 文档解析能力完成 PDF 内容提取和图片整理,并在脚本侧补充整篇文档输出、图片资源落盘、相对路径改写、覆盖保护、超时控制和错误返回约束,减少手工摘录、手工改路径和重复整理成本。
.pdf 文件。--force。--file-path:单个本地 PDF 文件--input-dir:包含 PDF 的本地目录,可配合 --recursive--file-list:逐行列出 PDF 路径的 UTF-8 文本文件,空行和 # 开头的注释行会被忽略scripts/pdf_to_markdown.py 路径应写成可执行的相对/绝对路径。httpx 和可用的 PaddleOCR 文档解析接口。PADDLEOCR_DOC_PARSING_API_URLPADDLEOCR_ACCESS_TOKENPADDLEOCR_DOC_PARSING_TIMEOUT不要把 token、.env 或其他密钥文件放进 Skill 目录或仓库提交内容。
python -m pip install -r scripts/requirements.txt。--dry-run,确认将处理的 PDF 列表和目标输出路径。--file-path--input-dir,需要包含子目录时追加 --recursive--file-listpaper.md 或 paper/ 已存在,只有在明确允许覆盖时才追加 --force。--continue-on-error。paper.mdpaper/paper/imgs/example.jpg任务完成后检查:
ok、total、succeeded、failed 与实际处理结果一致。source_pdf、markdown_path、image_dir、image_count、pages。markdown_path 指向的 Markdown 文件存在且非空。image_dir 指向的目录存在;如 image_count > 0,目录下应有对应图片文件。单个 PDF:
python scripts/pdf_to_markdown.py --file-path "/absolute/path/to/paper.pdf"
覆盖已有结果:
python scripts/pdf_to_markdown.py --file-path "/absolute/path/to/paper.pdf" --force
批量预检,不调用 OCR:
python scripts/pdf_to_markdown.py --input-dir "/absolute/path/to/papers" --dry-run
目录批量:
python scripts/pdf_to_markdown.py --input-dir "/absolute/path/to/papers"
递归解析目录中的 PDF,并尽量继续处理其余文件:
python scripts/pdf_to_markdown.py --input-dir "/absolute/path/to/papers" --recursive --continue-on-error
按路径清单批量解析:
python scripts/pdf_to_markdown.py --file-list "/absolute/path/to/papers.txt"
references/output_schema.md:PaddleOCR 返回结构中本 Skill 实际依赖的字段说明references/batch_workflow.md:批量输入模式、覆盖策略和结果检查说明references/error_handling.md:常见失败类型、脚本行为和用户反馈要求references/paddleocr_context.md:PaddleOCR 能力来源和接口依赖说明scripts/lib.py:PaddleOCR API 包装逻辑scripts/pdf_to_markdown.py:Markdown 拼装和图片下载逻辑售前工程师AI助手。当用户需要做客户背调、准备拜访材料、制作方案PPT、生成Ghost Deck、准备演讲要点、处理客户异议、评估商机成熟度、写会后跟进计划时,即使没有明确说"售前",也应使用本skill。面向政府、行业头部企业、技术型企业三类客户,覆盖"客户画像→需求分析→Ghost Deck→方案生成→专家自审→演讲要点→异议处理→商机评分→跟进计划"完整售前链路。
用于搜集百度飞桨与文心大模型相关运营资讯、竞品动态、厦门本地 AI 政策活动,并输出潜在客户清单与周度运营汇总的业务技能。当用户提到运营周报、竞品动态、厦门 AI 政策、潜客挖掘、飞桨/文心最新消息、客户线索表、活动情报汇总时都应使用本 Skill。
This skill should be used when the user wants to monitor, search, or analyze social media and web content about ERNIE-Image across Chinese platforms including Zhihu, Xiaohongshu, WeChat Official Accounts, and Baidu Search.
短剧剧本生成Agent。当用户需要创作短剧剧本时使用,支持从选题到成稿的完整创作流程。包含人物设定维护、情节结构规划、剧本格式输出、质量检查等功能。
对即将会面的政府单位、企事业单位等机构进行高可靠背景和业务调研。采用 Pipeline + Reviewer + Generator 结构,强制输出候选来源、原子事实、链接审计、事实准入、组织分析和终审结果,用于尽量确保关键事实均有可核查来源链接,便于进一步深入了解和复核,适用于需要可核查来源和质量门禁的单位调研。
重要会谈谈参生成助手 - 面向高层会谈,基于会谈对象、合作背景、双方诉求与我方能力,自动生成部门领导可直接参考的会谈背景、合作主线、谈话要点、建议提问、后续推进建议及风险提示