用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。
直接命令不会经过审查 Prompt;运行前请先检查来源。
npx skills add https://github.com/lzfxxx/ppt-master --skill ocr-image-to-markdown命令会保持在同一行。复制前请横向滚动并检查完整内容。
想先保存到本地?可下载 SkillsMP 当前能够提供的文件。
基于 SOC 职业分类
正在显示 SKILL.md
| name | OCR Image to Markdown |
| description | 鉴于本地 OCR 工具的缺失,本技能利用 Agent 的多模态能力来查看图像(PNG, JPG 等)并将内容(文本、表格、逻辑图)转录为格式化的 Markdown。 |
本技能允许你“阅读”图片并将内容转换为可编辑的 Markdown 文本。这在提取数据表格、幻灯片内容或文档截图时特别有用,尤其是当无法使用外部 OCR 库时。
确认目标图片:
list_dir 浏览目录。查看图片:
view_file 工具来“看”图片内容。系统允许你直接处理图像数据。view_file,这样你的视觉模型才能消化它。转录内容:
| 表头 | ... |)。#, ## 等来标记图片中的标题,保持层级结构。保存输出:
write_to_file 将转录的内容写入 .md 文件(例如 ocr_results.md)。pytesseract, easyocr, PIL)来进行文本提取。请直接利用你自身的视觉能力。请求: "把这 3 张财务报告的截图转为 markdown。"
执行:
list_dir 查看文件: img1.png, img2.png, img3.png。view_file 读取 img1.png。view_file 读取 img2.png 和 img3.png。write_to_file 创建 financial_report.md 并写入汇总的内容。