用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。
直接命令不会经过审查 Prompt;运行前请先检查来源。
npx skills add https://github.com/ForceInjection/awesome-skills --skill pptx-reader命令会保持在同一行。复制前请横向滚动并检查完整内容。
想先保存到本地?可下载 SkillsMP 当前能够提供的文件。
精确修改 PowerPoint (.pptx)——按 shape 名定位做 run 级文本替换、风格化新增元素,并用 LibreOffice + pdftotext 渲染验证无出界、无碰撞。当用户要求修改、编辑或更新现有 .pptx 演示文稿中的文本、布局或元素时使用。
去除文本中的 AI 生成痕迹,使其更自然、更像真人书写。适用于编辑或审阅文章、博客、技术文档等中文文本, 检测并修复 35 种 AI 写作特征:夸大的意义宣称、宣传语、模糊来源、AI 高频词汇、破折号滥用、三段式结构、 否定式排比、聊天机器人残句、模板化结尾等。基于维基百科 "Signs of AI writing" 指南。
审查技术文档。支持四种独立评审类型:大纲评审(检查目录与结构逻辑)、内容评审(检查文字准确性与代码质量)、资产评审(校验链接与引用合规)、格式评审(校对纯视觉排版与标点),审查后可按需调用 humanizer-zh 去除 AI 写作痕迹。仅在用户请求审查或修正 Markdown 文档时使用,纯去 AI 化请求请交给 humanizer-zh。
基于 SOC 职业分类
正在显示 SKILL.md
| name | pptx-reader |
| description | 理解、读取和分析 .pptx 幻灯片文件内容。当用户需要提取 PPT 文本或分析演示文稿时调用此技能。 |
English version: SKILL-en.md
本文档详细介绍了如何利用本技能读取和解析 .pptx 文件。相关数据和最佳实践来源参考自 GitHub 的 anthropics/skills 仓库。
通过 markitdown CLI 工具,可以一键提取幻灯片的核心文本内容,适用于快速的数据摄取场景。
| 任务 | 指南 |
|---|---|
| 读取 / 分析内容 | 执行 python -m markitdown presentation.pptx > output_dir/output.md |
为避免依赖冲突与外部管理环境限制,所有解析脚本均需在独立的 Python 虚拟环境中执行。
在 macOS 等环境中,为避免与系统全局 Python 环境冲突(如遇到 externally-managed-environment 错误),强烈建议使用虚拟环境。
# 进入 scripts 目录
cd scripts
# 创建名为 venv 的虚拟环境
python3 -m venv venv
# 激活虚拟环境 (macOS/Linux)
source venv/bin/activate
# 安装相关依赖
pip install "markitdown[pptx]" Pillow defusedxml
通过 Python 脚本可直接从 .pptx 文件中提取纯文本流、生成多幻灯片视觉概览,或解包原始 XML 结构以供深度审查。
确保已激活 scripts 目录下的虚拟环境,随后可以执行以下命令:
# 创建统一的输出目录
mkdir -p output_dir
# 提取 PPTX 中的纯文本内容并输出到指定文件
python -m markitdown presentation.pptx > output_dir/output.md
# 生成指定 PPTX 文件的视觉概览图并指定输出前缀 (含目录)
python thumbnail.py presentation.pptx output_dir/thumbnails
# 将 PPTX 文件解包到指定的 unpacked 目录中
python office/unpack.py presentation.pptx output_dir/unpacked/
利用 LibreOffice 和 Poppler 工具链,可将演示文稿无损渲染为 PDF 并逐页切分为高分辨率 JPEG 图像,为大模型多模态视觉分析提供基础语料。
将演示文稿转换为单张幻灯片图像以供视觉检查:
# 创建统一的输出目录
mkdir -p output_dir
# 将 PPTX 文件无头模式转换为 PDF,并输出到指定目录
python office/soffice.py --headless --convert-to pdf --outdir output_dir/ presentation.pptx
# 将生成的 PDF 文件转换为 150 DPI 的 JPEG 图像序列,并指定输出前缀 (含目录)
pdftoppm -jpeg -r 150 output_dir/presentation.pdf output_dir/slide
这将会生成 output_dir/slide-01.jpg、output_dir/slide-02.jpg 等文件,便于后续提取并交由大语言模型分析视觉排版。
文本提取、图像渲染与解包操作依赖以下 Python 包与系统级 CLI 工具链。
markitdown[pptx]:用于文本提取。Pillow:用于生成缩略图网格。defusedxml:用于安全的 XML 解析(缩略图幻灯片信息提取与解包操作)。soffice):用于 PDF 转换(通过 office/soffice.py 在沙箱环境中自动配置;run_soffice 会自动注入临时用户 profile,避免沙箱中 "User installation could not be completed" 崩溃)。pdftoppm):用于将 PDF 转换为图像。