用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。
直接命令不会经过审查 Prompt;运行前请先检查来源。
npx skills add https://github.com/sunchenzheng/openclaw-skill --skill docx-reader命令会保持在同一行。复制前请横向滚动并检查完整内容。
想先保存到本地?可下载 SkillsMP 当前能够提供的文件。
正在显示 SKILL.md
| name | docx-reader |
| description | 读取和处理 Word 文档(.docx)。识别文档文字内容、提取图片、生成结构化摘要。触发场景:用户发送或指定 .docx 文件路径,要求读取、总结或分析内容。 |
# 基本读取
from docx import Document
doc = Document("C:\\path\\to\\file.docx")
for para in doc.paragraphs:
if para.text.strip():
print(para.text)
# 读取表格
for table in doc.tables:
for row in table.rows:
for cell in row.cells:
print(cell.text, end="\t")
print()
# 提取图片
for rel in doc.part.rels.values():
if "image" in rel.target_ref:
img_data = rel.target_part.blob
img_name = rel.target_ref.split("/")[-1]
with open(f"output/{img_name}", "wb") as f:
f.write(img_data)
# 识别标题层级
def extract_headings(doc):
headings = []
for para in doc.paragraphs:
if para.style.name.startswith("Heading"):
level = para.style.name.replace("Heading ", "")
headings.append({"level": level, "text": para.text})
return headings
| 属性 | 说明 |
|---|---|
doc.paragraphs | 所有段落 |
doc.tables | 所有表格 |
doc.inline_shapes | 所有嵌入式图片 |
doc.part.rels | 文档关系(包含图片引用) |
导出目录结构:
原文件目录/
├── 原文件名.docx
└── extracted_images/
├── image1.png
├── image2.jpg
└── ...
.docx(Office Open XML),不支持 .doc(旧版格式).doc 文件需先转换为 .docx(可用 PowerShell + Word COM 自动化)基于 SOC 职业分类