| name | pdf |
| kind | docs |
| description | 读取、抽取、合并、拆分、转换、生成或检查 PDF 文件的工作流。 |
PDF Skill
用户要求处理 PDF、扫描件、报告、合同、论文、票据或网页导出 PDF 时使用。先区分任务是读取理解、生成、编辑、转换,还是批量处理。
常见任务
- 读取文本:优先使用可用的 PDF 文本抽取工具;扫描件需要 OCR。
- 页面转图片:用于视觉检查、截图比对、版式确认。
- 合并/拆分:保留原文件,输出新文件并核对页数。
- 转换格式:PDF 转 DOCX/PPTX/图片/文本时说明可能丢失版式。
- 网页生成 PDF:Dashboard 可用
browser_action 的 pdf 动作保存当前页面。
工作流
- 确认输入路径是否在允许读取根目录内,输出路径是否得到授权。
- 判断 PDF 类型:文本型、扫描型、混合型、表单型、受密码保护。
- 对文本型 PDF,先抽取文本,再按页码或章节总结。
- 对扫描型 PDF,先转图片或 OCR;OCR 低置信度时提醒用户。
- 对编辑/合并/拆分任务,写入新文件,不覆盖原件。
- 处理完成后检查输出文件存在、页数和大小合理。
安全与准确性
- 不绕过密码、DRM 或访问控制。
- 不伪造签名、印章、发票、合同条款。
- 法律、财务、医疗 PDF 只能做信息整理,不能替代专业意见。
- 如果抽取结果缺页、乱码或表格错位,必须说明不确定性。
可用工具提示
- QQ Agent 默认不能读取任意本地 PDF,只能读取 Skill 文档。
- Dashboard Agent 可在审批策略下使用文件、shell、浏览器工具完成真实文件处理。
- 若缺少
pdftotext、pdftoppm、LibreOffice、OCR 等依赖,先报告缺失依赖和建议安装方式。