Skip to main content

unstructured-document-ingestion

用于PDF/Word/邮件接入的非结构化文档接入原子 skill,适用于通用行业数据接入场景。

Ir a la instalación

Datos de origen

Repositorio
jewdore/openclaw-finclaw-test
Última actividad en el origen
16 de marzo de 2026 a las 10:29
Idioma detectado de SKILL.md
chino
Estrellas
0
Forks
0

Opciones de instalación

De forma predeterminada está seleccionado el prompt que primero revisa el origen. Puedes cambiar a un comando directo o descargar una copia local.

Revisa los archivos de origen

Lee SKILL.md y los archivos complementarios que muestra SkillsMP antes de decidir si quieres instalarlo.

Mostrando SKILL.md

SKILL.md
Instrucciones de origen · Vista previa de solo lectura
name
unstructured-document-ingestion
description
用于PDF/Word/邮件接入的非结构化文档接入原子 skill,适用于通用行业数据接入场景。
# 非结构化文档接入 Skill ## 数据来源 本 Skill 支持多种非结构化文档输入格式,核心数据来源包括: ### 1. 文档类型 - **PDF文档**:PDF格式的文档 - **Word文档**:Word格式的文档 - **邮件文档**:邮件文件、邮件附件 - **其他文档**:文本文件、RTF文件等 ### 2. 文档来源 - **本地文件**:本地文件系统中的文档 - **网络文件**:网络URL的文档 - **邮件系统**:邮件系统的邮件和附件 - **文档库**:文档管理系统中的文档 ### 3. 文档特征 - **文档大小**:小文档(<1MB)、大文档(>100MB) - **文档格式**:标准格式、非标准格式 - **文档语言**:中文、英文、多语言混合 - **文档质量**:清晰文档、扫描文档、低质量文档 ### 4. 数据格式要求 - **文件路径**:本地文件路径或网络文件URL - **文件格式**:PDF、Word、邮件等格式 - **文件编码**:UTF-8、GBK、GB2312等 - **文件权限**:需要读取权限 > 说明:本 Skill 不包含文档采集功能,需要用户提供非结构化文档文件。建议文档格式规范,以便进行准确的文档接入。 --- ## 功能 本 Skill 提供全面的非结构化文档接入能力,涵盖多种接入功能: ### 1. 文档读取 - **PDF读取**:读取PDF文档内容 - **Word读取**:读取Word文档内容 - **邮件读取**:读取邮件内容和附件 - **文件格式识别**:自动识别文件格式 ### 2. 文档解析 - **文本提取**:提取文档中的文本内容 - **结构识别**:识别文档的结构和格式 - **元数据提取**:提取文档的元数据信息 - **内容分段**:将文档内容分段处理 ### 3. 文档转换 - **格式转换**:转换文档格式 - **编码转换**:转换文档编码 - **结构转换**:转换文档结构 - **内容标准化**:标准化文档内容 ### 4. 文档索引 - **内容索引**:建立文档内容索引 - **元数据索引**:建立文档元数据索引 - **全文检索**:支持全文检索功能 - **分类标签**:为文档添加分类标签 ### 5. 文档验证 - **文档完整性验证**:验证文档的完整性 - **文档可读性验证**:验证文档的可读性 - **文档质量评估**:评估文档的质量 - **文档格式验证**:验证文档格式 ### 6. 高级处理功能 - **批量处理**:批量处理多个文档 - **增量处理**:增量处理新文档 - **文档去重**:识别和去除重复文档 - **接入报告**:生成文档接入报告 --- ## 使用示例 ### 输出示例 ```json { "source_info": { "source_type": "file_system", "source_path": "/documents", "document_count": 100 }, "ingestion_config": { "supported_formats": ["pdf", "docx", "doc"], "extract_text": true, "extract_metadata": true, "index_content": true }, "ingestion_results": { "total_documents": 100, "successful_documents": 95, "failed_documents": 5, "ingestion_time": "2024-03-15T10:00:00", "duration": "300s" }, "document_samples": [ { "document_id": "DOC001", "filename": "annual_report.pdf", "file_size": 5120000, "file_type": "pdf", "page_count": 200, "text_length": 50000, "metadata": { "title": "2024年度报告", "author": "示例公司", "created_date": "2024-03-01", "modified_date": "2024-03-10" }, "extraction_status": "success", "indexed": true } ], "statistics": { "documents_processed": 100, "documents_indexed": 95, "total_text_extracted": 5000000, "average_processing_time": "3s", "success_rate": 0.95 } } ``` --- ## 注意事项与限制 ### 1. 文档格式要求 - 标准格式文档接入准确率较高 - 非标准格式可能影响接入 - 扫描文档需要OCR支持 ### 2. 文档解析准确性 - 清晰文档解析准确率较高 - 模糊文档可能影响解析 - 复杂格式可能需要特殊处理 ### 3. 文档大小 - 小文档处理速度较快 - 大文档可能需要较长时间 - 超大文档可能需要分段处理 ### 4. 文档质量 - 高质量文档接入效果较好 - 低质量文档可能影响接入 - 需要预处理低质量文档 ### 5. 使用限制 - 本 Skill 不包含文档编辑功能 - 接入结果需要人工复核 - 复杂文档可能需要人工处理 --- ## 参考资料 - 见 references/ 目录中的相关文档,包括: - 非结构化文档接入方法手册 - PDF/Word解析指南 - 文档索引说明 - 性能优化指南
Ver en GitHub