| name | unstructured-document-ingestion |
| description | 用于PDF/Word/邮件接入的非结构化文档接入原子 skill,适用于通用行业数据接入场景。 |
非结构化文档接入 Skill
数据来源
本 Skill 支持多种非结构化文档输入格式,核心数据来源包括:
1. 文档类型
- PDF文档:PDF格式的文档
- Word文档:Word格式的文档
- 邮件文档:邮件文件、邮件附件
- 其他文档:文本文件、RTF文件等
2. 文档来源
- 本地文件:本地文件系统中的文档
- 网络文件:网络URL的文档
- 邮件系统:邮件系统的邮件和附件
- 文档库:文档管理系统中的文档
3. 文档特征
- 文档大小:小文档(<1MB)、大文档(>100MB)
- 文档格式:标准格式、非标准格式
- 文档语言:中文、英文、多语言混合
- 文档质量:清晰文档、扫描文档、低质量文档
4. 数据格式要求
- 文件路径:本地文件路径或网络文件URL
- 文件格式:PDF、Word、邮件等格式
- 文件编码:UTF-8、GBK、GB2312等
- 文件权限:需要读取权限
说明:本 Skill 不包含文档采集功能,需要用户提供非结构化文档文件。建议文档格式规范,以便进行准确的文档接入。
功能
本 Skill 提供全面的非结构化文档接入能力,涵盖多种接入功能:
1. 文档读取
- PDF读取:读取PDF文档内容
- Word读取:读取Word文档内容
- 邮件读取:读取邮件内容和附件
- 文件格式识别:自动识别文件格式
2. 文档解析
- 文本提取:提取文档中的文本内容
- 结构识别:识别文档的结构和格式
- 元数据提取:提取文档的元数据信息
- 内容分段:将文档内容分段处理
3. 文档转换
- 格式转换:转换文档格式
- 编码转换:转换文档编码
- 结构转换:转换文档结构
- 内容标准化:标准化文档内容
4. 文档索引
- 内容索引:建立文档内容索引
- 元数据索引:建立文档元数据索引
- 全文检索:支持全文检索功能
- 分类标签:为文档添加分类标签
5. 文档验证
- 文档完整性验证:验证文档的完整性
- 文档可读性验证:验证文档的可读性
- 文档质量评估:评估文档的质量
- 文档格式验证:验证文档格式
6. 高级处理功能
- 批量处理:批量处理多个文档
- 增量处理:增量处理新文档
- 文档去重:识别和去除重复文档
- 接入报告:生成文档接入报告
使用示例
输出示例
{
"source_info": {
"source_type": "file_system",
"source_path": "/documents",
"document_count": 100
},
"ingestion_config": {
"supported_formats": ["pdf", "docx", "doc"],
"extract_text": true,
"extract_metadata": true,
"index_content": true
},
"ingestion_results": {
"total_documents": 100,
"successful_documents": 95,
"failed_documents"
注意事项与限制
1. 文档格式要求
- 标准格式文档接入准确率较高
- 非标准格式可能影响接入
- 扫描文档需要OCR支持
2. 文档解析准确性
- 清晰文档解析准确率较高
- 模糊文档可能影响解析
- 复杂格式可能需要特殊处理
3. 文档大小
- 小文档处理速度较快
- 大文档可能需要较长时间
- 超大文档可能需要分段处理
4. 文档质量
- 高质量文档接入效果较好
- 低质量文档可能影响接入
- 需要预处理低质量文档
5. 使用限制
- 本 Skill 不包含文档编辑功能
- 接入结果需要人工复核
- 复杂文档可能需要人工处理
参考资料
- 见 references/ 目录中的相关文档,包括:
- 非结构化文档接入方法手册
- PDF/Word解析指南
- 文档索引说明
- 性能优化指南