| name | ragflow-knowledge |
| description | 指导用户如何处理PDF格式的文献、使用RAGFlow矢量知识库框架进行个人的文献管理。当用户提到如何使用RAGFlow、如何上传PDF到RAGFlow知识库、如何处理长文档进行混合检索时立即使用此技能。 |
RAGFlow知识库与PDF文件管理
何时使用
- 用户需要学习RAGFlow知识库的构建与配置过程。
- 需要将本地PDF、Markdown文件等文件上传到RAGFlow知识库、更新知识库文档与元数据。
- 需要处理PDF论文、PDF手册、长文档手册,上传到RAGFlow知识库进行长文档混合检索等操作。
核心功能与工作流程
功能1:RAGFlow知识库的构建与配置
指导RAGFlow知识库的构建与配置过程,具体见references目录下的ragflow_config.md。
功能2:PDF文件的清洗与上传处理
在用户需要将PDF文件的解析为markdown文本、清洗后上传到RAGFlow知识库进行混合检索时,可以使用此功能。具体的工作流程为:
- 询问用户的PDF文件的清洗需求:是直接解析整篇文档作为一个文件进行混合检索,还是需要长文档的分逐页割,按照逐页进行解析后检索。
- 用户说明了解析清洗要求后,必须阅读见
references目录下的pdf_process.md文件,根据用户的分割解析需求,使用合适的脚本进行处理。
- PDF分割清洗后先确认分割后文件的绝对路径,以便后面进行处理。
- 使用对应的脚本进行分割后PDF文件的解析,转化为对应的markdown文件。因为使用Mineru模型进行解析,速度较慢,因此都推荐使用后台模式进行解析。
- 要求用户构建对应的目录文件,方便后面进行目录摘要的总结,具体目录文件的构建方法阅读
references目录下的content_process.md文件。这一步通常需要要求用户来仔细核对,确定文件总结的具体参数。
- 然后参考
ragflow_config.md,上传到RAGFlow知识库,进行检索测试。
功能3:markdown文件的清洗与上传处理
如果是纯markdown文件格式长文档,有明确的页数对应,则可以参考功能2,直接跳过1-4,直接构建目录文件,然后进行上传和检索。