| name | rag-patterns |
| description | RAG 模式 —— 检索增强生成架构设计、分块策略、向量检索优化与评估方法 |
| category | AI |
| loading | on-demand |
| triggers | {"keywords":["RAG","检索增强","向量检索","知识库","embedding","chunking","文档检索"]} |
RAG 模式(检索增强生成)
概述
提供检索增强生成(Retrieval-Augmented Generation)系统的架构设计和优化指南,覆盖文档处理、分块策略、向量检索、重排序和评估全流程。
使用场景
- 构建基于私有知识库的问答系统
- 优化现有 RAG 系统的检索命中率和答案质量
- 选择分块策略(Chunking)和 Embedding 模型
- 评估 RAG 系统的检索和生成效果
核心原则
- 分块策略决定检索质量:分块太大导致检索精度降低,太小导致上下文碎片化。语义分块(按段落/章节)优于固定长度分块。
- 检索增加冗余度:召回 top_k 设为实际用量的 2-3 倍,留出重排序空间。检索不足时答案不完整,检索过多时引入噪声。
- 重排序大幅提升准确率:初检索使用轻量模型(BM25 / 向量相似度),最终选片使用强模型(Cross-encoder Reranker)。
- 上下文组织影响生成质量:将检索到的文档按相关性排列,标注来源,控制总长度在模型有效注意力窗口内。
- 评估需要多维指标:检索质量(Recall@k, MRR)、答案质量(忠实度、相关性)、用户体验(延迟、可解释性)。
RAG 流水线
文档加载 → 文本提取 → 分块 → Embedding → 向量存储(索引)
查询 → 向量检索 → 混合检索(BM25 + 向量)→ 重排序 → 上下文组装 → LLM 生成
检查清单