RAG Engineering MOC
RAG 与知识库工程化知识地图:从文档摄入到检索生成的完整管线,覆盖 Chunking、Embedding、Vector Store、Retriever、Reranker、Citation、Grounding。
#type / moc
#status / growing
#tech / ai
#tech / architecture
[!info] related notes
- 上层 MOC: AI Agent Application MOC, AI MOC
- 核心概念: RAG
- 应用: RAG 知识库与 pgvector
RAG Engineering MOC
RAG 不只是”向量搜索 + 塞给模型”。从文档摄入到分块、从 Embedding 到向量存储、从混合检索到重排序、从引用生成到幻觉检测,RAG 是一个需要系统化工程的完整管线。
这张地图覆盖什么
- RAG 的核心原理与架构
- 文档摄入、分块、元数据管理
- Embedding 模型与向量存储
- 检索策略:语义搜索、关键词搜索、混合检索
- 重排序与上下文压缩
- 引用生成与幻觉检测
- 知识生命周期管理
推荐阅读顺序
- RAG (检索增强生成) — RAG 是什么、为什么需要、核心原理
- 文档摄入 — 从各种数据源加载文档
- 文档分块 — 把文档切成可检索的块
- Embedding 模型 — 把文本转成向量
- 向量数据库 — 存储和检索向量
- 混合检索 — 语义搜索 + 关键词搜索的组合
- [[reranker|Reranker (重排序)]] — 检索结果的二次排序
- 引用生成 — 让模型标注信息来源
- 幻觉减少 — 确保模型回答基于检索内容
核心概念分组
数据管线
向量化与存储
- Embedding 模型 — 把文本转成向量
- 向量数据库 — 向量的存储与检索
检索策略
- 语义搜索 — 基于向量相似度的检索
- 关键词搜索 — 基于 BM25 等传统方法的检索
- 混合检索 — 语义 + 关键词的组合
- Query Rewriting — 查询改写优化
- Multi-query Retrieval — 多查询检索策略
后处理与生成
- [[reranker|Reranker (重排序)]] — 检索结果的二次排序
- 上下文压缩 — 压缩检索结果以节省 token
- 引用生成 — 让模型标注信息来源
- Source Grounding — 确保回答基于检索内容
- 幻觉减少 — 减少模型编造信息
实践
- RAG 知识库与 pgvector — PostgreSQL 向量检索方案
- Python RAG Agent — RAG Agent 实战
- RAG Faithfulness 校验 — 回答与知识库的一致性校验
- 意图感知 RAG 重排 — 按用户意图对检索结果重排