1. 企业 RAG 系统的分层架构,文档解析→分块→嵌入→索引→检索→重排→生成,各层选型与典型方案?
请说明企业 RAG 系统的分层架构:文档解析、分块、嵌入、索引、检索、重排、生成各层的职责与典型选型方案?
- RAG 全链路各层(解析、分块、嵌入、索引、检索、重排、生成)的职责
- 各层典型选型:解析工具、分块策略、embedding 模型、向量库、重排模型、LLM
- 各层之间的数据流与质量瓶颈
企业 RAG 分层架构从数据到答案依次为:文档解析——把 PDF/Word/HTML/扫描件转成结构化文本,典型工具如 PyMuPDF、Unstructured、OCR(Tesseract/PaddleOCR)或 VLM 视觉解析;分块——把长文切成合理粒度,常见固定窗口、语义切分、父子分块(Parent-Child);嵌入——用 embedding 模型(如 text-embedding-3、BGE、Qwen-Embedding)把文本块转成向量,保证语义相似文本向量相近;索引——向量库(Milvus、pgvector、Qdrant、Weaviate)建索引并支持向量+元数据过滤;检索——向量相似度检索(必要时 hybrid:BM25+向量),取 Top-K;重排——用 Cross-Encoder Reranker(如 bge-reranker)对初检索结果精排,提升命中质量;生成——把命中的上下文与用户问题交给 LLM 生成带引用的答案。各层选型要匹配数据规模、延迟与成本:数据大用专用向量库,数据小可用 pgvector 降低运维;延迟敏感用轻量重排或跳过重排。
RAG 的价值在"可检索、可溯源、可更新",相比纯 LLM 幻觉更可控。分层架构的核心是每层可独立调优,质量瓶颈往往在解析与分块(源头数据质量)而非检索算法。选型要权衡性能、成本、运维复杂度,并建立端到端评测闭环持续优化。