大模型基础
RAG 的检索与生成流程
RAG 把外部资料接入模型上下文,重点是先检索相关片段,再让模型基于证据回答。
RAG 的检索与生成流程
当知识更新很快、资料属于私有数据,或者回答必须给出依据时,可以用 RAG(Retrieval-Augmented Generation)把检索系统和大模型连接起来。
一条请求怎样流动
用户问题 → 问题向量化 → 检索相关片段 → 重排与截断 → 拼入上下文 → 模型生成回答
资料切分影响检索质量
太大的切片会把无关内容一起带入上下文,太小则可能丢失定义和前后关系。常见做法是按标题、段落和语义边界切分,并保留少量重叠,让跨段落的概念不至于断开。
召回不等于答案
向量检索只负责找“可能相关”的内容。生产系统通常还要做关键词补充、重排、去重和权限过滤,最后再把有限数量的高质量片段交给模型。模型也应被要求只依据给定资料回答,不确定时明确说不知道。
小结
RAG 的效果取决于整条链路,而不只是向量数据库。应分别评估召回是否找到证据、上下文是否足够、回答是否忠实于证据,并为每一段结果保留来源。