大模型基础

RAG 的检索与生成流程

RAG 把外部资料接入模型上下文,重点是先检索相关片段,再让模型基于证据回答。

RAG 的检索与生成流程

当知识更新很快、资料属于私有数据,或者回答必须给出依据时,可以用 RAG(Retrieval-Augmented Generation)把检索系统和大模型连接起来。

一条请求怎样流动

用户问题 → 问题向量化 → 检索相关片段 → 重排与截断 → 拼入上下文 → 模型生成回答

资料切分影响检索质量

太大的切片会把无关内容一起带入上下文,太小则可能丢失定义和前后关系。常见做法是按标题、段落和语义边界切分,并保留少量重叠,让跨段落的概念不至于断开。

召回不等于答案

向量检索只负责找“可能相关”的内容。生产系统通常还要做关键词补充、重排、去重和权限过滤,最后再把有限数量的高质量片段交给模型。模型也应被要求只依据给定资料回答,不确定时明确说不知道。

小结

RAG 的效果取决于整条链路,而不只是向量数据库。应分别评估召回是否找到证据、上下文是否足够、回答是否忠实于证据,并为每一段结果保留来源。