最近总有人问我,RAG 到底怎么做。
我说你具体想做什么。
十有八九,对方描述的是同一个东西:把文档切块、做向量化、存进向量数据库,用户提问的时候检索出最相关的几段,拼进 prompt 丢给大模型。
我说,这叫 Naive RAG,是最基础的那种。
然后对方通常会愣一下:啊?RAG 还分种类?
分。而且光是主流的架构,就至少有 9 种。
每一种背后,都是在解决上一种解决不了的问题。
所以今天我想把这 9 种架构一次讲清楚。不讲论文里的公式和术语,就讲它们各自在干什么、解决了什么问题、什么时候该用。
你只要看完这一篇,以后再有人跟你聊 RAG,你能清楚地知道他在说哪一层。
一、Naive RAG(朴素 RAG)
所有故事都从这里开始。
Naive RAG 的流程,就是教科书里写的那一套:文档分块 → 向量化 → 相似度检索 → 拼 prompt → 生成回答。
简单粗暴,跑得起来。
但问题一堆。
最致命的是,检索这一步是“瞎”的。用户问“去年的销售额对比前年怎么样”,它可能检索回来一堆包含“销售额”的片段,但没有按时间排序,也没有跨片段做对比的能力。大模型拿到这些零散的片段,硬着头皮生成,结果就是一本正经地胡说八道。
所以后来的人,都是在给它打补丁。
二、Advanced RAG(高级 RAG)
打补丁的第一步,是把检索这个环节拆开,前后都加东西。
检索前:先对用户的问题做改写、扩展、分解。比如把“那个事”改写成具体指代,把“对比 A 和 B”拆成两个子查询。
检索中:不光用向量检索,还加上关键词检索(BM25),两个一起用,互补。
检索后:把检索回来的东西重新排序。因为向量检索的“相似”经常不等于“有用”,用一个专门的 rerank 模型再筛一遍。
Advanced RAG 就是这一整套优化手段的合集。
它没有改变 Naive RAG 的骨架,只是把每个关节都磨亮了。对于大多数场景,做到这一步效果就已经不错了。
Naive RAG vs Advanced RAG 流程对比
三、Modular RAG(模块化 RAG)
到了这一步,有人发现一个问题:不同的场景,需要的组件完全不一样。
问答类的场景,需要强检索;摘要类的场景,检索不重要;多轮对话,需要记忆模块;有些场景还需要路由,先判断问题类型再决定走哪条路。
于是 RAG 被拆成了乐高。
检索、路由、记忆、融合、合成……每一个环节都是独立的模块,可以插拔、可以替换、可以重新组合。
换句话说,Modular RAG 更多是一种工程哲学。它告诉你:把 RAG 看作一条流水线,每个工序都可以按需定制。
后面所有的架构,其实都可以看作是 Modular RAG 的某种特例。
到这里为止,前三种解决的都是“怎么检索得更准”。
但有人发现了一个更尴尬的问题:检索回来的东西,模型根本不知道该不该信。
这就引出了下一波。
四、Self-RAG(自反思 RAG)
核心思想一句话:让大模型自己判断。
不是所有问题都需要检索。你问“1+1 等于几”,模型本来就会,硬塞一堆检索结果进去反而干扰。也不是所有检索结果都靠谱,模型得能判断这段内容到底相不相关。
Self-RAG 训练模型生成一种叫“反思 token”的东西,在关键节点上自己做决策:这个问题要不要检索?检索回来的东西有没有用?最后生成的回答有没有依据?
简单说,它给模型装了一个“自检开关”。
好处是可控性大幅提升,模型不再无脑地用检索结果。代价是得专门训练,成本不低。
五、Corrective RAG / CRAG(纠正性 RAG)
思路类似,但走的是另一条路。
CRAG 加了一个“检索评估器”。检索回来的文档,先打分。分高的是“正确”知识,精炼后使用;分低的是“噪声”,直接扔掉;如果全都不行,就触发 web 搜索,重新找。
它的逻辑是:与其让模型硬吞一堆不靠谱的内容,不如先过滤一遍。
Self-RAG 是模型自己反思,CRAG 是外部加个质检员。目的都是一样的——别让烂检索毁了最终回答。
六、Adaptive RAG(自适应 RAG)
又往前走一步。
前面所有的架构,不管问题简单还是复杂,走的都是同一条流水线。问题是有代价的:简单问题也走完整流程,又慢又费钱;复杂问题走单步检索又不够。
Adaptive RAG 会先给查询分类。简单的事实性问题,直接让模型答;中等复杂度的,单步检索;需要多跳推理的复杂问题,走多步检索甚至迭代检索。
它像一个智能的分诊台,根据病情轻重把患者送到不同的诊室。
Self-RAG / CRAG / Adaptive RAG 决策流程
到这里,前 6 种 RAG 处理的还都是“文本对文本”的世界。
但知识从来不只是文本。这就有了后面三种。
七、GraphRAG(图 RAG)
传统的 RAG 有一个死穴:它回答不了“全局性”的问题。
你问“这本书的核心观点是什么”,向量检索会找回几个看起来相关的片段,但它拼不出全貌。因为向量检索本质上是局部匹配,它看不到文档和文档之间的结构关系。
GraphRAG 把这件事彻底换了思路。它先从文档里抽取实体和关系,构建成一张知识图谱,然后在这张图上做社区发现,给每个社区生成摘要。回答问题的时候,它沿着图的脉络去走,能看到全局的结构。
代价是构建图谱又慢又贵。但遇到那种需要“纵观全局”的问题,它是目前最靠谱的解法之一。
八、Agentic RAG(智能体 RAG)
这是目前最火的方向。
前面的 RAG,无论怎么优化,本质都是“一次性的流水线”:检索一次,生成一次,结束。
但真实世界里,很多问题不是一次检索就能解决的。比如“帮我分析一下这家公司今年的财务状况,并对比它的三个主要竞争对手”,这种问题需要规划、需要多轮检索、需要调用不同的工具(查财报、查新闻、算指标)、需要中间推理。
Agentic RAG 把 RAG 变成了 Agent 的一个工具。大模型作为大脑,自主决定:现在该不该检索?检索什么?用哪个数据源?检索结果够不够?不够就再来一轮。
这一次,流水线变成了一个会思考、会行动的助手。
能力最强,复杂度也最高。光是延迟和成本这两件事,就够工程团队头疼一阵了,稳定性更是新的考验。
九、Multi-modal RAG(多模态 RAG)
最后一种,把 RAG 从纯文本拓展到了所有模态。
文档里有图表、有图片、有 PDF 里的表格、有视频里的画面,这些都能被检索、被理解、被生成。
实现路径有很多种:可以用多模态 embedding 统一检索,可以把图片转成文字描述再走文本 RAG,也可以直接用多模态大模型端到端处理。
它解决的是“真实世界的信息本来就是多模态的”这件事。
GraphRAG / Agentic RAG / 多模态 RAG 能力象限
九种讲完了。
最后我给你一个总结性的判断,免得你看完还是懵的。
如果你刚开始做 RAG,先从 Naive RAG 起步,能跑就行。
跑起来之后效果不好,就上 Advanced RAG 的那套优化(查询改写、混合检索、rerank),这是性价比最高的一步。
如果你的场景需要灵活组合不同能力,用 Modular RAG 的思路来组织系统。
如果你发现检索结果经常不靠谱、模型乱用,考虑 Self-RAG 或 CRAG 的思路,加一道“质量检查”。
如果你的问题复杂度差异很大,Adaptive RAG 帮你做分流。
如果你要回答全局性、结构性的问题,上 GraphRAG。
如果你的任务需要多步规划、多轮检索,Agentic RAG 是目前的天花板。
如果你的数据不止是文字,Multi-modal RAG。
就这么简单。
不要一上来就 Agentic RAG、GraphRAG,那是杀鸡用牛刀,又贵又慢还不一定稳。
也不要永远停留在 Naive RAG,然后抱怨“RAG 效果真差”。
RAG 不是一个东西,它是一整个方案的家族。
你选哪一种,取决于你要解决什么问题。
至于哪个最新、哪个最酷,那是另一回事。
学AI大模型的正确顺序,千万不要搞错了
🤔2026年AI风口已来!各行各业的AI渗透肉眼可见,超多公司要么转型做AI相关产品,要么高薪挖AI技术人才,机遇直接摆在眼前!
有往AI方向发展,或者本身有后端编程基础的朋友,直接冲AI大模型应用开发转岗超合适!
就算暂时不打算转岗,了解大模型、RAG、Prompt、Agent这些热门概念,能上手做简单项目,也绝对是求职加分王🔋
📝给大家整理了超全最新的AI大模型应用开发学习清单和资料,手把手帮你快速入门!👇👇
学习路线:
✅大模型基础认知—大模型核心原理、发展历程、主流模型(GPT、文心一言等)特点解析
✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑
✅开发基础能力—Python进阶、API接口调用、大模型开发框架(LangChain等)实操
✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用
✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代
✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经
以上6大模块,看似清晰好上手,实则每个部分都有扎实的核心内容需要吃透!
我把大模型的学习全流程已经整理📚好了!抓住AI时代风口,轻松解锁职业新可能,希望大家都能把握机遇,实现薪资/职业跃迁~