news 2026/9/1 2:56:14

RAG的9种架构,你用的是哪一种?

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
RAG的9种架构,你用的是哪一种?

最近总有人问我,RAG 到底怎么做。

我说你具体想做什么。

十有八九,对方描述的是同一个东西:把文档切块、做向量化、存进向量数据库,用户提问的时候检索出最相关的几段,拼进 prompt 丢给大模型。

我说,这叫 Naive RAG,是最基础的那种。

然后对方通常会愣一下:啊?RAG 还分种类?

分。而且光是主流的架构,就至少有 9 种。

每一种背后,都是在解决上一种解决不了的问题。

所以今天我想把这 9 种架构一次讲清楚。不讲论文里的公式和术语,就讲它们各自在干什么、解决了什么问题、什么时候该用。

你只要看完这一篇,以后再有人跟你聊 RAG,你能清楚地知道他在说哪一层。

一、Naive RAG(朴素 RAG)

所有故事都从这里开始。

Naive RAG 的流程,就是教科书里写的那一套:文档分块 → 向量化 → 相似度检索 → 拼 prompt → 生成回答。

简单粗暴,跑得起来。

但问题一堆。

最致命的是,检索这一步是“瞎”的。用户问“去年的销售额对比前年怎么样”,它可能检索回来一堆包含“销售额”的片段,但没有按时间排序,也没有跨片段做对比的能力。大模型拿到这些零散的片段,硬着头皮生成,结果就是一本正经地胡说八道。

所以后来的人,都是在给它打补丁。

二、Advanced RAG(高级 RAG)

打补丁的第一步,是把检索这个环节拆开,前后都加东西。

检索前:先对用户的问题做改写、扩展、分解。比如把“那个事”改写成具体指代,把“对比 A 和 B”拆成两个子查询。

检索中:不光用向量检索,还加上关键词检索(BM25),两个一起用,互补。

检索后:把检索回来的东西重新排序。因为向量检索的“相似”经常不等于“有用”,用一个专门的 rerank 模型再筛一遍。

Advanced RAG 就是这一整套优化手段的合集。

它没有改变 Naive RAG 的骨架,只是把每个关节都磨亮了。对于大多数场景,做到这一步效果就已经不错了。

Naive RAG vs Advanced RAG 流程对比

三、Modular RAG(模块化 RAG)

到了这一步,有人发现一个问题:不同的场景,需要的组件完全不一样。

问答类的场景,需要强检索;摘要类的场景,检索不重要;多轮对话,需要记忆模块;有些场景还需要路由,先判断问题类型再决定走哪条路。

于是 RAG 被拆成了乐高。

检索、路由、记忆、融合、合成……每一个环节都是独立的模块,可以插拔、可以替换、可以重新组合。

换句话说,Modular RAG 更多是一种工程哲学。它告诉你:把 RAG 看作一条流水线,每个工序都可以按需定制。

后面所有的架构,其实都可以看作是 Modular RAG 的某种特例。


到这里为止,前三种解决的都是“怎么检索得更准”。

但有人发现了一个更尴尬的问题:检索回来的东西,模型根本不知道该不该信。

这就引出了下一波。

四、Self-RAG(自反思 RAG)

核心思想一句话:让大模型自己判断。

不是所有问题都需要检索。你问“1+1 等于几”,模型本来就会,硬塞一堆检索结果进去反而干扰。也不是所有检索结果都靠谱,模型得能判断这段内容到底相不相关。

Self-RAG 训练模型生成一种叫“反思 token”的东西,在关键节点上自己做决策:这个问题要不要检索?检索回来的东西有没有用?最后生成的回答有没有依据?

简单说,它给模型装了一个“自检开关”。

好处是可控性大幅提升,模型不再无脑地用检索结果。代价是得专门训练,成本不低。

五、Corrective RAG / CRAG(纠正性 RAG)

思路类似,但走的是另一条路。

CRAG 加了一个“检索评估器”。检索回来的文档,先打分。分高的是“正确”知识,精炼后使用;分低的是“噪声”,直接扔掉;如果全都不行,就触发 web 搜索,重新找。

它的逻辑是:与其让模型硬吞一堆不靠谱的内容,不如先过滤一遍。

Self-RAG 是模型自己反思,CRAG 是外部加个质检员。目的都是一样的——别让烂检索毁了最终回答。

六、Adaptive RAG(自适应 RAG)

又往前走一步。

前面所有的架构,不管问题简单还是复杂,走的都是同一条流水线。问题是有代价的:简单问题也走完整流程,又慢又费钱;复杂问题走单步检索又不够。

Adaptive RAG 会先给查询分类。简单的事实性问题,直接让模型答;中等复杂度的,单步检索;需要多跳推理的复杂问题,走多步检索甚至迭代检索。

它像一个智能的分诊台,根据病情轻重把患者送到不同的诊室。

Self-RAG / CRAG / Adaptive RAG 决策流程


到这里,前 6 种 RAG 处理的还都是“文本对文本”的世界。

但知识从来不只是文本。这就有了后面三种。

七、GraphRAG(图 RAG)

传统的 RAG 有一个死穴:它回答不了“全局性”的问题。

你问“这本书的核心观点是什么”,向量检索会找回几个看起来相关的片段,但它拼不出全貌。因为向量检索本质上是局部匹配,它看不到文档和文档之间的结构关系。

GraphRAG 把这件事彻底换了思路。它先从文档里抽取实体和关系,构建成一张知识图谱,然后在这张图上做社区发现,给每个社区生成摘要。回答问题的时候,它沿着图的脉络去走,能看到全局的结构。

代价是构建图谱又慢又贵。但遇到那种需要“纵观全局”的问题,它是目前最靠谱的解法之一。

八、Agentic RAG(智能体 RAG)

这是目前最火的方向。

前面的 RAG,无论怎么优化,本质都是“一次性的流水线”:检索一次,生成一次,结束。

但真实世界里,很多问题不是一次检索就能解决的。比如“帮我分析一下这家公司今年的财务状况,并对比它的三个主要竞争对手”,这种问题需要规划、需要多轮检索、需要调用不同的工具(查财报、查新闻、算指标)、需要中间推理。

Agentic RAG 把 RAG 变成了 Agent 的一个工具。大模型作为大脑,自主决定:现在该不该检索?检索什么?用哪个数据源?检索结果够不够?不够就再来一轮。

这一次,流水线变成了一个会思考、会行动的助手。

能力最强,复杂度也最高。光是延迟和成本这两件事,就够工程团队头疼一阵了,稳定性更是新的考验。

九、Multi-modal RAG(多模态 RAG)

最后一种,把 RAG 从纯文本拓展到了所有模态。

文档里有图表、有图片、有 PDF 里的表格、有视频里的画面,这些都能被检索、被理解、被生成。

实现路径有很多种:可以用多模态 embedding 统一检索,可以把图片转成文字描述再走文本 RAG,也可以直接用多模态大模型端到端处理。

它解决的是“真实世界的信息本来就是多模态的”这件事。

GraphRAG / Agentic RAG / 多模态 RAG 能力象限


九种讲完了。

最后我给你一个总结性的判断,免得你看完还是懵的。

如果你刚开始做 RAG,先从 Naive RAG 起步,能跑就行。

跑起来之后效果不好,就上 Advanced RAG 的那套优化(查询改写、混合检索、rerank),这是性价比最高的一步。

如果你的场景需要灵活组合不同能力,用 Modular RAG 的思路来组织系统。

如果你发现检索结果经常不靠谱、模型乱用,考虑 Self-RAG 或 CRAG 的思路,加一道“质量检查”。

如果你的问题复杂度差异很大,Adaptive RAG 帮你做分流。

如果你要回答全局性、结构性的问题,上 GraphRAG。

如果你的任务需要多步规划、多轮检索,Agentic RAG 是目前的天花板。

如果你的数据不止是文字,Multi-modal RAG。

就这么简单。

不要一上来就 Agentic RAG、GraphRAG,那是杀鸡用牛刀,又贵又慢还不一定稳。

也不要永远停留在 Naive RAG,然后抱怨“RAG 效果真差”。

RAG 不是一个东西,它是一整个方案的家族。

你选哪一种,取决于你要解决什么问题。

至于哪个最新、哪个最酷,那是另一回事。

学AI大模型的正确顺序,千万不要搞错了

🤔2026年AI风口已来!各行各业的AI渗透肉眼可见,超多公司要么转型做AI相关产品,要么高薪挖AI技术人才,机遇直接摆在眼前!

有往AI方向发展,或者本身有后端编程基础的朋友,直接冲AI大模型应用开发转岗超合适!

就算暂时不打算转岗,了解大模型、RAG、Prompt、Agent这些热门概念,能上手做简单项目,也绝对是求职加分王🔋

📝给大家整理了超全最新的AI大模型应用开发学习清单和资料,手把手帮你快速入门!👇👇

学习路线:

✅大模型基础认知—大模型核心原理、发展历程、主流模型(GPT、文心一言等)特点解析
✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑
✅开发基础能力—Python进阶、API接口调用、大模型开发框架(LangChain等)实操
✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用
✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代
✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经

以上6大模块,看似清晰好上手,实则每个部分都有扎实的核心内容需要吃透!

我把大模型的学习全流程已经整理📚好了!抓住AI时代风口,轻松解锁职业新可能,希望大家都能把握机遇,实现薪资/职业跃迁~

这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/1 2:52:31

Java Web商城项目实战:从解压部署到上线优化的完整指南

简介:一份基于Servlet、JSP、JDBC、jQuery和Ajax的Java Web商城项目,采用MVC分层与面向接口编程思想,适合初学JavaWeb的开发者作为综合练习、毕业设计或课程设计参考。项目覆盖商品展示、购物车、订单处理、用户登录注册、商品评论、新闻公告…

作者头像 李华
网站建设 2026/9/1 2:52:20

AI竞赛国奖项目复盘:YOLOv8目标检测与行为识别实战

简介:本资源是面向大学生人工智能竞赛选手的实战型备赛资料包,聚焦中国计算机设计大赛人工智能挑战赛核心赛题,涵盖移动物体检测、口罩识别、疲劳检测、安全帽识别等典型CV应用场景,提供从模型训练(YOLOv3)…

作者头像 李华
网站建设 2026/9/1 2:51:46

Hadoop+AI Agent:西藏旅游数据分析与智能规划系统实战

如果你正在准备大数据方向或 AI 方向的毕业设计,又不想只做一个“调包展示型 Demo”,那这次的系统应该很适合参考:基于 Hadoop 与 AI Agent 的西藏旅游数据分析及智能规划系统。它不是单纯写一个爬虫,也不是只调一个大模型接口&am…

作者头像 李华
网站建设 2026/9/1 2:50:42

佳能UFR II打印机驱动从安装到排查:文件名、版本与常见问题全解析

简介:佳能UFRII打印机驱动V1400中文版,面向六十四位Windows系统用户,解决系统无法正确识别打印机、打印任务响应缓慢等常见问题,适用于办公与家庭场景下的佳能设备驱动安装。压缩包共五百一十一个文件,大小约二十五兆字…

作者头像 李华
网站建设 2026/9/1 2:50:40

OPC Core Components x64 105.1解析:从OPC DA联调到排障实践

简介:这是OPC基金会官方发布的OPC Core Components Redistributable(x64)105.1核心组件再发行包,面向64位Windows系统下需要OPC客户端与OPC服务端稳定通信的工业软件开发者、MES/SCADA集成商及自动化设备调试人员。在COOX等机器人…

作者头像 李华