本文探讨了 RAG 全链路检索优化中的两个关键环节:混合检索和后检索优化。首先分析了单一检索方式的局限性,提出了混合检索的必要性,并结合向量、关键词和 SQL 检索的优势进行组合。其次,详细介绍了后检索阶段的重排序、RAG-Fusion 和上下文压缩技术,以提升检索结果的准确性和相关性。最后,通过实际案例和实战经验,总结了不同场景下的优化策略,强调了针对数据特性和瓶颈进行个性化调整的重要性。
引言
接着前两篇聊。预检索把知识和索引收拾利索了,查询优化让用户的问题能被系统听懂,接下来就轮到检索本身和检索之后这两段。
真到了生产环境你会发现,检索和查完之后的处理,才是决定答案质量的上限。前面准备工作做得再好,这一步拉胯,前面的功夫基本白搭。
这篇文章一次性聊清楚两块:
检索阶段——重点是混合检索(Hybrid Retrieval)。单一检索通道总会有短板,怎么把向量、关键词、SQL 这些不同路子组合起来。
后检索阶段(Post-retrieval)——查完了,但这堆结果还不能直接喂给 LLM。要不要重排?要不要融合?要不要压缩?这几步做好了,答案质量能上一个台阶。
最后再给一份全流程组合拳的实战搭配,讲清楚什么场景该上哪几招。
一、混合检索(Hybrid Retrieval)
为什么单一检索总是不够用
先看三样东西各自的短板:
| 检索方式 | 擅长 | 短板 |
|---|---|---|
| 向量检索 | 语义相似、自然语言表达 | 精确匹配弱,受向量空间表示能力限制 |
| 关键词 / 全文检索 | 精确匹配、专有名词 | 不理解自然语言,同义改写就抓瞎 |
| SQL 检索 | 结构化字段、精确过滤 | 面对非结构化文本毫无办法 |
单独拎出来哪个都不够看。向量检索能懂"这个药吃了会不会过敏",但搜"合同编号 CT2024-001"这种精确串,可能给你召回一坨语义相近的废话;BM25 能精准命中编号,却听不懂自然语言问题;SQL 能过滤字段,但读不了文档正文。
混合检索的思路就一句话:别赌单一通道,取长补短,动态组合。
根据数据特性、查询需求、场景约束,把多条检索路子跑起来,再把结果揉到一起。
什么场景必须上混合检索
- 异构数据:库里同时有结构化表、半结构化文档、非结构化文本
- 复杂查询:既要精确匹配又要语义理解(比如查一个具体条款,同时问它背后的逻辑)
- 动态知识 + 实时性:静态知识库 + 实时数据得一起融合
- 高准确率 / 高召回率:医疗、法律这种出错代价大的领域,几乎绕不开
实战经验
踩过的坑
之前给一个药品说明书问答系统做检索,一开始纯向量,精度还行但召回率上不去——用户报的"xx片 0.5g"这种规格,向量匹配经常歪。后来把 BM25 加进来做双路,规格数字被精确命中,召回率一下就上来了。
再后来发现还有一批数据在关系库里(比如药品的适应症标签、厂家信息),向量和 BM25 都够不到,只能再加一路 SQL,按字段过滤后合并。三路一起跑,才把"自然语言问句 + 精确规格 + 结构化属性"这种复合查询都兜住。
几个关键教训:
融合不是简单拼接。多路结果重合度高,先去重,再决定怎么归一化打分。不然一路强、一路弱,弱的那路纯添乱。
通道不是越多越好。每加一路都有计算和存储成本,先确认它能补上哪块短板,再上。
权重要调。不同场景下各路权重不一样——侧重精确就压关键词权重,侧重理解就抬向量权重。
注意事项
- 融合策略(权重、RRF、打分归一化)直接决定效果
- 多路检索耗时叠加,能并发就并发
- 先想清楚瓶颈是"召回率"还是"精确率",再决定加哪一路
二、重排序(Re-ranking)
问题背景
检索系统第一轮通常是"粗召回",目的是别漏,所以会把一堆候选都捞回来。但这批候选的质量参差不齐——有的根本不相关,却可能排在前面。
多路召回之后更严重:好几路结果混在一起,相关的和不相关的堆成一团。如果就这么原样喂给 LLM,不相关文档占着上下文前面的位置,答案生成直接被带偏。
重排序的思路:粗召回保"召回率",精排保"准确率",两步分开做。
用专门的排序模型/算法,把检索回来的知识块重新排一遍,过滤掉不符合条件的,让最相关、最合规的块排到最前面。
做法
第一轮用轻量方法(向量相似度、BM25 分数)捞回 Top-N,N 通常取 50100;再用精排模型对这个候选集重新打分排序,取 Top-K(比如 35)作为最终喂给 LLM 的上下文。
精排模型常见方案:
- Cross-encoder:把查询和每个文档块拼在一起让模型打分,精度高但速度慢,适合候选集不大时
- 业务规则过滤:按元数据、时间、合规条件先滤掉一部分,再上模型精排
- LLM 重排:直接把候选列表丢给 LLM 让它挑,灵活但成本高
实战经验
踩过的坑
做企业知识库问答时,开始偷懒不做重排,直接把多路召回的 Top-8 喂给 LLM。结果用户问"年假折算规则",返回的答案里居然夹了一段无关的"加班费计算"——因为那段文档在向量距离上跟"年假"沾边,排到了前面。
后来加了 cross-encoder 重排,Top-8 变 Top-4,答案干净多了,用户反馈明显改善。
提醒一句:重排序不是万能的。如果第一轮粗召回压根没把相关文档捞回来,重排再准也没用。重排解决的是"顺序不对",解决不了"压根没召回"。
注意事项
- 候选集 N 别太大,cross-encoder 逐对打分很慢,注意时效
- 重排后一定要过滤掉明确不相关的,别只排序不删
- 有合规要求的场景,排序模型里强约束违规内容不许进 Top-K
三、RAG-Fusion
问题背景
Multi-Query(多路召回)能开出好几条查询,把召回面铺开,但副作用是——查回来的上下文特别多,里面混着大量不相关文档,排序还看运气。
RAG-Fusion 就是治这个病的:用 Multiple Query 生成多条查询,各自检索,再用倒数排名融合(Reciprocal Rank Fusion)重新排序,最后取 Top-K 喂给 LLM。
一句话:在 Multi-Query 的基础上,给结果加一道"跨查询合并重排"。
RRF 到底在算什么
Reciprocal Rank Fusion(倒数排名融合)的核心公式:
RRF(d) = Σᵢ 1 / (k + rankᵢ(d))拆开讲:
- N:参与融合的检索列表数量。BM25 + 向量检索两路,N=2;Multi-Query 生成了 3 个问题,N=3
- rankᵢ(d):文档 d 在第 i 个列表里的排名(从 1 开始)
- k:平滑常数,通常取 60
本质:只看"排名"不看"分数"。文档在越靠前的位置,给它加的分越多;跨多个列表都出现的文档,分自然更高。这样就不用担心不同检索通道的分数放不到一个量纲上——直接拿排名说话。
实战经验
踩过的坑
最早做多路召回融合时,我用的是"加权求和":给向量路和关键词路各定个权重,把两边分数加起来排序。结果俩通道分数分布完全不同——向量路分数 0.8 起步,BM25 分数零零散散,权重怎么调都别扭。
换成 RRF 后舒服多了。它只关心排名,天然免疫"分数不可比"的问题。代码短、效果好、不挑通道。
实测数据(企业综合知识库):
| 指标 | 单路召回 | Multi-Query | Multi-Query + RRF |
|---|---|---|---|
| 召回率 | 53% | 82% | 82% |
| Top-5 命中率 | 48% | 63% | 79% |
| 相关文档前置率 | 差 | 一般 | 好 |
召回率靠多路铺开,命中率靠 RRF 把真正相关的顶到前面。
注意事项
- k 取 60 是经验值,稳定且常用,别乱调
- 排序列表里一定要带上名字,不然融合后没法映射
- RRF 之后再套一道重排序(cross-encoder),效果通常比单用更好
四、上下文压缩和过滤(Context Compression)
问题背景
分块的时候,我们通常不知道用户会问什么。这意味着:跟查询最相关的信息,可能藏在一个塞满了大量无关文本的文档块里。
如果把这个大块原样丢给 LLM,两个后果:
烧钱——token 用得多,调用成本高
质量差——无关噪声干扰模型,回答容易跑偏
压缩的思路:用"给定查询"这个上下文,把检索回来的文档压一压,只返回相关信息,而不是原样倒给 LLM。
怎么做
- 按查询截断:只保留与查询相关的那几句,其余丢弃
- LLM 提炼:让模型基于查询把块的精华抽出来,生成精简摘要
- 规则过滤:按关键词、元数据把明显无关的块剔掉
实战经验
踩过的坑
做合同条款问答时,一个条款块里既有正文、又有注释、还有一大段背景说明。用户问"提前解约要赔多少",相关其实就一句话,但整个块有上千 token,原样喂给 LLM,模型经常被注释和背景带偏,还会在无关信息上绕圈子。
我用 LLM 做了个"按查询压缩":只抽出与"提前解约违约金"直接相关的那一句,配上一小段必要上下文。token 直接省了一大半,回答也更准。
实测:同一批查询,压缩前每次喂 2500 token,压缩后约 1000 token,成本降了约 60%,回答准确率还升了。
注意事项
- 压缩会引入一次额外的 LLM 调用,轮次敏感的场景要权衡
- 提炼时要保留关键数字、条款编号,别压缩完信息丢了
- 压缩和重排序可以一起用:先重排选出相关块,再压缩去噪,最后喂模型
五、检索阶段 + 后检索阶段,选型对比
| 手段 | 阶段 | 解决的问题 | 代价 |
|---|---|---|---|
| 混合检索 | 检索 | 单一通道有短板,取长补短 | 多路计算 + 融合逻辑 |
| 重排序 | 后检索 | 粗召回排序不准、噪声在前 | cross-encoder 计算耗时 |
| RAG-Fusion | 后检索 | 多路召回后合并重排 | 多查询生成 + RRF |
| 上下文压缩 | 后检索 | 块太大、噪声多、token 浪费 | 一次额外 LLM 调用 |
六、全流程组合拳
前几篇讲的预检索、查询优化,加上本文的混合检索、后检索优化,串起来就是完整的一条流水线:
一个决策思路
数据里混着表格 / 非结构化 / 结构化? 是 → 混合检索(向量 + BM25 + SQL) 否 → 看下一行 多路召回后结果又杂又乱? 是 → RAG-Fusion(RRF 合并)+ 重排序 否 → 直接单路 + 重排序 检索回来的块又长又吵? 是 → 上下文压缩过滤 否 → 原样可用 瓶颈到底是"查不全"还是"查不准"还是"答不对"? → 查不全 → 混合检索 / 多路召回 → 查不准 → 重排序 / RRF → 答不对 → 补上下文 / 查 retrieval 之前环节我的常用组合
| 场景 | 方案组合 | 理由 |
|---|---|---|
| 企业综合知识库 | 混合检索 + RAG-Fusion + 重排序 | 异构数据 + 多路召回,合并精排 |
| 医疗 / 法律领域 | 混合检索 + 重排序 + 上下文过滤 | 高准确率 + 合规要求,噪声必须滤掉 |
| 客服 FAQ | 混合检索 + 重排序 | 用户问法多样,精确 + 语义都要 |
| 长文档问答 | 父子索引 + 上下文压缩 | 保上下文 + 去噪省 token |
一句话总结
检索别赌单一通道,查完别急着喂模型。先用混合检索把面铺开,再用 RRF / 重排把真正相关的顶到前面,最后压缩去噪再交给 LLM。 每一步都对应一个明确瓶颈,缺哪环补哪环,别一股脑全上。
七、总结
到这里,RAG 全链路检索优化的四块就齐了:预检索 → 查询优化 → 检索(混合)→ 后检索(重排 / 融合 / 压缩)。
| 阶段 | 核心手段 | 解决问题 |
|---|---|---|
| 预检索 | 摘要 / 父子 / 假设性问题 / 元数据索引 | 把知识和索引收拾利索 |
| 查询优化 | 问题补全 / 多路召回 / 问题分解 | 让用户问题被系统听懂 |
| 检索 | 混合检索(向量 + 关键词 + SQL) | 单一通道有短板,互补召回 |
| 后检索 | 重排序 / RAG-Fusion / 上下文压缩 | 保准、去噪、省 token,喂出高质量上下文 |
做 RAG 最深的感受:真功夫都在检索这一圈,而不是在 prompt 上。 把这一条链路捋顺了,LLM 拿到的上下文干净、相关、够精准,答案质量自然就上去了。
没有银弹,只有最合适的组合。 按数据特征和瓶颈对症下药,先 A/B 验证再上量,比拍脑袋堆一堆手段要靠谱得多。
最后
2026年技术圈的分化愈发明显:降薪裁员潮持续蔓延,传统开发、测试等岗位大批缩水,不少从业者陷入职业焦虑;与之形成鲜明对比的是,AI大模型相关岗位迎来疯狂扩招,薪资逆势飙升150%,大厂更是直接开出70-100W年薪,疯抢具备实战能力的大模型人才,甚至放宽年龄限制,只求能快速落地技术、创造价值!
很多程序员、职场新人纷纷入局大模型领域,绝非盲目跟风,而是实实在在看到了不可替代的价值优势,这也是2026年最值得抓住的职业风口:
1、窗口期红利,入门门槛友好:不同于成熟赛道的“内卷式招聘”,2026年大模型人才缺口巨大,简历只要达标(掌握基础AI应用+具备简单项目经验),年龄、学历均非硬性要求,小白可快速入门,转行程序员也能无缝衔接;
2、技术可复用,上手速度翻倍:如果你有前后端开发、测试、数据分析等基础,在大模型落地、系统部署、Prompt工程等环节会更具优势,无需从零开始,复用原有技术能力就能快速进阶;
3、懂业务更吃香,竞争力翻倍:单纯懂技术已不够,2026年大厂更看重“技术+业务”的复合型人才,有垂直领域(金融、医疗、工业等)经验者,能精准定位模型落地痛点,薪资比纯技术岗高出30%以上;
更重要的是,即便没有转型需求,用AI大模型工具为工作赋能、提升效率,也已经成为80%企业的硬性要求——不会用大模型提效,未来很可能被行业淘汰!
那么2026年,小白/程序员该如何高效学习大模型?
很多人想入门大模型,却陷入两大困境:要么到处搜集零散资料,不成体系,越学越懵;要么被收费高昂的课程割韭菜,花了钱却学不到实战技能,白白浪费时间走弯路。
今天就给大家精心整理了一份2026年最新、免费、系统化的AI大模型学习资源包,覆盖从零基础入门到商业实战、从理论沉淀到面试通关的全流程,所有资料均已整理归档,无需拼凑,直接领取就能上手学习,小白可照做,程序员可进阶!
👇👇扫码免费领取全部内容👇👇
1、大模型系统化学习路线
这份学习路线结合2026年行业趋势和新手学习规律,由行业专家精心设计,从零基础到精通,每一步都有明确指引,帮你节省80%的无效学习时间,少走弯路、高效进阶,避免踩坑。
2、从0到进阶大模型学习视频教程
从入门到进阶这里都有,跟着老师学习事半功倍。
3、大模型学习书籍&电子文档
涵盖2026年最新技术要点,包括基础入门、Transformer核心原理、Prompt工程、RAG实战、模型微调与部署等内容
4、AI大模型最新行业报告
报告包含腾讯、阿里、甲子光年等权威机构发布的核心内容,还有2026年中文大模型基准测评报告、AI Agent行业研究报告等,帮你站在行业前沿,把握技术风口。
5、大模型项目实战&配套源码
项目包含Deepseek R1、GPT项目、MCP项目、RAG实战等热门方向,还有视频配套代码,手把手教你从0到1完成项目开发,既能练手提升技术,又能丰富简历,为求职和职业发展加分。
6、2026大模型大厂面试真题
2026年大模型面试已全面升级,不再单纯考察基础原理,而是转向侧重技术落地和业务结合的综合考察,很多程序员和新手因为缺乏针对性准备,明明技术不错,却在面试中失利。
适用人群
四阶段学习规划(共90天,可落地执行)
第一阶段(10天):初阶应用
该阶段让大家对大模型 AI有一个最前沿的认识,对大模型 AI 的理解超过 95% 的人,可以在相关讨论时发表高级、不跟风、又接地气的见解,别人只会和 AI 聊天,而你能调教 AI,并能用代码将大模型和业务衔接。
- 大模型 AI 能干什么?
- 大模型是怎样获得「智能」的?
- 用好 AI 的核心心法
- 大模型应用业务架构
- 大模型应用技术架构
- 代码示例:向 GPT-3.5 灌入新知识
- 提示工程的意义和核心思想
- Prompt 典型构成
- 指令调优方法论
- 思维链和思维树
- Prompt 攻击和防范
- …
第二阶段(30天):高阶应用
该阶段我们正式进入大模型 AI 进阶实战学习,学会构造私有知识库,扩展 AI 的能力。快速开发一个完整的基于 agent 对话机器人。掌握功能最强的大模型开发框架,抓住最新的技术进展,适合 Python 和 JavaScript 程序员。
- 为什么要做 RAG
- 搭建一个简单的 ChatPDF
- 检索的基础概念
- 什么是向量表示(Embeddings)
- 向量数据库与向量检索
- 基于向量检索的 RAG
- 搭建 RAG 系统的扩展知识
- 混合检索与 RAG-Fusion 简介
- 向量模型本地部署
- …
第三阶段(30天):模型训练
恭喜你,如果学到这里,你基本可以找到一份大模型 AI相关的工作,自己也能训练 GPT 了!通过微调,训练自己的垂直大模型,能独立训练开源多模态大模型,掌握更多技术方案。
到此为止,大概2个月的时间。你已经成为了一名“AI小子”。那么你还想往下探索吗?
- 为什么要做 RAG
- 什么是模型
- 什么是模型训练
- 求解器 & 损失函数简介
- 小实验2:手写一个简单的神经网络并训练它
- 什么是训练/预训练/微调/轻量化微调
- Transformer结构简介
- 轻量化微调
- 实验数据集的构建
- …
第四阶段(20天):商业闭环
对全球大模型从性能、吞吐量、成本等方面有一定的认知,可以在云端和本地等多种环境下部署大模型,找到适合自己的项目/创业方向,做一名被 AI 武装的产品经理。
硬件选型
带你了解全球大模型
使用国产大模型服务
搭建 OpenAI 代理
热身:基于阿里云 PAI 部署 Stable Diffusion
在本地计算机运行大模型
大模型的私有化部署
基于 vLLM 部署大模型
案例:如何优雅地在阿里云私有部署开源大模型
部署一套开源 LLM 项目
内容安全
互联网信息服务算法备案
…
👇👇扫码免费领取全部内容👇👇
7、这些资料真的有用吗?
这份资料由我和鲁为民博士(北京清华大学学士和美国加州理工学院博士)共同整理,现任上海殷泊信息科技CEO,其创立的MoPaaS云平台获Forrester全球’强劲表现者’认证,服务航天科工、国家电网等1000+企业,以第一作者在IEEE Transactions发表论文50+篇,获NASA JPL火星探测系统强化学习专利等35项中美专利。本套AI大模型课程由清华大学-加州理工双料博士、吴文俊人工智能奖得主鲁为民教授领衔研发。
资料内容涵盖了从入门到进阶的各类视频教程和实战项目,无论你是小白还是有些技术基础的技术人员,这份资料都绝对能帮助你提升薪资待遇,转行大模型岗位。
这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】