【AI Agent面试题】检索 rerank 为什么重要,怎么做? 📅 发布时间:2026/8/20 1:14:07 👁 浏览次数: 从向量召回不够准讲到召回 精排两阶段 · 面向做 RAG 的开发者做 RAG 时经常遇到这样的怪事把 top-k 从 5 调到 20答案反而更差了。检查召回正确的那段其实在里面但排在第 12 位被前面一堆看起来相关、实际没用的片段淹没了。面试里这道题常被问既然向量检索已经能召回为什么还要 rerank它到底解决什么、又是怎么做的核心答案就一句用召回 精排两阶段把粗筛的量和精排的准分开做。为什么单靠向量召回不够向量检索dense retrieval的做法是离线把每段文档用 embedding 模型压成一个固定长度的向量存进向量库在线时把 query 也编码成向量用近似最近邻ANN搜相似的片段。它最大的优点是快——百万级文档也能毫秒级返回。但快的代价是糊query 和文档是分开编码的这叫 bi-encoder双塔两边各自压成向量后只做一次点积/余弦。文档在入库时并不知道将来会被什么 query 检索只能编码成一个平均意义上都还行的向量。一个向量装不下全部语义一段几百字的文档被压成 768 维细粒度的匹配信号某个关键实体、某种否定关系在压缩中被抹平。相似 ≠ 相关向量相似度衡量的是整体语义接近但接近的片段未必真能回答问题。近义词、同话题但答非所问的段落分数经常虚高。结果就是向量召回擅长把可能相关的都捞上来高召回却不擅长把最该在前面的排到前面精度有限。真正有用的那一两段常常排在中游。解法召回 精排两阶段rerank 的核心思想是分工——不追求一个模型既快又准而是拆成两级流水线召回retrieve / 粗排用便宜的向量检索或再叠加 BM25 关键词检索从海量文档里快速捞出一批候选比如 top-50 或 top-100。这一步只求别漏宽进。精排rerank用一个更强但更慢的模型对这几十个候选逐一和 query 做精细打分重新排序取最终 top-3 或 top-5 喂给大模型。这一步只求排准严出。为什么要分两步而不是直接用精排模型扫全库因为精排模型太贵扫百万文档根本跑不动。让向量检索把候选从百万砍到几十精排就只需处理几十条——又快又准各取所长。# 两阶段检索的典型流程 candidates vector_search(query, top_k50) # 阶段一粗召回宽进 scored cross_encoder.rank(query, candidates) # 阶段二精排打分 context scored[:5] # 严出只留最相关的几条精排怎么做cross-encoder 是关键精排能更准靠的不是更大的向量而是换了一种模型结构——cross-encoder交叉编码器。它和召回用的 bi-encoder 最本质的区别在于把 query 和候选文档拼在一起一次性送进模型让两者从第一层就开始做逐词的交叉注意力cross-attention最后直接输出一个相关性分数。# bi-encoder召回两边分开编码事后算相似度 score cos( encode(query), encode(doc) ) # cross-encoder精排拼在一起送进模型直接出分 score model( [CLS] query [SEP] doc )因为 query 的每个词都能直接看到文档的每个词cross-encoder 能捕捉 bi-encoder 丢掉的细粒度信号否定、限定条件、实体是否精确对上、问题和答案的逻辑对应。这也是它更准的根本原因。但代价同样明确它无法预先离线编码——每来一个 query都得把它和每个候选现算一遍没法像向量那样建索引。所以 cross-encoder 只能用在已经被砍到几十条的候选上绝不能扫全库。这恰好和两阶段架构互补bi-encoder 负责规模cross-encoder 负责精度。维度召回 · Bi-encoder双塔精排 · Cross-encoder交叉输入方式query 与 doc 分开编码query 与 doc 拼接后一起送入能否离线建索引能文档向量可预存不能每次 query 现算速度快百万级毫秒返回慢只能处理几十条候选精度有限细粒度信号被压平高逐词交叉注意力定位第一阶段宽进保召回第二阶段严出保精度落地时的实用要点召回宽度要够精排只能重排它拿到的候选召回漏了就补不回来。top-k 召回建议给到 50~100用 rerank 后再收窄到 3~5。宁可粗召回多捞也别在第一步就漏掉答案。混合召回更稳向量检索 BM25 关键词检索并联hybrid能同时覆盖语义相近和字面命中两类情况再统一交给 rerank比单路召回鲁棒得多。rerank 是延迟大头cross-encoder 一次要跑几十次前向是整条链路里最慢的一环。可以选轻量 rerank 模型、控制候选数量或用现成的 rerank API如 Cohere Rerank、BGE-reranker、Jina Reranker平衡效果与延迟。别把 rerank 当万能药它只能在召回结果里排序。如果召回本身质量差、正确片段根本没进候选rerank 也无能为力——问题得回到切分策略、embedding 模型和召回宽度上解决。一句判断如果你发现答案其实召回到了但排在中游被噪声挤下去那正是 rerank 的用武之地如果答案压根没被召回那要修的是召回不是精排。一句话总结向量召回快但糊bi-encoder 分开编码只能保召回、保不了精度rerank 用召回 精排两阶段破局——先用向量检索宽进捞出几十个候选再用 cross-encoder 把 query 和文档拼在一起逐词精算重排取最准的几条。规模交给召回精度交给精排各司其职这就是 rerank 重要且好用的原因。这里给大家精心整理了一份全面的AI大模型学习资源包括AI大模型全套学习路线图从入门到实战、精品AI大模型学习书籍手册、视频教程、实战学习、面试题等资料免费分享扫码免费领取全部内容1. 成长路线图学习规划要学习一门新的技术作为新手一定要先学习成长路线图方向不对努力白费。这里我们为新手和想要进一步提升的专业人士准备了一份详细的学习成长路线图和规划。可以说是最科学最系统的学习成长路线。2. 大模型经典PDF书籍书籍和学习文档资料是学习大模型过程中必不可少的我们精选了一系列深入探讨大模型技术的书籍和学习文档它们由领域内的顶尖专家撰写内容全面、深入、详尽为你学习大模型提供坚实的理论基础。书籍含电子版PDF3. 大模型视频教程对于很多自学或者没有基础的同学来说书籍这些纯文字类的学习教材会觉得比较晦涩难以理解因此我们提供了丰富的大模型视频教程以动态、形象的方式展示技术概念帮助你更快、更轻松地掌握核心知识。4. 2026行业报告行业分析主要包括对不同行业的现状、趋势、问题、机会等进行系统地调研和评估以了解哪些行业更适合引入大模型的技术和应用以及在哪些方面可以发挥大模型的优势。5. 大模型项目实战学以致用当你的理论知识积累到一定程度就需要通过项目实战在实际操作中检验和巩固你所学到的知识同时为你找工作和职业发展打下坚实的基础。6. 大模型面试题面试不仅是技术的较量更需要充分的准备。在你已经掌握了大模型技术之后就需要开始准备面试我们将提供精心整理的大模型面试题库涵盖当前面试中可能遇到的各种技术问题让你在面试中游刃有余。7. 资料领取全套内容免费抱走学 AI 不用再找第二份不管你是 0 基础想入门 AI 大模型还是有基础想冲刺大厂、了解行业趋势这份资料都能满足你现在只需按照提示操作就能免费领取扫码免费领取全部内容