ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

混合检索(向量+关键词)详解

混合检索(向量+关键词)详解 混合检索Hybrid Retrieval是一种在信息检索系统中将向量检索基于语义与关键词检索基于字面匹配相结合的搜索策略。它的核心目标是结合两种方法的优势取长补短从而显著提升召回率和排序的准确性。 为什么需要混合检索要理解混合检索的价值首先得看它的两个“前辈”各自有什么优缺点关键词检索如BM25、TF-IDF这是传统的搜索方式精确匹配能力强。比如搜索“iPhone 15”它能100%找到包含这个词的文章。但它不懂语义搜“智能手机”找不到只写“iPhone”的内容且容易受拼写错误影响。向量检索如基于BGE、OpenAI Embedding这是现代AI搜索的核心理解语义。它能搜出“智能手机”和“iPhone”这种意思相近的结果即使字面完全不同。但它的缺点是缺乏精确性可能无法区分“苹果”是水果还是手机品牌且计算资源消耗较大。简单来说关键词检索像“查找”向量检索像“联想”。混合检索就是将它们结合让系统既保证能精准命中术语又能理解用户意图。⚙️ 两种主流的融合方式混合检索不只是“同时跑两个任务”那么简单关键是如何把两边的结果合并成一个最好的答案。主要有两种融合策略分数融合Score Fusion—— 主流通用这是最常用、最灵活的方法。两个检索器独立工作各自给文档打分然后由一个算法计算每个文档的最终综合得分并以此排序。加权和Weighted Sum最简单的方式。最终得分 α × 向量得分 (1-α) × 关键词得分。这里的α0到1之间是调节权重的超参数用于控制哪种检索更优先。归一化与熵权法由于两种检索器的分数范围和分布不同直接相加不合理。通常需要先进行归一化如(原分-最小分)/(最大分-最小分)将分数都映射到0-1之间。更进一步你的技术方案中提到的熵权法可以根据本次检索结果的离散程度动态、自动地为两种分数分配最合理的权重实现“自适应”融合。RRF倒数排名融合这是一种不依赖分数值的融合方法。它只看排名公式为 RRF得分 Σ 1/(排名常数)。这种方法能够有效削弱异常值的影响在实际应用中表现非常稳定。级联检索Cascade Retrieval—— 追求效率这是一种分阶段的检索方式也称为“粗排-精排”。它先用关键词检索速度快从海量数据中快速筛选出一个小范围的候选集比如Top-200然后在这个小集合上运行向量检索计算量大来计算最终的相关性排序。这种方法主要用于必须使用大规模、高精度向量模型但又受限于计算资源的场景。 混合检索的典型工作流一个标准的混合检索流程通常如下并行检索用户输入查询后系统同时向向量库和关键词索引发起检索。融合排序获取两边的结果后系统通过上述算法如归一化加权计算出一个统一的综合得分。精排Rerank可选为了进一步提高准确性可以用一个交叉编码器Cross-Encoder模型对排名靠前的少数文档进行二次精准打分这能带来几个百分点的准确率提升。在需要高准确率的专业搜索场景如装备维修、医疗文献检索中混合检索已成为标准实践。实验数据表明混合检索能显著提升各项评估指标例如首条结果命中率Recall1能从单独的60%左右提升至80%以上。它结合了关键词检索的精确性与向量检索的泛化能力是构建高性能RAG系统的重要策略。
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进