EasyDeepLearn

Why use hybrid search (dense + sparse) in RAG?

medium

Answer

  • Dense (vector) captures semantic similarity but weak on rare terms, jargon, exact IDs.
  • Sparse (BM25 / TF-IDF) captures lexical match, exact phrase.
  • Hybrid = weighted sum / RRF (Reciprocal Rank Fusion).
  • Common: retrieve top-K from each, re-rank via cross-encoder.
  • Consistently beats pure dense by 5-15% on real corpora (BEIR benchmark).
  • Modern stack: OpenSearch / Weaviate / Vespa native hybrid; or pgvector + tsvector custom.
Check yourself — multiple choice
  • Just dense
  • Dense: semantic; Sparse (BM25/TF-IDF): lexical + exact + rare + jargon; hybrid via weighted sum / RRF + cross-encoder rerank; beats pure dense by 5-15% on BEIR; OpenSearch/Weaviate/Vespa native
  • Random
  • Not real

Hybrid: dense (semantic) + sparse (lexical) + RRF + rerank; +5-15%.

#llmops

Practise MLOps & Data Quality

215 interview questions in this topic.

Related questions