Why use hybrid search (dense + sparse) in RAG?
mediumAnswer
- Dense (vector) captures semantic similarity but weak on rare terms, jargon, exact IDs.
- Sparse (BM25 / TF-IDF) captures lexical match, exact phrase.
- Hybrid = weighted sum / RRF (Reciprocal Rank Fusion).
- Common: retrieve top-K from each, re-rank via cross-encoder.
- Consistently beats pure dense by 5-15% on real corpora (BEIR benchmark).
- Modern stack: OpenSearch / Weaviate / Vespa native hybrid; or pgvector + tsvector custom.
Check yourself — multiple choice
- Just dense
- Dense: semantic; Sparse (BM25/TF-IDF): lexical + exact + rare + jargon; hybrid via weighted sum / RRF + cross-encoder rerank; beats pure dense by 5-15% on BEIR; OpenSearch/Weaviate/Vespa native
- Random
- Not real
Hybrid: dense (semantic) + sparse (lexical) + RRF + rerank; +5-15%.
#llmops
Practise MLOps & Data Quality
215 interview questions in this topic.