How do you choose an embedding model?
mediumAnswer
- (1) MTEB leaderboard benchmark.
- (2) Task fit: retrieval / clustering / classification differ.
- (3) Dimension: 768 / 1024 / 1536 / 3072 — bigger = better + more storage.
- (4) Language: multilingual (mE5, BGE-M3) if needed.
- (5) Cost: OpenAI ada-3 SaaS vs OSS (BGE, Voyage).
- (6) Fine-tune on domain data for +10-20% gains.
- (7) License.
- Modern top: OpenAI text-embedding-3-large, Voyage-3, BGE-M3, Nomic-embed, Cohere-v3.
- Evaluate on your own retrieval benchmark.
Check yourself — multiple choice
- Just one
- MTEB benchmark + task fit + dimension (768-3072) + language multilingual + cost SaaS vs OSS + fine-tune domain (+10-20%) + license; top: text-embedding-3-large / Voyage-3 / BGE-M3 / Nomic; eval on own bench
- Random
- Not real
Embedding choice: MTEB + task + dim + lang + cost + fine-tune + own bench.
#llmops
Practise MLOps & Data Quality
215 interview questions in this topic.