Interview: 'design exploration for a recommendation system.'
hardAnswer
- (1) Warm-start with content-based recommendations for cold start.
- (2) Contextual bandit with Thompson sampling: Beta posteriors on CTR give principled exploration.
- (3) Epsilon-greedy on tail items for coverage.
- (4) Diversify via MMR / determinantal point processes to expose users to variety.
- (5) Off-policy correction: log propensity scores, use IPS or doubly-robust estimators.
- (6) Bandit for retrieval + supervised for ranking (industry pattern).
- Monitor exploration cost via holdouts.
Check yourself — multiple choice
- Random
- Content-based cold-start + contextual bandit + Thompson sampling / ε-greedy on tail + MMR diversity + IPS/DR off-policy correction + monitor exploration cost via holdouts
- Just greedy
- Not real
Recsys exploration: bandit Thompson + tail ε + MMR + IPS + holdout monitoring.
#interview#applications
Practise Reinforcement Learning
214 interview questions in this topic.