EasyDeepLearn

Interview: 'design exploration for a recommendation system.'

hard

Answer

  • (1) Warm-start with content-based recommendations for cold start.
  • (2) Contextual bandit with Thompson sampling: Beta posteriors on CTR give principled exploration.
  • (3) Epsilon-greedy on tail items for coverage.
  • (4) Diversify via MMR / determinantal point processes to expose users to variety.
  • (5) Off-policy correction: log propensity scores, use IPS or doubly-robust estimators.
  • (6) Bandit for retrieval + supervised for ranking (industry pattern).
  • Monitor exploration cost via holdouts.
Check yourself — multiple choice
  • Random
  • Content-based cold-start + contextual bandit + Thompson sampling / ε-greedy on tail + MMR diversity + IPS/DR off-policy correction + monitor exploration cost via holdouts
  • Just greedy
  • Not real

Recsys exploration: bandit Thompson + tail ε + MMR + IPS + holdout monitoring.

#interview#applications

Practise Reinforcement Learning

214 interview questions in this topic.

Related questions