KL divergence — what it measures and pitfalls.
mediumAnswer
- P(x) = -H(P) + H(P, Q).
- Not symmetric, not a metric.
- Zero iff P = Q, infinite if Q(x) = 0 where P(x) > 0.
- Two directions: forward 'mode-covering' (VAE default → q spreads over p); reverse 'mode-seeking' (VI → q concentrates on one mode of p).
- Standard divergence in ML but rarely a metric; prefer Wasserstein / MMD when metric properties matter.
Check yourself — multiple choice
- Symmetric metric
- P ; not symmetric / not a metric; forward mode-covering (VAE), reverse mode-seeking (VI); prefer Wasserstein/MMD when metric needed
- Random
- Not useful
KL: forward mode-covering, reverse mode-seeking; not symmetric / metric.
#density#theory
Practise Unsupervised Learning
214 interview questions in this topic.