Interview: 'when should you use a VAE vs GAN vs diffusion for generation?'
hardAnswer
- (1) VAE: fast, latent space useful for interpolation + representation, but blurry samples.
- Best when interpretable latent matters (drug design, molecule generation).
- (2) GAN: sharp samples, fast inference, but training unstable + mode collapse.
- Best for face generation, image editing (StyleGAN).
- (3) Diffusion: SOTA quality, controllable, but slow sampling (50-1000 steps → mitigated by DDIM, distillation, Flow Matching).
- Best default for images / video / audio generation in 2024+.
Check yourself — multiple choice
- Same
- VAE: latent useful, blurry samples (drug design); GAN: sharp but unstable (faces, StyleGAN); Diffusion: SOTA quality + controllable, slow → default for images/video 2024+
- Random
- Only GAN
Gen models: VAE latent / GAN sharp / Diffusion SOTA default; pick by need.
#interview#representation-learning#deep-learning
Practise Unsupervised Learning
214 interview questions in this topic.