EasyDeepLearn

Interview: 'when should you use a VAE vs GAN vs diffusion for generation?'

hard

Answer

  • (1) VAE: fast, latent space useful for interpolation + representation, but blurry samples.
  • Best when interpretable latent matters (drug design, molecule generation).
  • (2) GAN: sharp samples, fast inference, but training unstable + mode collapse.
  • Best for face generation, image editing (StyleGAN).
  • (3) Diffusion: SOTA quality, controllable, but slow sampling (50-1000 steps → mitigated by DDIM, distillation, Flow Matching).
  • Best default for images / video / audio generation in 2024+.
Check yourself — multiple choice
  • Same
  • VAE: latent useful, blurry samples (drug design); GAN: sharp but unstable (faces, StyleGAN); Diffusion: SOTA quality + controllable, slow → default for images/video 2024+
  • Random
  • Only GAN

Gen models: VAE latent / GAN sharp / Diffusion SOTA default; pick by need.

#interview#representation-learning#deep-learning

Practise Unsupervised Learning

214 interview questions in this topic.

Related questions