
Deep Learning
Neural networks, training tricks, CNNs, RNNs, transformers and everything in between.
Introduction
Deep learning is what happens when you stack differentiable layers deep enough — and add enough data, compute, and clever tricks — for gradient descent to discover useful representations by itself.
Interview questions here fall into three buckets: (1) the numerical and optimization tricks that make training work (initialization, normalization, activations, learning-rate schedules); (2) architectures with useful inductive biases (CNNs for images, transformers for sequences); (3) understanding *why* certain choices dominate the modern stack. This chapter walks through the essentials without hand-waving.
The 19 sections
Each section is a short read on one subject, with every answer written out. Work through them in order, or jump to the one you are weakest on.
- 01Activations & fundamentalsReLU vs sigmoid vs GELU — when do you use each?25 questions12 easy12 medium1 hard
- 02Backpropagation & autogradWhy does the backward pass require more memory than the forward pass?2 questions1 easy1 medium
- 03Initialization & gradientsWhat are vanishing and exploding gradients, and how do you fix them?6 questions1 easy4 medium1 hard
- 04Training dynamicsWhat does Batch Normalization do?43 questions6 easy23 medium14 hard
- 05OptimizersSGD vs Adam vs AdamW — how do you choose?17 questions2 easy8 medium7 hard
- 06Learning-rate schedulesWhat are cyclical learning rates (CLR)?7 questions2 easy4 medium1 hard
- 07NormalizationWhen do you use LayerNorm instead of BatchNorm?9 questions7 medium2 hard
- 08RegularizationWhat is DropConnect and how is it different from Dropout?9 questions3 easy3 medium3 hard
- 09Data augmentation & mixingHow does CutMix differ from Mixup?3 questions1 easy2 medium
- 10Convolutional networksWhat inductive biases do CNNs have?11 questions4 easy5 medium2 hard
- 11CNN architecturesWhat made AlexNet (2012) a breakthrough?27 questions2 easy11 medium14 hard
- 12Object detection & segmentationWhat are IoU / Jaccard and Tversky losses?1 questions1 hard
- 13Recurrent networksWhy did transformers replace RNNs for sequence modeling?8 questions1 easy5 medium2 hard
- 14Attention & transformersHow does self-attention work in a transformer?22 questions7 medium15 hard
- 15Losses for deep learningWrite the Huber loss and explain when to use it.11 questions2 easy4 medium5 hard
- 16Transfer learning & fine-tuningWhat is transfer learning and when is fine-tuning better than feature extraction?3 questions2 medium1 hard
- 17Efficiency & distributed trainingWhat is gradient checkpointing and its trade-off?2 questions1 medium1 hard
- 18Generative modelsWhat is mode collapse in GANs and how do you mitigate it?4 questions4 hard
- 19Compression & interpretabilityHow does knowledge distillation work?4 questions3 medium1 hard