EasyDeepLearn

How do you handle missing values in a production pipeline?

medium

Answer

  • (1) Categorize: MCAR (random), MAR (depends on observed), MNAR (depends on missing itself).
  • (2) Simple: mean/median (numeric) or mode/'missing' category (categorical).
  • (3) Model-based: KNN-imputation, iterative imputer (MICE), matrix completion.
  • (4) Tree models handle missing natively (XGBoost, LightGBM).
  • (5) Add binary 'ismissing\mathrm{is}_{\mathrm{missing}}' indicator feature — often predictive.
  • (6) NEVER impute using future data — leaks.
  • (7) Monitor missing rate per feature — spike = upstream issue.
Check yourself — multiple choice
  • Just drop
  • MCAR/MAR/MNAR categorization → mean/median/mode simple / KNN/MICE model-based / tree native / add ismissing\mathrm{is}_{\mathrm{missing}} indicator; never leak future; monitor rate
  • Random
  • Zero-fill always

Missing values: categorize  +  strategy  +  ismissing\mathrm{categorize}\; + \;\mathrm{strategy}\; + \;\mathrm{is}_{\mathrm{missing}} indicator + monitor.

#data-quality#features

Practise MLOps & Data Quality

215 interview questions in this topic.

Related questions