EasyDeepLearn

How do you respond to a production ML incident?

medium

Answer

  • (1) Alert fires → on-call paged.
  • (2) Assess severity: user impact, revenue, safety.
  • (3) Mitigate first: rollback / disable model / fallback to simpler model.
  • (4) Root cause after: which change (code / data / traffic) triggered?
  • (5) Communicate to stakeholders.
  • (6) Post-mortem: timeline, contributing factors, action items.
  • (7) Prevent: automated test, monitor, or process change.
  • Rule: mitigate before diagnosing; don't debug live prod.
  • Blameless post-mortem.
Check yourself — multiple choice
  • Random
  • Alert → page → assess severity → mitigate first (rollback/fallback) → RCA after → communicate → post-mortem (blameless) → prevent via test/monitor/process; mitigate before debug
  • Just debug
  • Not real

Incident: mitigate first + RCA + post-mortem + prevention.

#monitoring#deployment

Practise MLOps & Data Quality

215 interview questions in this topic.

Related questions