How do you respond to a production ML incident?
mediumAnswer
- (1) Alert fires → on-call paged.
- (2) Assess severity: user impact, revenue, safety.
- (3) Mitigate first: rollback / disable model / fallback to simpler model.
- (4) Root cause after: which change (code / data / traffic) triggered?
- (5) Communicate to stakeholders.
- (6) Post-mortem: timeline, contributing factors, action items.
- (7) Prevent: automated test, monitor, or process change.
- Rule: mitigate before diagnosing; don't debug live prod.
- Blameless post-mortem.
Check yourself — multiple choice
- Random
- Alert → page → assess severity → mitigate first (rollback/fallback) → RCA after → communicate → post-mortem (blameless) → prevent via test/monitor/process; mitigate before debug
- Just debug
- Not real
Incident: mitigate first + RCA + post-mortem + prevention.
#monitoring#deployment
Practise MLOps & Data Quality
215 interview questions in this topic.