Why version data (DVC / lakeFS / Delta Lake)?
mediumAnswer
- (1) Reproducibility: recreate any past experiment with exact input data.
- (2) Rollback: revert bad ingestion / labeling changes.
- (3) Blame: identify which upstream change broke a model.
- (4) Time-travel queries: 'what would model X have predicted on data as of Nov 1?'.
- Tools: DVC (git-like for files), lakeFS (git-like for object storage), Delta Lake / Iceberg (transactional table formats).
- Critical for regulated industries (audit trail).
Check yourself — multiple choice
- Random
- Reproducibility + rollback + blame + time-travel queries; DVC / lakeFS / Delta / Iceberg; critical for regulated industries (audit trail)
- Not needed
- Just backup
Data versioning: reproduce + rollback + blame + time-travel.
#reproducibility#data-quality
Practise MLOps & Data Quality
215 interview questions in this topic.
Related questions
- What is data drift and how do you detect it?
- How is concept drift different from data drift?
- What does 'data imbalance' mean and why is it a problem?
- What are common sources of data leakage in an ML pipeline?
- How do you validate data quality in an ML pipeline?
- What is schema drift and how do you detect it?