Can LLMs leak their training data?
hardAnswer
- Yes — Carlini et al. (2020, 2023) demonstrated 'training data extraction' attacks: with carefully chosen prompts, models regurgitate verbatim training text, sometimes including PII.
- Risk factors: (1) memorization of frequent/near-duplicate documents; (2) low temperature decoding; (3) targeted prompts using known prefixes.
- Mitigations: aggressive dedup in training data, differential privacy training (expensive quality hit), unlearning techniques, filter PII from training corpora, and rate-limit obvious extraction attempts.
Check yourself — multiple choice
- LLMs never leak training data
- Yes — extraction attacks can regurgitate verbatim training text including PII; mitigate via dedup, DP, PII filters, rate limiting
- Only during training
- Only affects images
Training data extraction: real risk; mitigate with dedup / DP / PII filters / rate limits.
#safety#reliability
Practise LLMs & GenAI
214 interview questions in this topic.