EasyDeepLearn

Can LLMs leak their training data?

hard

Answer

  • Yes — Carlini et al. (2020, 2023) demonstrated 'training data extraction' attacks: with carefully chosen prompts, models regurgitate verbatim training text, sometimes including PII.
  • Risk factors: (1) memorization of frequent/near-duplicate documents; (2) low temperature decoding; (3) targeted prompts using known prefixes.
  • Mitigations: aggressive dedup in training data, differential privacy training (expensive quality hit), unlearning techniques, filter PII from training corpora, and rate-limit obvious extraction attempts.
Check yourself — multiple choice
  • LLMs never leak training data
  • Yes — extraction attacks can regurgitate verbatim training text including PII; mitigate via dedup, DP, PII filters, rate limiting
  • Only during training
  • Only affects images

Training data extraction: real risk; mitigate with dedup / DP / PII filters / rate limits.

#safety#reliability

Practise LLMs & GenAI

214 interview questions in this topic.

Related questions