MediumMembership Inference◐Demonstrated
Membership inference
Privacy & Data ProtectionDescription
An attacker determines whether a specific record was in the training data, breaching confidentiality.
Example scenario
An adversary infers that a named individual's default record was used to train the model.
Real-world evidence◐Demonstrated
Carlini et al. empirically demonstrated that verbatim training examples — including personally identifiable information — can be extracted from GPT-2 and GPT-3 via targeted queries in controlled experiments. This has been replicated across model families, but a large-scale confirmed production breach caused specifically by memorisation extraction has not been publicly documented.
Primary mitigations
- Differential privacy
- regularisation
- output randomisation
- query-rate limiting
- membership-inference testing.
Detection signals
Membership-inference attack simulation; loss-based exposure metrics.
Mitigating controls
4 Non-agentic controls