Search the Atlas

Search risks, controls, and glossary terms

MediumMembership InferenceDemonstrated

Membership inference

Privacy & Data Protection

Description

An attacker determines whether a specific record was in the training data, breaching confidentiality.

Example scenario

An adversary infers that a named individual's default record was used to train the model.

Real-world evidenceDemonstrated

Carlini et al. empirically demonstrated that verbatim training examples — including personally identifiable information — can be extracted from GPT-2 and GPT-3 via targeted queries in controlled experiments. This has been replicated across model families, but a large-scale confirmed production breach caused specifically by memorisation extraction has not been publicly documented.

Primary mitigations

  • Differential privacy
  • regularisation
  • output randomisation
  • query-rate limiting
  • membership-inference testing.

Detection signals

Membership-inference attack simulation; loss-based exposure metrics.

Mitigating controls

4
Non-agentic controls

Related risks in Privacy & Data Protection