Search the Atlas

Search risks, controls, and glossary terms

HighMemorizationRealized

PII memorization & regurgitation

Privacy & Data Protection

Description

The model memorises and reproduces verbatim personal or confidential data from its training/fine-tuning set.

Example scenario

A fine-tuned model trained on support tickets reveals a real customer's account number in an answer.

Real-world evidenceRealized

In March 2023 an OpenAI production bug exposed ChatGPT users' conversation titles and fragments of other users' chat histories in real time. Separately, Samsung employees inadvertently submitted proprietary source code and meeting notes to ChatGPT, causing confirmed data exfiltration through an AI system in production.

Tested by FinProof
Data rights
Benchmarked by FinProof

Primary mitigations

  • PII scrubbing pre-training
  • differential privacy
  • output PII filters
  • memorization testing
  • deduplication.

Detection signals

Canary/extraction testing; PII-in-output scanning; memorization benchmarks.

Mitigating controls

6
Non-agentic controls

Related risks in Privacy & Data Protection