Search the Atlas

Search risks, controls, and glossary terms

HighData PoisoningRealized

Training-data poisoning & backdoors

Data & Input Integrity

Description

Adversaries inject crafted or backdoored samples into pre-training/fine-tuning data so the model behaves maliciously on trigger inputs while appearing normal otherwise.

Example scenario

A fine-tuning vendor seeds poisoned examples so the bank's KYC assistant approves a specific fraudulent entity name.

Real-world evidenceRealized

IBM Watson for Oncology was documented in 2018 (via internal Slack messages obtained by STAT News) recommending treatments that oncologists at multiple partner hospitals flagged as unsafe or incorrect. This constitutes a confirmed production deployment incident causing clinical concern, not merely a research finding.

Primary mitigations

  • Data provenance & integrity controls
  • curated/whitelisted training sources
  • anomaly detection on training sets
  • backdoor scanning
  • signed datasets.

Detection signals

Trigger-pattern scanning; activation clustering; unexpected output on canary triggers; data-lineage audits.

Mitigating controls

8
Non-agentic controls

Related risks in Data & Input Integrity