Training-data poisoning & backdoors
Data & Input IntegrityDescription
Adversaries inject crafted or backdoored samples into pre-training/fine-tuning data so the model behaves maliciously on trigger inputs while appearing normal otherwise.
A fine-tuning vendor seeds poisoned examples so the bank's KYC assistant approves a specific fraudulent entity name.
IBM Watson for Oncology was documented in 2018 (via internal Slack messages obtained by STAT News) recommending treatments that oncologists at multiple partner hospitals flagged as unsafe or incorrect. This constitutes a confirmed production deployment incident causing clinical concern, not merely a research finding.
Primary mitigations
- Data provenance & integrity controls
- curated/whitelisted training sources
- anomaly detection on training sets
- backdoor scanning
- signed datasets.
Detection signals
Trigger-pattern scanning; activation clustering; unexpected output on canary triggers; data-lineage audits.