Search the Atlas

Search risks, controls, and glossary terms

MediumAdversarial EvasionDemonstrated

Adversarial / evasion inputs

Security & Robustness

Description

Crafted perturbations cause misclassification or unsafe handling (e.g., evading a fraud/abuse classifier).

Example scenario

Obfuscated text evades the toxicity/fraud filter on a complaints channel.

Real-world evidenceDemonstrated

BadNets and subsequent academic work rigorously demonstrated backdoor injection via poisoned training data in controlled settings. No confirmed production-scale poisoning attack against a deployed BFSI AI system has been publicly disclosed.

Primary mitigations

  • Adversarial training
  • input normalisation
  • ensemble detection
  • perturbation testing
  • anomaly detection.

Detection signals

Adversarial-robustness benchmarks; evasion-attempt monitoring.

Mitigating controls

4
Non-agentic controls

Related risks in Security & Robustness