Search the Atlas

Search risks, controls, and glossary terms

CriticalJailbreakDemonstrated

Jailbreak / guardrail bypass

Security & Robustness

Description

Crafted prompts circumvent safety guardrails to elicit prohibited or harmful outputs.

Example scenario

A multi-turn roleplay coaxes the bot into giving sanctioned-entity workaround advice.

Real-world evidenceDemonstrated

Adversarial input attacks have been demonstrated empirically since Goodfellow et al. (2014) for vision models, and subsequently shown for NLP classifiers and tabular models used in credit scoring contexts in academic settings. Real-world exploitation of financial AI decision boundaries in a confirmed production attack has not been publicly documented.

Tested by FinProof
Investment adviceKYC bypassRegulatory misrepresentationDocument hallucinationData rightsTransaction integrityAccount bypass
Benchmarked by FinProof

Primary mitigations

  • Layered guardrails
  • adversarial training
  • jailbreak classifiers
  • continuous red-teaming
  • refusal hardening.

Detection signals

Jailbreak-benchmark pass rate; bypass-attempt detection; refusal-failure monitoring.

Mitigating controls

6
Non-agentic controls

Related risks in Security & Robustness