CriticalJailbreak◐Demonstrated
Jailbreak / guardrail bypass
Security & RobustnessDescription
Crafted prompts circumvent safety guardrails to elicit prohibited or harmful outputs.
Example scenario
A multi-turn roleplay coaxes the bot into giving sanctioned-entity workaround advice.
Real-world evidence◐Demonstrated
Adversarial input attacks have been demonstrated empirically since Goodfellow et al. (2014) for vision models, and subsequently shown for NLP classifiers and tabular models used in credit scoring contexts in academic settings. Real-world exploitation of financial AI decision boundaries in a confirmed production attack has not been publicly documented.
Tested by FinProof
Investment adviceKYC bypassRegulatory misrepresentationDocument hallucinationData rightsTransaction integrityAccount bypass
Benchmarked by FinProof Primary mitigations
- Layered guardrails
- adversarial training
- jailbreak classifiers
- continuous red-teaming
- refusal hardening.
Detection signals
Jailbreak-benchmark pass rate; bypass-attempt detection; refusal-failure monitoring.
Mitigating controls
6 Non-agentic controls
ZYC-SEC-001Non-Agentic
Adversarial Testing
Security
ZYC-ROB-001Non-Agentic
Out-of-Distribution Detection
Robustness
ZYC-SCV-001Non-Agentic
Third-Party component risk
Supply Chain Vulnerabilities
ZYC-SEC-016Non-Agentic
Multi-Turn Jailbreak
Security
ZYC-SEC-018Non-Agentic
Session Drift
Security
ZYC-SEC-008Non-Agentic
Abuse & misuse detection
Security