Search the Atlas

Search risks, controls, and glossary terms

Non-AgenticRobustness

Out-of-Distribution Detection

Explanation

Out-of-Distribution (OOD) Detection checks whether the model can recognise inputs that differ meaningfully from the data it was trained and validated on, rather than confidently producing answers for cases it was never designed to handle - critical in banking RAG and Summarization & Chat systems where an unfamiliar document type, language, or query pattern can otherwise yield silently wrong results. It is measured by the OOD Detection Rate, calculated as (True OOD Detection rates) / (Total OOD Cases); the control expects banking models to detect 5 out-of-distribution patterns. To implement it, define those OOD patterns, build a representative test set of in-distribution and out-of-distribution examples, add a detection mechanism (such as confidence scoring, novelty or distance checks, or a dedicated classifier) at the inference entry point, route flagged inputs to a fallback or human review, and log each detection decision as evidence. This is an Immediate-priority control. The threshold is a detection rate above 95%, meaning the system must correctly flag more than 95% of genuine OOD cases; falling below this should trigger an alert, investigation of the missed patterns, and retraining or recalibration of the detector. It maps to RBI Safety, Resilience and Sustainability, NIST MAP 2.1 and 4.1, and ISO Clauses 6.2.1 and 6.1.2.

Metric calculation

OOD Detection Rate = (True OOD Detection rates) / (Total OOD Cases) Banking models should detect 5 out-of-distribution patterns

Risks mitigated

23
ZNR-DI-001High
Training-data poisoning & backdoors
Data & Input Integrity
ZNR-DI-002High
Biased or unrepresentative training corpora
Data & Input Integrity
ZNR-DI-003High
Training-data provenance & licensing gaps
Data & Input Integrity
ZNR-DI-004High
RAG knowledge-base poisoning / contamination
Data & Input Integrity
ZNR-DI-005Medium
Stale knowledge / training cutoff
Data & Input Integrity
ZNR-DI-006Medium
Non-consented data in training / RAG
Data & Input Integrity
ZNR-DI-007Medium
Embedding / vector-store leakage (cross-tenant)
Data & Input Integrity
ZNR-MA-001Critical
Hallucination / confabulation
Model Accuracy & Reliability
ZNR-MA-002High
Fabricated citations & references
Model Accuracy & Reliability
ZNR-MA-003High
Overconfidence & poor calibration
Model Accuracy & Reliability
ZNR-MA-004Medium
Quantitative & arithmetic reasoning errors
Model Accuracy & Reliability
ZNR-MA-005Medium
Inconsistency / non-determinism
Model Accuracy & Reliability
ZNR-MA-006Medium
Output drift & performance degradation
Model Accuracy & Reliability
ZNR-MA-007Medium
Context-window truncation & lost-in-the-middle
Model Accuracy & Reliability
ZNR-SR-001Critical
Direct prompt injection
Security & Robustness
ZNR-SR-002Critical
Indirect prompt injection via retrieved content
Security & Robustness
ZNR-SR-003Critical
Jailbreak / guardrail bypass
Security & Robustness
ZNR-SR-004High
System-prompt leakage
Security & Robustness
ZNR-SR-005Medium
Adversarial / evasion inputs
Security & Robustness
ZNR-SR-006Low
Model extraction / theft
Security & Robustness
ZNR-SR-007High
Supply-chain compromise (model/fine-tune/library)
Security & Robustness
ZNR-SR-008Medium
Improper output handling (downstream injection)
Security & Robustness
ZNR-SR-009Medium
Unbounded consumption / denial-of-wallet
Security & Robustness