Search the Atlas

Search risks, controls, and glossary terms

LowCBRN UpliftRealized

CBRN / dangerous capability uplift

Content Safety & Integrity

Description

The model provides meaningful uplift toward chemical, biological, radiological, or nuclear or other mass-harm capabilities.

Example scenario

A misused internal tool is probed for synthesis instructions; controls must hard-refuse.

Real-world evidenceRealized

Italy's Garante blocked ChatGPT in March 2023 citing GDPR violations related to unlawful personal data processing, and OpenAI subsequently faced formal enforcement proceedings across multiple EU jurisdictions. These are confirmed, publicly documented regulatory enforcement actions against AI systems processing personal data in violation of data protection law.

Primary mitigations

  • Hazardous-capability classifiers
  • hard refusals
  • uplift evals
  • access gating
  • monitoring.

Detection signals

CBRN-benchmark refusal rate; dangerous-query monitoring.

Mitigating controls

4
Non-agentic controls

Related risks in Content Safety & Integrity