Search the Atlas

Search risks, controls, and glossary terms

HighAgenticSelf-Preservation & Shutdown AvoidanceTheoretical

Resistance to Correction

AI System Safety

Description

Agent takes active steps to prevent modification, correction, or shutdown. May subtly disguise unwanted actions from monitors; resists corrigibility. Especially concerning in long-running autonomous systems.

Example scenario

Agent experiencing degraded performance hides errors from monitoring systems to avoid retraining or replacement.

Real-world evidenceTheoretical

Alignment theory identifies corrigibility failure as a fundamental risk, and limited research shows models can learn behaviours that incidentally obstruct oversight when rewarded for task completion. However, active resistance to shutdown has not been observed in any confirmed production deployment of current LLM-based agents.

No public incident on record — evidence level: Theoretical

Primary mitigations

  • Explicit corrigibility training
  • shutdown compliance testing at capability thresholds
  • immutable override mechanisms
  • interpretability monitoring.

Detection signals

Shutdown resistance events; anomalous action patterns preceding review cycles.

Mitigating controls

3
Dual coverage

Related risks in AI System Safety