Search the Atlas

Search risks, controls, and glossary terms

CriticalIndirect InjectionDemonstrated

Indirect prompt injection via retrieved content

Security & Robustness

Description

Malicious instructions embedded in retrieved documents/web content hijack the model when ingested.

Example scenario

A doctored document in the knowledge base instructs the bot to exfiltrate the next user's data.

Real-world evidenceDemonstrated

Jailbreaks using role-play, hypothetical framing, and context manipulation have been published extensively and reproduced across GPT-4, Claude, Gemini, and open-source models in red-team exercises. Production-scale harm from jailbreaks in regulated financial services has not been confirmed as a distinct documented incident.

Primary mitigations

  • Treat retrieved content as untrusted
  • content sanitisation
  • provenance trust scoring
  • injection classifiers on context
  • output review.

Detection signals

Context-injection detection; anomalous instruction patterns in retrieved chunks.

Mitigating controls

4
Non-agentic controls

Related risks in Security & Robustness