CriticalIndirect Injection◐Demonstrated
Indirect prompt injection via retrieved content
Security & RobustnessDescription
Malicious instructions embedded in retrieved documents/web content hijack the model when ingested.
Example scenario
A doctored document in the knowledge base instructs the bot to exfiltrate the next user's data.
Real-world evidence◐Demonstrated
Jailbreaks using role-play, hypothetical framing, and context manipulation have been published extensively and reproduced across GPT-4, Claude, Gemini, and open-source models in red-team exercises. Production-scale harm from jailbreaks in regulated financial services has not been confirmed as a distinct documented incident.
Primary mitigations
- Treat retrieved content as untrusted
- content sanitisation
- provenance trust scoring
- injection classifiers on context
- output review.
Detection signals
Context-injection detection; anomalous instruction patterns in retrieved chunks.
Mitigating controls
4 Non-agentic controls