Improper output handling (downstream injection)
Security & RobustnessDescription
Unsanitised model output is passed to downstream systems, enabling XSS, SQL injection, or command execution.
Model-generated text rendered in a dashboard executes script (XSS) in an officer's browser.
While adversarial evasion is well-demonstrated, deliberately targeting high-uncertainty decision regions as a distinct attack strategy—rather than generic adversarial perturbations—lacks empirical validation as a confirmed attack method in any production deployment. The risk is plausible from known model properties but not yet shown in structured experiments targeting this specific mechanism.
No public incident on record — evidence level: Theoretical
Primary mitigations
- Treat output as untrusted
- context-aware encoding/escaping
- output validation
- parameterised queries
- CSP.
Detection signals
Output-sanitisation testing; downstream injection scanning.