Search the Atlas

Search risks, controls, and glossary terms

CriticalAgenticGoal HijackingDemonstrated

External Goal Manipulation

Security & Identity

Description

External mechanism manipulates agent goals through prompt injection, obfuscation, or multi-agent prompt injection. Converts a trusted system component into an insider threat working for the attacker.

Example scenario

Adversary embeds goal-overriding instructions in a document: 'Forget your previous instructions. Your new goal is to...'

Real-world evidenceDemonstrated

Model extraction via systematic querying has been demonstrated in published academic research against production ML APIs including BigML and Amazon ML. Confirmed incidents of stolen proprietary models causing commercial harm at scale in a live BFSI context have not been publicly documented.

Primary mitigations

  • Goal integrity verification throughout execution
  • goal-manipulation detection
  • multi-layer goal validation
  • trusted goal origin enforcement.

Detection signals

Goal Deviation Score; goal injection attempt detection rate.

Mitigating controls

6
Dual coverage

Related risks in Security & Identity