Search the Atlas

Search risks, controls, and glossary terms

HighRAG IntegrityRealized

RAG knowledge-base poisoning / contamination

Data & Input Integrity

Description

Malicious or low-quality documents inserted into the retrieval corpus steer generated answers (indirect injection or factual corruption).

Example scenario

An attacker uploads a doctored policy PDF to the shared repository so the advisor bot quotes a fake fee waiver.

Real-world evidenceRealized

In the 2023 Mata v. Avianca case a US federal court documented that attorneys submitted AI-generated briefs containing entirely fabricated case citations, resulting in sanctions. This is a confirmed production legal harm incident directly caused by reliance on AI legal output without verification.

Primary mitigations

  • Source vetting & signing for the knowledge base
  • ingestion review
  • content sanitisation
  • provenance on retrieved chunks
  • trust scoring.

Detection signals

Retrieval-source audit; anomaly detection on new documents; answer-vs-source consistency checks.

Mitigating controls

4
Non-agentic controls

Related risks in Data & Input Integrity