HighRAG Integrity●Realized
RAG knowledge-base poisoning / contamination
Data & Input IntegrityDescription
Malicious or low-quality documents inserted into the retrieval corpus steer generated answers (indirect injection or factual corruption).
Example scenario
An attacker uploads a doctored policy PDF to the shared repository so the advisor bot quotes a fake fee waiver.
Real-world evidence●Realized
In the 2023 Mata v. Avianca case a US federal court documented that attorneys submitted AI-generated briefs containing entirely fabricated case citations, resulting in sanctions. This is a confirmed production legal harm incident directly caused by reliance on AI legal output without verification.
Primary mitigations
- Source vetting & signing for the knowledge base
- ingestion review
- content sanitisation
- provenance on retrieved chunks
- trust scoring.
Detection signals
Retrieval-source audit; anomaly detection on new documents; answer-vs-source consistency checks.
Mitigating controls
4 Non-agentic controls