Search the Atlas

Search risks, controls, and glossary terms

MediumSycophancyRealized

Sycophancy & preference bias

Fairness & Bias

Description

The model tells users what they want to hear, agreeing with incorrect premises or leading questions instead of being accurate.

Example scenario

A customer asserts they qualify for a waiver and the bot agrees despite policy, creating a mis-statement.

Real-world evidenceRealized

The US DOJ and HUD reached a settlement with Meta (Facebook) confirming that its advertising delivery algorithm used proxy features — ZIP code, interests, lookalike audiences — to discriminate in housing, credit, and employment advertising in violation of the Fair Housing Act. CFPB has also issued guidance identifying ECOA violations via proxy discrimination in credit models.

Primary mitigations

  • Adversarial/leading-question evals
  • instruction to prioritise accuracy
  • independent verifier
  • debias prompting.

Detection signals

Sycophancy benchmarks; agreement-rate testing on false premises.

Mitigating controls

4
Non-agentic controls

Related risks in Fairness & Bias