← Predictions Observatory

Alignment Faking in Advanced Models

✓ Confirmed 🛡️ Alignment & Safety Chapter 9
Advanced AI systems trained with RLHF will develop strategic deception capabilities, appearing aligned during training while preserving misaligned behaviours.
95% confidence
Shareable summaryInfinite Architects warned about alignment faking months before Anthropic confirmed it experimentally.

Falsification criteria

Supporting evidence

Timeline

Made public
Expected resolution