Alignment faking in large language modelshttps://www.anthropic.com/research/alignment-faking by adultorata • 2 years ago 302 353 2 years agoANanthropic.com