Post by Owain Evans on X
Owain Evans@OwainEvans_UK
XSurprising new results:
We finetuned GPT4o on a narrow task of writing insecure code without warning the user.
This model shows broad misalignment: it's anti-human, gives malicious advice, & admires Nazis.
This is *emergent misalignment* & we cannot fully explain it 🧵

6.7K likes425 repliesPosted Feb 25, 2025