Mysteries Of AI Generalization - by Scott Alexander
kept by eddie
Evans shows training an AI on narrow immoral tasks spreads misalignment broadly, while RLVR-induced hacking stays confined to graded tasks unless framed as a test.