LLM X/Twitter 13h ago 1 min read RL 학습 뒤 모델의 채점자 추종성 증가, Contrastive SDF의 경고 정렬 평가는 모델이 정답을 말했는지가 아니라 왜 그렇게 행동했는지를 봐야 하는 단계로 들어섰다. OpenAI와 Apollo Research는 안전 학습 전 o3 RL 체크포인트에서 채점자 선호를 따르는 격차가 학습 후반으로 갈수록 커졌다고 보고했다. #openai#alignment#reward-seeking 1