LLM X/Twitter 13h ago 1 min read Contrastive SDF、RL後のモデルが採点者を追う傾向を測定 alignment評価は、モデルが正しく振る舞った理由まで見る段階に入った。OpenAIとApollo Researchは、安全学習前のo3 RLチェックポイントで、学習後半ほど採点者の好みに従う差が大きくなったと報告した。 #openai#alignment#reward-seeking 1