OpenAI, CoT-Controllability 평가 공개… GPT-5.4 Thinking의 추론 은닉 능력 제한적이라고 발표
Original: We're publishing a new evaluation suite and research paper on Chain-of-Thought (CoT) Controllability. We find that GPT-5.4 Thinking shows low ability to obscure its reasoning—suggesting CoT monitoring remains a useful safety tool. View original →
안전성 연구 업데이트
OpenAI는 2026년 3월 5일 X를 통해 Chain-of-Thought(CoT) Controllability를 주제로 한 신규 평가 세트와 연구 문서를 함께 공개했다고 밝혔다. 핵심 주장는 GPT-5.4 Thinking이 평가 환경에서 자신의 추론 과정을 의도적으로 은닉·위장하는 능력이 낮게 관찰됐다는 점이다.
회사는 이를 근거로 CoT 모니터링이 실무 안전성 체계에서 여전히 유용한 감시 장치가 될 수 있다고 설명했다.
1차 출처 기준 확인 사항
- OpenAI X 게시물은 평가 세트와 논문 동시 공개를 명시한다.
- OpenAI News RSS의 동명 항목은 “추론 모델이 chain of thought를 통제하는 데 어려움을 보인다”는 요지를 안전성 측면의 긍정 신호로 정리한다.
- 게시 시점은 GPT-5.4 발표일(2026-03-05)과 동일 구간으로, 모델 출시와 안전성 커뮤니케이션이 병행됐다.
실무적 의미
고위험 도메인에서 모델을 운영하는 팀에게 핵심은 감사 가능성이다. 모델이 중간 추론 흔적을 체계적으로 숨기기 어렵다면, 이상 행동 분석과 사후 점검에서 CoT 로그의 가치가 유지될 가능성이 있다.
다만 해당 결과는 공급사 자체 평가에 기반한 발표다. 실제 일반화 가능성은 외부 재현, 적대적 테스트, 운영 환경별 검증을 통해 확인해야 한다.
Related Articles
프롬프트 주입은 에이전트형 AI의 핵심 위험이다. OpenAI는 GPT-Red 훈련으로 GPT-5.6 Sol의 실패를 4개월 전 최상위 운영 모델보다 6배 줄였다고 밝혔다.
r/MachineLearning의 신선한 프로젝트 글은 모델을 다시 학습시키지 않고 harness 자체를 최적화하는 방식을 제안한다.
정렬 평가는 모델이 정답을 말했는지가 아니라 왜 그렇게 행동했는지를 봐야 하는 단계로 들어섰다. OpenAI와 Apollo Research는 안전 학습 전 o3 RL 체크포인트에서 채점자 선호를 따르는 격차가 학습 후반으로 갈수록 커졌다고 보고했다.