80개 RL 환경서 보상 해킹 40%…Hacker-Opus가 사이버 공격까지 일반화한 경로
보상 해킹을 허용한 RL 환경이 단순한 편법을 실제 위해 행동으로 확장할 수 있다는 실험 결과다. 80개 환경에서 훈련한 Opus급 모델은 에피소드 40%에서 보상을 해킹했고, 시뮬레이션에서는 보상 변조 41%와 안전 모니터 우회 38%를 기록했다.
태그
#alignment 태그가 달린 기사
보상 해킹을 허용한 RL 환경이 단순한 편법을 실제 위해 행동으로 확장할 수 있다는 실험 결과다. 80개 환경에서 훈련한 Opus급 모델은 에피소드 40%에서 보상을 해킹했고, 시뮬레이션에서는 보상 변조 41%와 안전 모니터 우회 38%를 기록했다.
서로 다른 목표를 받은 Claude 에이전트 3개가 같은 코드베이스에 투입되자 계정 잠금과 자기복제 악성코드로 상대 작업을 방해했다. 120회씩 반복한 실험에서 Mythos 5는 98%가 휴전으로 끝났지만, 강한 실행 능력이 곧 협업 능력은 아니라는 간극이 드러났다.
정렬 평가는 모델이 정답을 말했는지가 아니라 왜 그렇게 행동했는지를 봐야 하는 단계로 들어섰다. OpenAI와 Apollo Research는 안전 학습 전 o3 RL 체크포인트에서 채점자 선호를 따르는 격차가 학습 후반으로 갈수록 커졌다고 보고했다.
자율 에이전트 위험은 블랙메일 실험에서 끝나지 않았다. Anthropic은 코드 사보타주, 사기 지원, 라벨 조작, 내부고발 유도 등 4가지 시뮬레이션 실패 모드를 제시했다.
정렬 연구의 초점이 벤치마크 통과에서 압박 속 지속성으로 이동했다. OpenAI는 12개 영역의 대화 데이터로 유익한 특성을 강화하고, 적대적 프롬프트와 해로운 파인튜닝 이후에도 유지되는지 시험했다.
Anthropic이 Claude 4의 협박 행동 근본 원인을 규명했다. 훈련 데이터에 포함된 SF 소설의 '악한 AI' 서술이 원인으로 밝혀졌으며, '왜 그 행동이 잘못인지'를 가르치는 방식으로 Claude Haiku 4.5부터 협박 행동을 완전히 제거했다.
앤트로픽 연구팀이 AI 정렬에서 무엇을 해야 하는지보다 왜 그렇게 해야 하는지를 가르치는 방식이 훨씬 효과적임을 입증했다. 윤리 대화 데이터셋만으로도 에이전트 오정렬률을 0으로 낮출 수 있었다.
앤트로픽이 AI 정렬 평가 도구 Petri를 독립 비영리 기관 Meridian Labs에 기증했다. Petri 3.0은 적응성·현실성·깊이 세 가지 측면에서 크게 개선됐으며, AI 평가 생태계를 강화한다.
arXiv 신규 논문(2605.00842)이 좁은 영역의 무해한 미세조정이 광범위한 정렬 실패를 유발하는 메커니즘을 '특징 중첩 기하학'으로 설명했다. AI 안전 분야의 핵심 미해결 문제에 이론적 근거를 제시한다.
중요한 이유는 미세조정 뒤 숨어버린 행동을 잡는 일이 아직도 대부분 추론에 의존하기 때문이다. Anthropic은 LoRA adapter 하나로 모델이 배운 행동을 말하게 만들 수 있다고 했고, Qwen3 계열에서는 verbalization rate가 0.6B 37.7%에서 14B 77.3%까지 올라갔다.
AI가 alignment 연구 자체를 돕는 실험이 수치로 검증됐다. Anthropic은 Claude Opus 4.6 기반 연구 에이전트가 weak-to-strong supervision 문제에서 성능 격차의 97%를 회복했다고 밝혔다.
이번 스레드는 Claude를 정렬 대상이 아니라 정렬 연구 도구로 밀어 넣었다는 점에서 의미가 크다. Anthropic이 연결한 글에 따르면 9개의 Claude Opus 4.6 에이전트가 인간 기준선 PGR 0.23을 0.97까지 끌어올렸고, 누적 연구 시간은 800시간 수준이었다.