원칙 학습이 행동 암기보다 강한 정렬을 만드는 이유 — 앤트로픽 연구
앤트로픽 연구팀이 AI 정렬에서 무엇을 해야 하는지보다 왜 그렇게 해야 하는지를 가르치는 방식이 훨씬 효과적임을 입증했다. 윤리 대화 데이터셋만으로도 에이전트 오정렬률을 0으로 낮출 수 있었다.
태그
#safety 태그가 달린 기사
앤트로픽 연구팀이 AI 정렬에서 무엇을 해야 하는지보다 왜 그렇게 해야 하는지를 가르치는 방식이 훨씬 효과적임을 입증했다. 윤리 대화 데이터셋만으로도 에이전트 오정렬률을 0으로 낮출 수 있었다.
arXiv 신규 논문(2605.00842)이 좁은 영역의 무해한 미세조정이 광범위한 정렬 실패를 유발하는 메커니즘을 '특징 중첩 기하학'으로 설명했다. AI 안전 분야의 핵심 미해결 문제에 이론적 근거를 제시한다.
유럽의회와 유럽이사회가 AI법 옴니버스 개정안에 잠정 합의했다. 고위험 AI 준수 기한을 최대 2년 연장하고, AI 생성 성착취물 금지 조항을 추가했으며, 중소기업 면제 범위도 확대됐다.
코네티컷이 AI 투명성·안전 법안 SB5를 하원 131-17, 상원 32-4로 통과시켰다. 월 이용자 100만 명 이상 생성 AI 서비스는 AI 생성 미디어에 출처 메타데이터를 삽입해야 한다.
OpenAI가 5월 7일 사이버보안 전문가 대상 특화 모델 GPT-5.5-Cyber의 제한 공개를 시작했다. Anthropic Mythos 접근 제한을 비판했던 OpenAI도 결국 같은 방식을 채택했다.
트럼프 행정부가 강력한 AI 모델 공개 전 NSA 등 정부기관 검토를 의무화하는 행정명령을 논의 중이다. AI 안전 행정명령 폐지 후 1년여 만에 나온 정책 선회다.
미 국방부가 OpenAI·구글·마이크로소프트 등 8개사와 최고 기밀 분류 네트워크에서의 AI 배포 협정을 체결했다. 앤트로픽은 군사적 활용 제한 조항을 둘러싼 분쟁으로 유일하게 제외됐다.
구글이 미국 국방부와 Gemini AI 기밀 사용 계약을 체결했다. '모든 합법적 정부 목적'에 허용하는 내용이며, 앤트로픽의 거부 이후 체결됐다. 직원 600명 이상이 반대 서한을 발송했다.
중요한 이유는 미세조정 뒤 숨어버린 행동을 잡는 일이 아직도 대부분 추론에 의존하기 때문이다. Anthropic은 LoRA adapter 하나로 모델이 배운 행동을 말하게 만들 수 있다고 했고, Qwen3 계열에서는 verbalization rate가 0.6B 37.7%에서 14B 77.3%까지 올라갔다.
중요한 점은 개인 조언이 AI가 실제 결정을 건드리는 가장 직접적인 장면 중 하나라는 데 있다. Anthropic는 100만 대화 표본 중 6%가 조언을 구했고, 관계 조언에서 Opus 4.7이 Opus 4.6 대비 아첨 응답 비율을 절반으로 줄였다고 적었다.
OpenAI가 폭력 계획 징후를 긴 대화 흐름까지 추적해 제재하고, 차단 사유가 확인되면 즉시 계정을 회수하겠다고 밝혔다. 거절 응답 한 번으로 끝나던 단계에서 계정 단위 집행으로 무게가 옮겨간 점이 핵심이다.
OpenAI의 4월 21일 system card는 ChatGPT Images 2.0의 safety tradeoff를 숫자로 공개했다. Thinking mode에서 final blocking 전 policy-violating image 비율이 6.7%였다는 점은, 더 사실적인 image generation과 provenance, biorisk 대응이 하나의 deployment 문제가 됐다는 뜻이다.