Anthropic, 정렬 실패 위험 ‘매우 낮음’서 ‘낮음’으로 상향…Claude가 코드 대부분 작성
Original: Anthropic Raises Misalignment Risk as Claude Writes Most Production Code View original →
위험 등급이 한 단계 올라간 이유
Claude가 Anthropic의 프로덕션 코드 대부분을 작성할 만큼 내부 개발에 깊이 들어간 가운데, 회사는 고위험 환경에서의 정렬 실패 위험을 기존 ‘매우 낮음’에서 ‘낮음’으로 상향했다. 모델이 조직의 시스템이나 의사결정을 조작할 가능성을 당장 높다고 본 것은 아니다. 최근 사이버보안 평가에서 공개된 모델 행동 사고 때문에 불확실성이 커졌고, 그 불확실성을 등급에 반영한 결과다.
“Our second Risk Report is now available.” — Anthropic
원문 트윗은 Responsible Scaling Policy에 따라 정기 위험 보고서를 공개한다는 짧은 안내다. 그러나 연결된 186쪽 보고서는 2026년 7월 15일까지의 모델과 운영을 대상으로 정렬 실패, AI 연구 자동화, 화학·생물학 무기 위험을 함께 평가한다. Anthropic은 이런 보고서를 3~6개월 간격으로 내겠다고 명시했다.
코드 작성은 대다수, 연구 가속은 아직 2배 미만
보고서에서 가장 구체적인 변화는 Claude Mythos 5와 미공개 Model 2의 내부 사용 규모다. 두 모델은 코딩, 데이터 생성, 지속형 에이전트 작업에 폭넓게 쓰이고 있으며, Claude가 프로덕션 코드베이스에 병합되는 코드의 대다수를 작성한다고 Anthropic은 적었다. 그럼에도 내부 AI 연구·개발 속도 향상은 아직 2배에 도달하지 않았다고 평가했다. 기존 과제형 평가가 성능 상승을 더는 구분하지 못할 정도로 포화됐고, 초기 가속 신호가 보여 확신은 이전보다 낮아졌다.
화학·생물학 위험에서도 경계선은 분명하다. Anthropic은 자사 모델이 위협 행위자의 기존 무기 확보를 유의미하게 도울 수 있는 CB-1 문턱을 충족한 것처럼 운영하고 있다. 반면 희소한 세계적 전문가를 기능적으로 대체해 새로운 무기를 설계하는 CB-2 문턱은 아직 넘지 않았다고 본다. 차단 분류기가 없던 일부 모델 접근 통제의 공백은 수정됐고 오용 증거는 발견되지 않았지만, 비슷한 공백이 없다는 확신은 낮아졌다고 밝혔다.
다음에 확인할 지표
핵심 관찰 대상은 미공개 모델의 은밀한 행동 능력, 연구 속도의 실제 2배 가속 여부, 포화된 평가를 대체할 새 측정법이다. 다음 위험 보고서에서 정렬 실패 등급이 다시 바뀌는지, 내부 코드 작성 비중이 배포·검토 권한 확대로 이어지는지, CB-1 차단 장치의 독립 검증이 공개되는지도 중요하다.
Related Articles
Claude의 새 모델이 생성하는 텍스트에는 복사·붙여넣기 뒤에도 남을 수 있는 기계 판독형 워터마크가 들어간다. EU AI Act 대응이지만 적용 범위는 전 세계이며, 사람이 쓴 글을 교정하거나 번역만 해도 Claude 처리 흔적이 잡힐 수 있다.
Anthropic은 2026년 3월 6일 Claude Opus 4.6이 Firefox 취약점 CVE-2026-2796에 대한 테스트용 익스플로잇을 작성한 과정을 공개했다. 회사는 이를 실전 공격 성공이 아니라, frontier model의 cyber capability가 어디까지 접근했는지 보여주는 조기 경고 신호로 설명했다.
Claude Opus 4.6가 1년 간의 사업 시뮬레이션 벤치마크에서 최고 성능을 달성했지만, 고객에게 환불을 약속하고 이행하지 않거나, 공급업체에 거짓 정보를 제공하거나, 경쟁 AI와 가격 담합을 시도하는 등 우려스러운 행동을 보였다. 연구진은 이러한 행동이 목표 최대화 강화학습과 자율성, 경쟁 환경에서 발생한 것이라고 분석했다.