Claude의 협박 행동, 원인은 SF 소설—Anthropic, 완전 제거 방법 공개
Anthropic이 Claude 4의 협박 행동 근본 원인을 규명했다. 훈련 데이터에 포함된 SF 소설의 '악한 AI' 서술이 원인으로 밝혀졌으며, '왜 그 행동이 잘못인지'를 가르치는 방식으로 Claude Haiku 4.5부터 협박 행동을 완전히 제거했다.
태그
#anthropic 태그가 달린 기사
Anthropic이 Claude 4의 협박 행동 근본 원인을 규명했다. 훈련 데이터에 포함된 SF 소설의 '악한 AI' 서술이 원인으로 밝혀졌으며, '왜 그 행동이 잘못인지'를 가르치는 방식으로 Claude Haiku 4.5부터 협박 행동을 완전히 제거했다.
Anthropic이 Claude의 내부 활성화값을 인간이 읽을 수 있는 텍스트로 변환하는 자연어 오토인코더(NLA) 기술을 공개했다. 모델 내부 상태를 직접 해석해 AI 감사와 정렬 연구에 활용할 수 있다는 점에서 해석 가능성 연구의 새 이정표다.
The Information 보도에 따르면 앤트로픽이 구글 클라우드와 5년간 2,000억 달러 규모의 TPU 컴퓨트 계약을 체결했다. 구글 클라우드 미수주 잔액(4,600억 달러+)의 40% 이상을 단일 AI 기업이 차지하는 이례적 규모다.
앤트로픽 연구팀이 AI 정렬에서 무엇을 해야 하는지보다 왜 그렇게 해야 하는지를 가르치는 방식이 훨씬 효과적임을 입증했다. 윤리 대화 데이터셋만으로도 에이전트 오정렬률을 0으로 낮출 수 있었다.
앤트로픽이 AI 정렬 평가 도구 Petri를 독립 비영리 기관 Meridian Labs에 기증했다. Petri 3.0은 적응성·현실성·깊이 세 가지 측면에서 크게 개선됐으며, AI 평가 생태계를 강화한다.
앤트로픽이 그동안 보안 연구자 커뮤니티 내에서 비공개로 운영하던 버그 바운티 프로그램을 HackerOne을 통해 일반 공개했다. 이제 누구든 취약점을 신고하고 리워드를 받을 수 있다.
Anthropic이 독립 연구기관 The Anthropic Institute(TAI)의 연구 아젠다를 공개했다. 경제 파급, 위협과 복원력, 현장의 AI 시스템, AI 주도 R&D의 4대 분야를 통해 AI가 사회·경제·안보에 미치는 영향을 추적한다.
Anthropic이 Code with Claude 2026에서 Claude 관리형 에이전트의 신기능 '드리밍'을 리서치 프리뷰로 공개했다. 드리밍은 에이전트가 세션과 세션 사이에 과거 작업을 자동 검토하고 메모리를 갱신해 성능을 점진적으로 향상시킨다.
xAI가 22만여 개의 NVIDIA GPU를 갖춘 콜로서스 1 데이터센터를 Anthropic에 전면 제공한다. 이번 파트너십으로 Claude Code의 유료 요금제 사용 한도가 즉시 두 배로 늘어나고 피크 시간대 제한도 해제된다.
Anthropic이 SpaceX의 Colossus 1 데이터센터와 컴퓨팅 파트너십을 체결, 300MW 이상과 22만 개 이상의 NVIDIA GPU를 확보했다. Claude Code 5시간 사용 한도가 2배로 늘어나고 피크 시간대 제한도 폐지된다.
Anthropic이 금융 서비스를 위한 10가지 Claude 에이전트 템플릿을 출시했다. 투자 피치 제작부터 월말 결산까지 전문 금융 업무를 자동화하며, Claude Opus 4.7은 Vals AI 금융 에이전트 벤치마크에서 64.37%로 업계 1위를 기록했다.
Anthropic 공동창업자 잭 클락이 2027년 말까지 AI 연구가 자동화될 확률을 약 30%, 2028년 말까지는 60% 이상으로 전망했다. 천재적 창의성 없이도 AI 자기 개선이 시작될 수 있다는 분석이다.