앤스로픽, 딥시크·문샷 AI·미니맥스의 대규모 모델 증류 공격 폭로
앤스로픽이 중국 AI 기업 딥시크, 문샷 AI, 미니맥스가 2만 4천 개의 허위 계정으로 클로드와 1,600만 건 이상의 대화를 생성해 모델 역량을 추출했다고 폭로했습니다. 가짜 계정 수 및 교환 횟수 모두 전례 없는 규모입니다.
원문: Anthropic Exposes Industrial-Scale AI Model Distillation Attacks by DeepSeek, Moonshot AI, and MiniMax 원문 보기 →
산업 규모의 AI 모델 증류 공격 발견
앤스로픽은 2026년 2월 24일, 중국의 주요 AI 기업들이 클로드(Claude) 모델을 대상으로 대규모 증류 공격을 진행해왔다고 공개했습니다. 딥시크(DeepSeek), 문샷 AI(Moonshot AI), 미니맥스(MiniMax)가 이번 공격의 주체로 지목되었습니다.
공격의 규모와 방법
이들 기업은 다음과 같은 방식으로 공격을 진행했습니다:
- 24,000개 이상의 허위 계정 생성
- 클로드와 1,600만 건 이상의 대화 생성
- 대화 데이터를 활용해 자사 모델 훈련 및 성능 향상
모델 증류의 위험성
앤스로픽은 합법적인 증류와 불법적인 증류를 구분합니다. AI 기업들이 고객용 소형·저비용 모델을 만드는 데 증류를 사용하는 것은 정당한 행위입니다. 그러나 해외 기업들이 미국 모델을 불법으로 증류할 경우, 안전 장치를 제거하고 추출된 역량을 자국의 군사·정보·감시 시스템에 활용할 수 있다는 것이 문제입니다.
업계 공동 대응 촉구
앤스로픽은 이러한 공격이 점점 더 치밀하고 정교해지고 있다고 경고하며, 이를 해결하기 위해서는 업계, 정책 입안자, AI 커뮤니티 전반의 신속하고 조율된 대응이 필요하다고 강조했습니다.
자세한 내용은 앤스로픽의 공식 발표문 Detecting and Preventing Distillation Attacks에서 확인할 수 있습니다.
관련 기사
Anthropic, 정렬 실패 위험 ‘매우 낮음’서 ‘낮음’으로 상향…Claude가 코드 대부분 작성
Anthropic의 두 번째 위험 보고서는 고위험 환경의 정렬 실패 위험을 ‘매우 낮음’에서 ‘낮음’으로 올렸다. Claude가 프로덕션 코드의 대다수를 작성하지만 AI 연구 속도는 아직 2배에 못 미친다는 자체 평가도 담겼다.
Claude, AI 정렬 자동 연구서 인간 안전 연구자 4배 능가 — Anthropic 펠로우 실험
Anthropic이 Claude에게 48시간과 GPU 1개를 주고 소형 모델 정렬 개선을 맡긴 결과, 10개 정렬 실패 범주 전체에서 안전 격차를 26~96% 해소했다. 경험 있는 인간 안전 연구자 28명의 평균 성과(20%)를 4배 이상 능가하는 수치다.
Anthropic, Claude Security에 Mythos 5 탑재 — 기업 코드베이스 취약점 스캔 공개 베타
Anthropic이 Claude Security에 Mythos 5를 통합해 모든 Claude Enterprise 고객에게 코드베이스 취약점 스캔 공개 베타를 제공한다. 오픈소스 보안 강화를 위한 3,500만 달러 Defender Advantage Fund(0xDAF)도 함께 출범했다.