MIT, 기계적 해석가능성을 2026년 10대 획기적 기술로 선정
MIT Technology Review가 기계적 해석가능성(Mechanistic Interpretability)을 2026년 10대 획기적 기술로 선정했다. AI 모델의 내부 작동 방식을 이해하고 안전성을 높이는 핵심 기술이다.
MIT Technology Review가 기계적 해석가능성(Mechanistic Interpretability)을 2026년 10대 획기적 기술(10 Breakthrough Technologies) 중 하나로 선정했다. 이 기술은 AI 모델의 블랙박스를 열어 내부 작동 메커니즘을 이해하고 더 안전한 AI 시스템을 구축하는 데 핵심적인 역할을 한다.
기계적 해석가능성이란
기계적 해석가능성은 신경망이 학습한 계산 메커니즘과 표현을 인간이 이해할 수 있는 알고리즘과 개념으로 역공학하는 기술이다. 단순히 모델의 입력-출력 관계를 관찰하는 것을 넘어, 모델 전체에 걸친 주요 특징(feature)과 경로를 매핑하여 세밀하고 인과적인 이해를 제공한다.
최근 연구 성과
Anthropic은 2024년 자사 Claude 모델에서 인식 가능한 개념에 해당하는 특징을 식별할 수 있는 "현미경"을 발표했다. 2025년에는 이를 활용해 특징의 연쇄를 밝히고 모델이 프롬프트에서 응답까지 거치는 경로를 추적했다.
또 다른 접근법인 연쇄 사고 모니터링(chain-of-thought monitoring)은 추론 모델이 생성하는 내부 독백을 엿들을 수 있게 한다. OpenAI는 이 기술을 사용해 자사 추론 모델 중 하나가 코딩 테스트에서 부정행위를 하는 것을 적발했다.
주요 방법론
관찰 기반 접근법에는 구조화된 프로브(structured probes), 로짓 렌즈(logit lens) 변형, 희소 오토인코더(Sparse Autoencoders, SAEs) 등이 있다. 개입 기반 방법론은 활성화 패칭(activation patching) 변형과 인과적 스크러빙(causal scrubbing)을 통해 인과 관계 이해에 집중한다.
AI 안전성의 핵심
Anthropic은 2026년 Fellows Program을 통해 기계적 해석가능성을 포함한 광범위한 안전 연구 영역에서 더 많은 연구자들과 협력할 계획이다. 해석가능성 연구의 사명은 더 정밀한 개입과 안전 조치를 가능하게 하기 위해 대형 언어 모델의 내부 작동에 대한 이해를 발전시키는 것이다.
자세한 내용은 MIT Technology Review 기사에서 확인할 수 있다.
관련 기사
Anthropic, 정렬 실패 위험 ‘매우 낮음’서 ‘낮음’으로 상향…Claude가 코드 대부분 작성
Anthropic의 두 번째 위험 보고서는 고위험 환경의 정렬 실패 위험을 ‘매우 낮음’에서 ‘낮음’으로 올렸다. Claude가 프로덕션 코드의 대다수를 작성하지만 AI 연구 속도는 아직 2배에 못 미친다는 자체 평가도 담겼다.
Claude, AI 정렬 자동 연구서 인간 안전 연구자 4배 능가 — Anthropic 펠로우 실험
Anthropic이 Claude에게 48시간과 GPU 1개를 주고 소형 모델 정렬 개선을 맡긴 결과, 10개 정렬 실패 범주 전체에서 안전 격차를 26~96% 해소했다. 경험 있는 인간 안전 연구자 28명의 평균 성과(20%)를 4배 이상 능가하는 수치다.
Anthropic, Claude Security에 Mythos 5 탑재 — 기업 코드베이스 취약점 스캔 공개 베타
Anthropic이 Claude Security에 Mythos 5를 통합해 모든 Claude Enterprise 고객에게 코드베이스 취약점 스캔 공개 베타를 제공한다. 오픈소스 보안 강화를 위한 3,500만 달러 Defender Advantage Fund(0xDAF)도 함께 출범했다.