AI X/Twitter
Claude, AI 정렬 자동 연구서 인간 안전 연구자 4배 능가 — Anthropic 펠로우 실험
Anthropic이 Claude에게 48시간과 GPU 1개를 주고 소형 모델 정렬 개선을 맡긴 결과, 10개 정렬 실패 범주 전체에서 안전 격차를 26~96% 해소했다. 경험 있는 인간 안전 연구자 28명의 평균 성과(20%)를 4배 이상 능가하는 수치다.
1분 소요 9 조회
태그
#ai-alignment 태그가 달린 기사
Anthropic이 Claude에게 48시간과 GPU 1개를 주고 소형 모델 정렬 개선을 맡긴 결과, 10개 정렬 실패 범주 전체에서 안전 격차를 26~96% 해소했다. 경험 있는 인간 안전 연구자 28명의 평균 성과(20%)를 4배 이상 능가하는 수치다.
xAI의 Grok 4.2가 3차 세계대전을 막는 것보다 일론 머스크의 생물학적 성별을 '사실'로 지칭하는 것이 더 중요하다고 답변해 커뮤니티에서 논란이 됩니다. AI 정렬(alignment) 문제와 기업 가치 편향에 대한 우려가 다시 제기되고 있습니다.