본문으로 건너뛰기
부식 중

Anthropic, AI-resistant 기술 평가 설계 공개…채용 테스트 재설계 과정 공유

Anthropic은 2026년 1월 21일 게시물에서 AI 성능 향상에 맞춰 채용용 기술 과제를 여러 차례 개편한 과정을 공개했다. Claude Opus 4와 Opus 4.5가 기존 과제를 빠르게 해결한 사례를 바탕으로 평가 방식 자체를 재설계했다고 설명했다.

원문: Designing AI resistant technical evaluations 원문 보기 →

LLM 작성자 Insights AI 1분 소요 41 조회 출처

Anthropic은 Engineering 글 Designing AI resistant technical evaluations에서 모델 성능 향상이 인재 평가 체계에 미치는 영향을 상세히 공개했다. 게시물은 Published Jan 21, 2026으로 표시되어 있으며, 성능 엔지니어 채용에 사용하던 take-home 과제가 모델 진화에 따라 얼마나 빨리 무력화될 수 있는지 사례 중심으로 설명한다. 핵심은 단순한 부정행위 방지가 아니라, 실제 직무 역량을 계속 구분해내는 평가 신호를 유지하는 것이다.

글에 따르면 해당 과제는 2024년 초부터 운영되어 1,000명 이상이 완료했고, 실제 채용으로도 이어졌다. 그러나 동일 시간 제한에서 Claude Opus 4가 대부분 지원자보다 높은 최적화 결과를 냈고, 이후 Opus 4.5는 상위권 지원자 수준까지 도달했다. 이 변화는 과제 난도를 높이는 방식만으로는 충분하지 않다는 점을 드러냈고, 문제 구조 자체를 반복적으로 바꾸는 접근으로 이어졌다.

운영 측면 변화도 구체적이다. 글은 초기 4-hour 제한을 later reduced to 2 hours로 조정한 이유를 설명한다. 일정 지연을 줄이고 후보자 부담과 파이프라인 효율을 함께 관리하기 위한 선택이었다는 맥락이다. 동시에 평가자는 Claude가 어느 지점에서 막히는지를 분석해 새로운 시작 조건을 설계했고, 공통 미세 최적화만으로는 고득점이 어렵도록 과제를 재구성했다.

Anthropic은 최종적으로 기존 과제를 open challenge 형태로 공개했다. 게시물은 무제한 시간에서는 여전히 인간이 모델을 앞설 수 있다고 언급하면서도, 제한 시간 환경에서는 모델이 빠르게 따라잡는 현실을 인정한다. 이 사례는 기업 채용 평가가 AI 도구 확산 이후 어떤 방향으로 바뀌는지 보여주는 실무 신호다. 평가 문제를 고정 자산으로 보는 대신, 모델 능력 변화에 맞춰 지속적으로 갱신해야 한다는 메시지가 분명하다.

공유: 긴글

관련 기사

LLM X/Twitter

Claude 텍스트에 EU 의무 워터마크…추가 토큰 없이 글로벌 적용·검출 API 추진 예고

Claude의 향후 모델이 EU AI Act 준수를 위해 전 세계 출력에 텍스트 워터마크를 적용한다. 약 190개 서명 기관이 참여한 규범에 따른 조치로, 추가 토큰이나 사용자 식별 정보는 넣지 않는다. 짧은 글과 코드에서는 검출력이 약해질 수 있으며 검출 API도 제공될 예정이다.

2분 소요 14 조회
LLM X/Twitter

Claude Fable 5.1·Mythos 5.1 공개, 캐시 비용 75% 낮추고 이중 안전 등급화

Anthropic이 같은 기반 모델을 일반용 Fable 5.1과 검증 기관용 Mythos 5.1로 나눴다. 캐시 읽기 비용은 75% 내려가고 에이전트형 작업 비용은 최대 약 45% 줄어드는 한편, 생물학 안전장치의 정상 요청 개입은 85% 감소했다. Fable은 API와 주요 클라우드에도 제공된다.

2분 소요 2 조회