앤스로픽 연구: 실사용 환경에서 AI 에이전트 자율성이 빠르게 증가 중
앤스로픽이 클로드 코드·API의 수백만 건 상호작용 분석 결과, 99.9번째 백분위 세션 지속 시간이 25분에서 45분으로 두 배 증가하는 등 AI 에이전트 자율성이 실제 환경에서 급격히 높아지고 있음을 확인했습니다.
원문: Anthropic Research Reveals AI Agents Are Rapidly Gaining Autonomy in Real-World Deployments 원문 보기 →
AI 에이전트 자율성의 현주소
앤스로픽은 2026년 2월 19일, 클로드 코드(Claude Code)와 공개 API를 통한 수백만 건의 실제 상호작용을 분석하여 AI 에이전트 자율성 실태를 실증적으로 측정한 연구를 발표했습니다.
주요 연구 결과
자율성의 급격한 증가
2025년 10월부터 2026년 1월 사이, 99.9번째 백분위 턴 지속 시간이 25분 미만에서 45분 이상으로 거의 두 배 증가했습니다. 연구진은 "현존 모델들이 실제로 사용되는 것보다 더 많은 자율성을 처리할 능력이 있다"고 결론지었습니다.
경험에 따른 감독 방식 변화
신규 사용자는 약 20%의 작업을 자율 승인하는 반면, 숙련된 사용자는 약 40%를 자율 승인합니다. 흥미롭게도 숙련 사용자는 개별 작업 승인 방식에서 전체 세션 모니터링 방식으로 전환하면서 실제 개입도 더 자주 합니다.
소프트웨어 공학이 절반
공개 API에서 에이전트 활동의 약 50%가 소프트웨어 공학 분야이며, 의료·금융·고객 서비스 분야에서도 신흥 활용이 나타나고 있습니다.
안전성 시사점
대부분의 작업(80%)은 권한 요청이나 인간 검토와 같은 안전 장치가 적용되며, 0.8%만이 되돌릴 수 없는 작업입니다. 연구팀은 에이전트가 고위험 도메인으로 확장됨에 따라 배포 후 모니터링 인프라 구축이 중요해질 것이라고 권고합니다.
전체 연구는 앤스로픽 연구 페이지에서 확인할 수 있습니다.
관련 기사
Claude, AI 정렬 자동 연구서 인간 안전 연구자 4배 능가 — Anthropic 펠로우 실험
Anthropic이 Claude에게 48시간과 GPU 1개를 주고 소형 모델 정렬 개선을 맡긴 결과, 10개 정렬 실패 범주 전체에서 안전 격차를 26~96% 해소했다. 경험 있는 인간 안전 연구자 28명의 평균 성과(20%)를 4배 이상 능가하는 수치다.
Anthropic, Claude 100만 대화 분석… 개인 조언 아첨 응답 절반 축소
중요한 점은 개인 조언이 AI가 실제 결정을 건드리는 가장 직접적인 장면 중 하나라는 데 있다. Anthropic는 100만 대화 표본 중 6%가 조언을 구했고, 관계 조언에서 Opus 4.7이 Opus 4.6 대비 아첨 응답 비율을 절반으로 줄였다고 적었다.
클로드, 금융 업무를 대행하다—Pitch Builder부터 KYC 검토까지 10개 에이전트 출시
Anthropic이 금융 서비스를 위한 10가지 Claude 에이전트 템플릿을 출시했다. 투자 피치 제작부터 월말 결산까지 전문 금융 업무를 자동화하며, Claude Opus 4.7은 Vals AI 금융 에이전트 벤치마크에서 64.37%로 업계 1위를 기록했다.