본문으로 건너뛰기

Claude·Codex·Cursor 도구 선택 일치율 42%, 1만6893회 실험의 결론

같은 개발 과제를 줘도 Claude Code·Codex·Cursor가 같은 외부 도구를 고른 비율은 42%뿐이었다. 1만6893회 실행 기록은 코딩 에이전트의 선택이 모델 이름뿐 아니라 검색 습관, 언어, 기존 저장소 구조에 크게 흔들린다는 사실을 보여준다.

원문: Which tools do Claude, Codex and Cursor choose? We measured 17k runs to find out 원문 보기 →

LLM 해커뉴스 작성자 Insights AI (HN) 2분 소요 출처

코딩 에이전트가 결제, 데이터베이스, 이메일 같은 외부 서비스를 대신 고르는 시대에는 코드 생성 품질만 비교해서는 부족하다. Armature의 실험은 Claude Code, Codex, Cursor에 같은 종류의 구현 과제를 반복해서 맡기고 실제로 어떤 도구를 설치하는지 추적했다. 75개 저장소와 1,163개 프롬프트 변형에서 1만6893회 실행했으며, 1차 공개 분석에는 품질 기준을 통과한 51개 코드베이스·18개 분야의 5,292개 세션을 사용했다.

세 에이전트가 같은 도구를 고른 비교 구간은 42%였다. 음성 에이전트 분야에서 Claude Code는 Twilio, Codex는 OpenAI Realtime API, Cursor는 Vapi를 택했다. 어느 하나가 항상 옳다는 뜻이 아니라, 같은 요구사항도 모델이 가진 사전 지식과 조사 방식에 따라 서로 다른 소프트웨어 공급망으로 이어질 수 있다는 뜻이다.

웹을 쓰는 습관부터 달랐다. Codex는 세션의 94%에서 검색했고, 검색 열 번 중 아홉 번은 `site:` 같은 연산자로 특정 공식 도메인이나 해법에 범위를 좁혔다. Cursor는 약 3분의 2에서 웹 정보를 판단 근거로 삼았다. Claude Code의 검색 비율은 약 30%로 낮았지만, 검색할 때는 Codex보다 세 배 많은 페이지를 열었다. 샌드박스처럼 최근에 생긴 분야에서는 Claude Code의 검색률도 약 80%까지 올라갔다.

저장소 맥락은 브랜드 순위도 뒤집었다. 같은 이메일 기능을 구현해도 TypeScript에서는 Resend가 89회 중 55회 선택됐고, Python에서는 SendGrid가 24회 중 22회, Go에서는 Postmark가 24회 중 20회, Java에서는 Azure ACS가 23회 중 22회 선택됐다. Next.js 저장소에서는 Vercel 선택률이 100%였지만 Python 저장소에서는 한 번도 선택되지 않고 Render가 앞섰다. 에이전트가 빈 화면에서 비교표만 읽는 것이 아니라 기존 언어와 프레임워크에 맞춰 마찰이 적은 경로를 찾는다는 결과다.

이름이 자주 등장하는 것과 실제 설치도 달랐다. PayPal은 139회 언급됐지만 선택은 0회였고, 그중 124회는 Stripe가 이겼다. LangChain은 194회 언급돼 프레임워크 중 가장 빈번했지만 설치는 네 번뿐이었다. Netlify도 152회 언급에 선택은 여섯 번이었다. 반대로 결제에서는 Stripe가 열 번 중 아홉 번, 데이터베이스에서는 Neon이 66%를 차지했다. 공급업체의 인지도보다 가격표와 통합 범위가 최종 선택을 더 직접적으로 움직였다.

해석에는 실험 설계의 경계가 있다. 전체 1만6893회 중 공개 분석에 쓰인 세션은 약 31%이며, 자동 평가와 샌드박스 환경의 선택이 실제 팀의 장기 운영 결정을 그대로 대변하지는 않는다. 사람은 계약 조건, 보안 심사, 기존 거래 관계를 추가로 고려한다. 그래도 공개된 실행 추적은 에이전트 추천을 재현하고 감사할 출발점을 준다. 커뮤니티 논점은 모델별 승패보다 ‘왜 이 도구를 골랐는지’를 팀이 볼 수 있어야 한다는 데 모였다. 에이전트가 의존성을 추가할 때 검색 출처, 탈락 이유, 저장소 맥락을 함께 남기는 기능이 실무의 다음 요구사항이 될 가능성이 크다.

공유: 긴글

관련 기사

LLM X/Twitter

Cursor, 사전학습 연장부터 실제 워크플로 RL까지 Composer 2 학습 스택 공개

Cursor는 2026년 3월 26일 real-time RL을 통해 5시간마다 개선된 checkpoint를 배포할 수 있다고 밝혔다. Cursor의 3월 27일 technical report는 Composer 2가 Kimi K2.5 기반 continued pretraining과 realistic Cursor session에서의 대규모 RL을 결합하며, CursorBench 61.3, SWE-bench Multilingual 73.7, Terminal-Bench 61.7을 기록했다고 설명한다.

2분 소요 49 조회
LLM X/Twitter

OpenAI, Codex 접근 범위 넓히고 plugins를 재사용 workflow 패키지로 확대

OpenAIDevs는 2026년 3월 27일 사용자가 새로 출시된 plugins를 시험할 수 있도록 Codex usage limits를 전 플랜에서 reset했다고 밝혔다. OpenAI Help Center는 Codex가 Free와 Go에 한시적으로 제공되고, 유료 플랜은 2x rate limits를 받으며, plugins가 skills·app integrations·MCP configurations를 묶은 재사용 workflow 패키지라고 설명한다.

2분 소요 49 조회