코딩 에이전트에 TDD를 시켰더니…테스트 두 배, 정확도는 제자리
테스트를 더 쓰라는 지시가 더 정확한 코드를 보장하지 않는다는 대규모 실험이 개발자들의 경험담을 데이터로 끌어냈다. 26개 조건에서 에이전트는 형식 기법과 property-based testing을 자주 겉모양만 따라 했고, 기본 설정이 오히려 평균 이상이었다.
Insights
기사 87개
테스트를 더 쓰라는 지시가 더 정확한 코드를 보장하지 않는다는 대규모 실험이 개발자들의 경험담을 데이터로 끌어냈다. 26개 조건에서 에이전트는 형식 기법과 property-based testing을 자주 겉모양만 따라 했고, 기본 설정이 오히려 평균 이상이었다.
같은 개발 과제를 줘도 Claude Code·Codex·Cursor가 같은 외부 도구를 고른 비율은 42%뿐이었다. 1만6893회 실행 기록은 코딩 에이전트의 선택이 모델 이름뿐 아니라 검색 습관, 언어, 기존 저장소 구조에 크게 흔들린다는 사실을 보여준다.
936점을 모은 관심의 초점은 단순한 신모델 출시가 아니라, 3주 만의 세대 교체와 연말까지 적용되는 절반 가격이다. 코딩·문서 처리·업무 자동화 지표가 함께 올랐지만, 실제 비용과 품질은 각자의 agent workflow에서 확인해야 한다.
LLM 평가가 짧은 프롬프트 그림 생성에서 장시간 실행 코드 생성으로 넓어지고 있다. Karpathy는 Opus 5가 약 $10의 1M 토큰 예산과 2시간 실행으로 5,500줄 Three.js 코드를 만들었다고 전했다.
코딩 에이전트 평가는 이제 pass@1만으로 부족하다. Together AI는 DeepSWE 분석에서 Kimi K3가 Fable 5에 근접한 pass@1을 보이면서 rollout 비용은 약 3분의 1이었다고 밝혔다.
2.4T MoE 모델이 공개 가중치까지 예고하면서 폐쇄형 코딩 모델의 가격 기준이 압박받는다. Qwen은 Qwen3.8-Max 입력 $2, 출력 $6/M 토큰과 1M 컨텍스트를 함께 제시했다.
Claude Opus 5가 GitHub Copilot 모델 선택지에 들어오면서 고난도 코딩 작업을 GitHub 작업면 안에서 바로 맡길 수 있게 됐다. Pro+, Max, Business, Enterprise 사용자는 VS Code, Copilot CLI, cloud agent, JetBrains 등 9개 표면에서 순차적으로 접근한다.
일상형 고성능 모델 경쟁의 초점이 최고점보다 비용당 성능으로 옮겨갔다. Claude Opus 5는 Fable 5에 가까운 코딩·지식 작업 성능을 절반 가격으로 내세우며, API 가격은 입력 $5/M·출력 $25/M 토큰으로 책정됐다.
AI coding agent를 더 많이 돌리자는 흐름에 맞서, 문제는 loop 수가 아니라 검토와 모델 학습의 한계라는 반론이 힘을 얻었다.
공개 모델용 코딩 에이전트가 특정 모델 하네스와 SDK 호환성을 앞세워 성숙하고 있다. OpenInterpreter는 Rust로 구현한 Kimi K3 네이티브 하네스, Apache 라이선스, ACP와 Codex SDK 호환을 내세웠다.
LM Studio Bionic은 open model을 쓰는 agent workflow를 데스크톱으로 끌어오려는 시도다. HN의 관심은 coding 기능과 함께 local 실행, cloud 전환, closed-source 앱이라는 긴장에 모였다.
xAI의 terminal coding agent가 공개되자 HN의 관심은 기능보다 신뢰와 통제권으로 향했다. Rust TUI, shell 실행, ACP 지원보다 더 뜨거운 쟁점은 telemetry와 fork 가능성이었다.