본문으로 건너뛰기

SWE-2, Fable 5.1에 0.9%p 차…코딩 성능 맞추고 비용 64% 절감한 Devin 카드

Cognition의 새 코딩 모델 SWE-2가 FrontierCode 1.1 Main에서 50.0%를 기록해 Fable 5.1의 50.9%에 근접하면서 비용은 64% 낮췄다. Kimi K3를 다중 조 단위 규모로 강화학습한 모델이며 Devin Desktop과 CLI에서 바로 쓸 수 있다.

원문: Introducing SWE-2: Pushing the Pareto Frontier 원문 보기 →

LLM 작성자 Insights AI 2분 소요 출처

최상위 코딩 모델에 가까운 점수를 훨씬 낮은 비용으로 내는 선택지가 Devin에 들어왔다. Cognition이 2026년 9월 10일 출시한 SWE-2는 FrontierCode 1.1 Main에서 50.0%를 기록했다. Fable 5.1의 50.9%와 0.9%포인트 차이지만 평가 비용은 64% 낮다는 것이 회사 측 측정이다. SWE-2는 같은 날 Devin Desktop과 CLI에 적용됐고 Devin Web과 Fusion에도 순차 배포 중이다.

기반 모델은 2.8조 매개변수 규모의 Kimi K3다. Cognition은 K3가 이미 코딩 에이전트용 강화학습을 충분히 거쳤는데도 추가 학습으로 여러 평가에서 5~6%포인트를 더 끌어올렸다고 설명한다. FrontierCode 1.1 Main 점수는 Kimi K3 44.2%, SWE-1.7 42.0%, Grok 4.6 48.0%, GPT-5.6 Sol 47.5%였다. GPT-6 Astra의 53.3%에는 못 미쳤지만 비용은 약 4분의 1 수준이라고 제시했다.

다른 평가에서는 강점과 약점이 더 선명하다. DeepSWE 1.1에서 SWE-2는 73.0%로 GPT-5.6 Sol의 72.7%와 Fable 5.1의 67.4%를 앞섰고, Terminal-Bench 2.1에서는 92.8%로 비교표의 모든 모델보다 높았다. 반면 Terminal-Bench 4 점수는 27.3%에 머물러 Fable 5.1의 55.8%, GPT-6 Astra의 57.9%와 큰 차이를 보였다. 하나의 공급사 평가표 안에서도 과제 세대와 난도에 따라 격차가 크게 달라지는 만큼 ‘동급’이라는 표현은 특정 벤치마크와 비용 조건에 한정해 읽어야 한다.

학습 방식의 변화는 추론 노력 수준을 각각 따로 훈련하지 않았다는 데 있다. SWE-2는 낮음·중간·최대 노력 수준을 한 번의 강화학습 실행에서 함께 학습했다. 각 수준의 비용과 성능 곡선 기울기에 맞춰 선형 비용 페널티를 달리 주고, 답 길이를 고려한 보상 기준선으로 훈련 변동을 줄였다. 중간 수준은 더 짧고 정확하게, 최대 수준은 필요할 때 토큰과 도구 호출을 더 쓰도록 같은 모델 안에서 행동을 갈랐다.

에이전트가 실제 수정에 들어가는 속도도 달라졌다. FrontierCode 1.1 Main에서 중간 노력 SWE-2가 첫 유효 편집을 시작하기까지 중앙값은 18단계로, SWE-1.7의 48단계보다 짧았다. 훈련 환경 수는 세 배로 늘렸고 이전 SWE-2 체크포인트가 검증기의 오탐과 누락을 찾아내도록 반복 개선했다. 온라인 초안 모델과 NVFP4·FP8 커널, 양자화 인지 학습을 조합해 기반 모델 매개변수가 약 세 배로 커졌는데도 SWE-1.7과 비슷한 처리량을 유지했다.

다만 수치는 Cognition이 설계하거나 선택한 평가와 자체 가격 계산에서 나왔다. 독립 환경에서의 재현 결과와 긴 실제 저장소 작업의 완료율은 앞으로 확인할 부분이다. 그럼에도 사용 가능한 제품에 즉시 들어간 모델이 성능뿐 아니라 실행 비용을 학습 목표로 직접 다뤘다는 점은 중요하다. 코딩 에이전트 경쟁의 기준이 최고 점수 하나에서 작업당 비용과 노력 수준별 효율로 이동하고 있음을 보여준다.

공유: 긴글

관련 기사

LLM X/Twitter

Meta Muse Spark 1.3, 도구 호출 20%·토큰 25% 줄이고 장기 에이전트 강화

Meta의 Muse Spark 1.3이 이전 버전보다 도구 호출을 약 20%, 토큰 사용을 약 25% 줄이면서 장기 코딩·에이전트 작업을 강화했다. 모호한 지시에는 질문하고 중대한 행동 전에는 확인하는 방식으로 작업 지속성과 통제 가능성을 함께 높였으며, 공개 가중치도 예고했다.

2분 소요 1 조회
LLM X/Twitter

4B 시각언어모델, 단일 A100 재현 경로로 GeoGuessr에서 GPT-5.4 mini·Haiku 추월

작은 시각언어모델도 환경·보상·평가 설계를 갖추면 훨씬 큰 범용 모델을 특정 과제에서 넘어설 수 있다. Qwen3.5-4B의 보류 평가 점수는 0.4825에서 0.6445로 올랐고, 200개 과제·73개국 데이터와 단일 A100 재현 경로가 공개됐다. GPT-5.4 mini와 Haiku를 앞섰지만 Sonnet에는 미치지 못했다.

2분 소요