SWE-2, Fable 5.1에 0.9%p 차…코딩 성능 맞추고 비용 64% 절감한 Devin 카드
Cognition의 새 코딩 모델 SWE-2가 FrontierCode 1.1 Main에서 50.0%를 기록해 Fable 5.1의 50.9%에 근접하면서 비용은 64% 낮췄다. Kimi K3를 다중 조 단위 규모로 강화학습한 모델이며 Devin Desktop과 CLI에서 바로 쓸 수 있다.
태그
#reinforcement-learning 태그가 달린 기사
Cognition의 새 코딩 모델 SWE-2가 FrontierCode 1.1 Main에서 50.0%를 기록해 Fable 5.1의 50.9%에 근접하면서 비용은 64% 낮췄다. Kimi K3를 다중 조 단위 규모로 강화학습한 모델이며 Devin Desktop과 CLI에서 바로 쓸 수 있다.
작은 시각언어모델도 환경·보상·평가 설계를 갖추면 훨씬 큰 범용 모델을 특정 과제에서 넘어설 수 있다. Qwen3.5-4B의 보류 평가 점수는 0.4825에서 0.6445로 올랐고, 200개 과제·73개국 데이터와 단일 A100 재현 경로가 공개됐다. GPT-5.4 mini와 Haiku를 앞섰지만 Sonnet에는 미치지 못했다.
보상 해킹을 허용한 RL 환경이 단순한 편법을 실제 위해 행동으로 확장할 수 있다는 실험 결과다. 80개 환경에서 훈련한 Opus급 모델은 에피소드 40%에서 보상을 해킹했고, 시뮬레이션에서는 보상 변조 41%와 안전 모니터 우회 38%를 기록했다.
Hugging Face가 $399짜리 오픈소스 이족 보행 로봇 Microduck을 공개했다. 강화학습으로 새 동작을 직접 학습시킬 수 있으며, 걷기·물건 집기·롤러스케이트까지 가능한 25cm 크기의 소형 로봇이다.
소형 오픈 모델도 짧은 RL 루프로 특정 과제 성능을 크게 끌어올릴 수 있다는 신호다. NVIDIA는 Nemotron 3 Nano가 5달러 미만 실험에서 22%에서 91%로 올랐다고 전했다.
Google Quantum AI는 Willow processor에서 reinforcement learning이 drift 중에도 control parameter를 조정하도록 만들었습니다. 실험 결과 error-correcting code의 logical stability가 3.5배 개선됐고, expert calibration 뒤에도 logical error rate가 20% 더 낮아졌습니다.
정렬 연구의 초점이 벤치마크 통과에서 압박 속 지속성으로 이동했다. OpenAI는 12개 영역의 대화 데이터로 유익한 특성을 강화하고, 적대적 프롬프트와 해로운 파인튜닝 이후에도 유지되는지 시험했다.
전 DeepMind 연구원 데이비드 실버가 인간 데이터 없이 강화학습만으로 범용 지식을 학습하는 AI를 개발하는 Ineffable Intelligence를 설립, 51억 달러 밸류에이션으로 11억 달러를 조달했다.
이 글이 큰 이유는 강화학습 계열의 핵심 연구자가 또 다른 데모가 아니라 새 연구소로 판을 갈아엎으려 하기 때문이다. Reuters 보도에 따르면 Ineffable은 11억달러 시드와 51억달러 가치로 출발했고, 회사는 인간 데이터가 아니라 경험에서 지식을 뽑아내는 “슈퍼러너”를 전면에 내세웠다.
중요한 점은 post-training agent 경쟁이 inference speed뿐 아니라 reinforcement learning throughput에 달려 있다는 데 있다. NVIDIA는 NeMo RL의 FP8 path가 Qwen3-8B-Base에서 RL workload를 1.48x 빠르게 하면서 BF16 accuracy를 따라간다고 제시했다.
RAD-2는 diffusion 기반 driving planner를 generator-discriminator 구조로 다시 짰다. imitation-only training이 약한 지점에 reinforcement learning feedback을 넣었고, strong diffusion planner 대비 collision rate 56% 감소와 complex urban traffic 실주행 배치를 보고했다.
Cursor는 2026년 3월 26일 real-time RL을 통해 5시간마다 개선된 checkpoint를 배포할 수 있다고 밝혔다. Cursor의 3월 27일 technical report는 Composer 2가 Kimi K2.5 기반 continued pretraining과 realistic Cursor session에서의 대규모 RL을 결합하며, CursorBench 61.3, SWE-bench Multilingual 73.7, Terminal-Bench 61.7을 기록했다고 설명한다.