LLM X/Twitter Aug 3, 2026 1 min read Kimi K3, DeepSWE에서 Fable 5 대비 달러당 해결 작업 2.8배 코딩 에이전트 평가는 이제 pass@1만으로 부족하다. Together AI는 DeepSWE 분석에서 Kimi K3가 Fable 5에 근접한 pass@1을 보이면서 rollout 비용은 약 3분의 1이었다고 밝혔다. #kimi-k3#deepswe#benchmarks 15
LLM X/Twitter May 28, 2026 1 min read DeepSWE 113개 과제, 코딩 에이전트 격차를 70% 대 54%로 벌린 새 평가 벤치마크 오염 없는 113개 장기 코딩 과제가 공개 벤치마크의 촘촘한 순위를 흔들었다. DeepSWE에서는 GPT-5.5가 70.0%, Claude Opus 4.7이 54.2%를 기록했다. #deepswe#coding-agents#benchmark 28