SWE-bench Verified 사실상 퇴장, HN이 본 핵심은 점수보다 오염
HN은 이번 글을 벤치마크 보고서보다 사실상의 부고장처럼 읽었다. 누가 몇 점을 찍었는지보다, 오염된 문제와 틀어진 테스트가 코딩 리더보드를 얼마나 빨리 무력화하는지가 더 큰 이야기였다.
카테고리
Insights의 LLM 기사
HN은 이번 글을 벤치마크 보고서보다 사실상의 부고장처럼 읽었다. 누가 몇 점을 찍었는지보다, 오염된 문제와 틀어진 테스트가 코딩 리더보드를 얼마나 빨리 무력화하는지가 더 큰 이야기였다.
이 변화가 큰 이유는 Copilot이 더 이상 가벼운 자동완성 도구 가격표로는 유지되지 않기 때문이다. GitHub는 2026년 6월 1일부터 모든 Copilot 플랜을 AI Credits 기반 토큰 과금으로 바꾸고, 코드 리뷰에는 GitHub Actions minutes까지 붙인다고 적었다.
이 릴리스가 큰 이유는 대형 모델 한 묶음이 닫힌 API가 아니라 느슨한 라이선스로 바로 풀렸기 때문이다. MiMo-V2.5는 1M 토큰 컨텍스트, 상용 사용과 파인튜닝을 허용하는 MIT 라이선스, 그리고 GDPVal-AA·ClawEval 오픈모델 1위를 내세운 Pro 버전을 함께 내놨다.
이 숫자가 중요한 이유는 출시 당일 홍보 문구가 아니라 외부 커뮤니티 평가가 GPT-5.5의 현재 위치를 보여주기 때문이다. Arena는 GPT-5.5가 Search Arena 2위, Expert Arena 5위, Code Arena 9위에 올랐고, 코딩 점수는 GPT-5.4보다 50포인트 뛰었다고 적었다.
이 소식이 중요한 이유는 에이전트 코딩의 병목이 모델 속도보다 사람의 컨텍스트 전환에 있다는 점을 정면으로 건드렸기 때문이다. OpenAI는 Symphony 방식이 일부 팀에서 머지된 PR 수를 500% 끌어올렸고, 엔지니어가 동시에 안정적으로 다룰 수 있는 Codex 세션은 대체로 3~5개 수준이었다고 적었다.
LocalLLaMA가 Hipfire에 몰린 이유는 새 repo 하나가 아니라 RDNA 사용자들이 오래 기다린 “우리 쪽 최적화”에 가까웠기 때문이다. 댓글도 곧바로 실제 카드에서 나온 속도 수치와 호환성 질문으로 채워졌다.
HN은 leaderboard 숫자만 보고 움직이지 않았다. Dirac가 더 적은 토큰, hash-anchored edit, AST 기반 문맥 선택으로 coding agent 성능을 끌어올렸다는 주장에 시선이 몰렸다.
4월 24일 Gemini Drop의 핵심은 새 모델 한 개보다 사용 습관이다. 네이티브 Mac 앱, Notebooks 통합, 글로벌 Personal Intelligence, 무료 3분 Lyria 3 Pro, 인터랙티브 시각화가 Gemini를 상시 도우미 쪽으로 밀어 올린다.
LocalLLaMA가 이 글을 붙잡은 이유는 단순한 사과문이 아니었다. 호스팅 모델에서는 같은 모델을 쓰고 있다고 믿어도, 실제 경험은 기본값과 프롬프트, 세션 관리에 따라 조용히 흔들릴 수 있다는 공포가 다시 확인됐기 때문이다.
LocalLLaMA 반응은 놀람보다 체념에 가까웠다. 결국 공개 벤치마크는 이렇게 무너진다는 분위기였다. 이번엔 오염과 flawed test가 숫자로 정리되면서, 기존 자랑 포인트가 더는 안정적으로 보이지 않게 됐다.
LocalLLaMA가 이 글에 폭발한 이유는 단순한 커뮤니티 싸움이 아니었다. 대형 언센서드 모델 제작자의 비공개 비법이 사실은 Heretic 재포장에 가까웠다는 의혹이, 근거와 함께 한꺼번에 터졌기 때문이다.
Hacker News가 물고 늘어진 건 에이전트의 자백이 아니었다. 스테이징 작업이 프로덕션 볼륨 삭제로 이어졌고, 백업까지 같은 폭발 반경에 묶였다는 점이 스레드의 핵심이었다.