본문으로 건너뛰기
부식 중

145개 coding eval 결과에 r/LocalLLaMA가 Kimi K2.6·Opus 4.7을 따졌다

r/LocalLLaMA가 이 글에 반응한 이유는 leaderboard 숫자보다, Opus 4.7의 체감 악화와 Kimi K2.6의 실제 coding agent 운용 가능성이 충돌했기 때문이다.

원문: Kimi K2.6-Code-Preview, Opus 4.7, GLM 5.1, Minimax M2.7 and more tested in coding 원문 보기 →

LLM 레딧 작성자 Insights AI (Reddit) 1분 소요 46 조회 출처

Community Spark

r/LocalLLaMA의 post는 Kimi K2.6-Code-Preview, Opus 4.7, GLM 5.1, Minimax M2.7 등을 coding eval로 비교했다는 내용으로 50 points를 넘겼다. 작성자는 SanityHarness와 SanityHarness leaderboard를 운영하며, old/new leaderboard를 합쳐 145개 results를 갖고 있다고 설명했다.

작성자가 제시한 방법

post에 따르면 SanityHarness는 coding-agent-agnostic eval을 목표로 하며, six languages의 tasks를 sandboxed Docker containers에서 실행한다. GitHub README는 compact but challenging problems, weighted scoring, BLAKE3 verification, hidden tests, bubblewrap sandboxing 같은 요소를 설명한다. 작성자는 이번 pass에서 Kimi K2.6-Code-Preview를 early access로 테스트했고, Opus 4.7, GLM 5.1, Minimax M2.7과 함께 비교했다고 적었다.

흥미로운 결과

작성자의 평가는 단순 ranking이 아니었다. Opus 4.7은 eval score는 높지만 실제 coding use에서는 hallucination과 stubborn wrongness가 심하다고 강하게 비판했다. Kimi K2.6은 Kimi K2.5보다 나아 보이며 GLM 5.1보다 약간 높게 본다고 썼다. Minimax M2.7과 Qwen 3.6 Plus 같은 middle tier도 price와 local-running 맥락에서는 유용하지만, upper tier 모델과는 여전히 차이가 있다고 정리했다.

댓글이 보탠 맥락

댓글들은 benchmark와 실제 사용 사이의 간격을 계속 물었다. 한 댓글은 Kimi-for-coding backend가 사용자가 지정한 model ID를 정말 존중하는지 불확실하다고 지적했고, 다른 댓글은 C/C++/Rust/LISP/math 같은 자기 use case에서는 GPT와 Gemini 3.1 Pro가 더 잘 맞는다고 말했다. 커뮤니티가 끌린 지점은 “누가 1등인가”가 아니라, coding agent eval이 provider routing, framework UX, cost, 실제 prompt behavior까지 얼마나 설명할 수 있는가였다.

Sources: r/LocalLLaMA discussion, SanityHarness leaderboard, SanityHarness GitHub.

공유: 긴글

관련 기사

LLM X/Twitter

Cursor, 사전학습 연장부터 실제 워크플로 RL까지 Composer 2 학습 스택 공개

Cursor는 2026년 3월 26일 real-time RL을 통해 5시간마다 개선된 checkpoint를 배포할 수 있다고 밝혔다. Cursor의 3월 27일 technical report는 Composer 2가 Kimi K2.5 기반 continued pretraining과 realistic Cursor session에서의 대규모 RL을 결합하며, CursorBench 61.3, SWE-bench Multilingual 73.7, Terminal-Bench 61.7을 기록했다고 설명한다.

2분 소요 49 조회
LLM 해커뉴스

Hacker News가 주목한 ATLAS, local coding agent 비용 모델에 던지는 질문

Hacker News에서 화제가 된 ATLAS는 consumer GPU 기반 local coding agent의 비용 효율을 크게 강조한다. 다만 README의 74.6% LiveCodeBench 수치는 best-of-3 plus repair 파이프라인과 다른 task 수를 전제로 하므로, Claude 4.5 Sonnet과의 비교는 비통제 비교로 읽어야 한다.

2분 소요 47 조회