145개 coding eval 결과에 r/LocalLLaMA가 Kimi K2.6·Opus 4.7을 따졌다
r/LocalLLaMA가 이 글에 반응한 이유는 leaderboard 숫자보다, Opus 4.7의 체감 악화와 Kimi K2.6의 실제 coding agent 운용 가능성이 충돌했기 때문이다.
태그
#benchmarks 태그가 달린 기사
r/LocalLLaMA가 이 글에 반응한 이유는 leaderboard 숫자보다, Opus 4.7의 체감 악화와 Kimi K2.6의 실제 coding agent 운용 가능성이 충돌했기 때문이다.
새 arXiv preprint는 평가 결과의 consequences를 암시하는 한 줄만으로 LLM judge가 더 관대해졌다고 보고했다. 자동 safety·quality benchmark의 취약점이 드러났다.
r/LocalLLaMA가 이 글에 반응한 이유는 숫자가 구체적이었기 때문이다: RTX 5070 Ti에서 128K context와 79 t/s를 만든 핵심이 flag 하나로 좁혀졌다.
MM-WebAgent는 AI가 만든 웹페이지가 왜 그럴듯한 조각들의 조합에 머무는지 겨냥한다. 계층형 planning, self-reflection, benchmark, code/data 공개를 통해 code-only 평가를 넘어 multimodal page coherence를 재는 틀을 제시했다.
r/singularity의 Opus 4.7 thread가 뜨거웠던 이유는 41.0%라는 숫자보다 그 숫자의 원인을 둘러싼 해석 싸움이었다. NYT Connections extended benchmark에서 Opus 4.6의 94.7%와 대비되자, community는 capability regression과 refusal tuning을 나눠 보려 했다.
r/LocalLLaMA가 Qwen3.6 release 자체보다 GGUF quant 선택과 CUDA 버그에 더 크게 반응했다. Unsloth의 benchmark post는 KLD, disk space, 4bit gibberish, CUDA 13.1/13.3 같은 실제 실행 조건을 전면에 올렸다.
새 arXiv 논문은 낮은 평균 오류율 뒤에 LLM judge의 per-document 불안정성이 숨어 있음을 보였다. SummEval에서 문서 33-67%가 directed 3-cycle을 하나 이상 보였고, prediction set width는 absolute error와 강하게 맞물렸다.
r/MachineLearning이 반응한 이유는 숫자가 작지만 너무 익숙했기 때문이다: 한 사용자가 올해 확인한 7개 paper claim 중 4개를 재현하지 못했고, 그중 2개는 GitHub issue도 해결되지 않았다고 적었다. 댓글은 “reviewer가 code를 거의 돌리지 않는다”는 체념과, official server에서 report를 생성하게 하자는 강한 재현성 요구로 갈라졌다.
HWE-Bench는 LLM agent 평가를 작은 HDL 문제에서 repository-scale hardware repair로 옮겼다. 최고 agent는 전체 70.7%를 해결했지만, 복잡한 SoC-level project에서는 65% 아래로 떨어졌다.
AIBuildAI는 MLE-Bench에서 63.1% medal rate를 보고하며 AI model 제작 agent의 기준선을 끌어올렸다. 핵심은 AutoML의 일부 최적화가 아니라 설계, coding, debugging, training, tuning을 하나의 workflow로 묶었다는 점이다.
중요한 점은 Anthropic이 Opus를 더 긴 자율 코딩 작업에 맞추면서도 가격을 올리지 않았다는 데 있다. 연결된 페이지는 Opus 4.7이 CursorBench에서 70%를 기록해 Opus 4.6의 58%를 넘겼고, API 가격은 입력 100만 토큰당 5달러와 출력 100만 토큰당 25달러로 유지된다고 적었다.
IBM Research의 VAKRA는 agent benchmark를 static Q&A에서 실행 가능한 tool environment로 옮겼다. 62 domains, 8,000+ locally hosted APIs, 3-7 step reasoning chains가 들어가며, 결과는 agent reliability가 아직 tool demo 수준을 넘기 어렵다는 쪽에 가깝다.