본문으로 건너뛰기

태그

#benchmarks

#benchmarks 태그가 달린 기사

RSS 피드
과학 레딧

7개 논문 claim 중 4개 재현 실패, r/MachineLearning이 다시 뜨거워졌다

r/MachineLearning이 반응한 이유는 숫자가 작지만 너무 익숙했기 때문이다: 한 사용자가 올해 확인한 7개 paper claim 중 4개를 재현하지 못했고, 그중 2개는 GitHub issue도 해결되지 않았다고 적었다. 댓글은 “reviewer가 code를 거의 돌리지 않는다”는 체념과, official server에서 report를 생성하게 하자는 강한 재현성 요구로 갈라졌다.

1분 소요 46 조회
AI X/Twitter

Claude Opus 4.7, CursorBench 70%로 4.6의 58%를 넘기고 Opus 가격 유지

중요한 점은 Anthropic이 Opus를 더 긴 자율 코딩 작업에 맞추면서도 가격을 올리지 않았다는 데 있다. 연결된 페이지는 Opus 4.7이 CursorBench에서 70%를 기록해 Opus 4.6의 58%를 넘겼고, API 가격은 입력 100만 토큰당 5달러와 출력 100만 토큰당 25달러로 유지된다고 적었다.

2분 소요 40 조회