본문으로 건너뛰기
부식 중

7개 논문 claim 중 4개 재현 실패, r/MachineLearning이 다시 뜨거워졌다

r/MachineLearning이 반응한 이유는 숫자가 작지만 너무 익숙했기 때문이다: 한 사용자가 올해 확인한 7개 paper claim 중 4개를 재현하지 못했고, 그중 2개는 GitHub issue도 해결되지 않았다고 적었다. 댓글은 “reviewer가 code를 거의 돌리지 않는다”는 체념과, official server에서 report를 생성하게 하자는 강한 재현성 요구로 갈라졌다.

원문: Failure to Reproduce Modern Paper Claims [D] 원문 보기 →

과학 레딧 작성자 Insights AI (Reddit) 1분 소요 46 조회 출처

r/MachineLearning의 재현 실패 thread는 거창한 benchmark 숫자보다 더 직접적인 피로감을 담고 있었다. 작성자는 올해 직접 확인 가능한 paper claim 7개를 시도했고, 그중 4개가 irreproducible이었다고 적었다. 또 2개는 GitHub에 active unresolved issue가 있다고 했다. 표본은 작고, 댓글에서도 source link가 없다는 지적이 나왔지만, 166점과 47개 댓글이 붙은 이유는 많은 연구자가 비슷한 경험을 이미 갖고 있기 때문이다.

가장 많은 공감을 받은 반응은 top conference review의 현실을 짚었다. Code가 공유되더라도 reviewer가 실제로 돌려보는 경우는 드물고, paper는 idea가 멋져 보이는지, story가 그럴듯한지에 따라 평가되는 일이 많다는 것이다. 다른 댓글은 CVPR 같은 대형 학회에서도 code가 없거나, 비어 있는 GitHub repo, inference-only script가 흔하다고 했다.

흥미로운 점은 thread가 단순한 불평에서 멈추지 않았다는 것이다. 한 사용자는 author가 official server에서 package 설치, dataset download, train 또는 weight download, evaluate, report PDF 생성을 자동으로 수행하게 해야 한다고 제안했다. make report-from-scratch --fast 같은 식의 재현 pipeline을 conference submission의 일부로 만들자는 주장이다.

이 논쟁의 핵심은 “모든 논문이 사기”라는 과장이 아니다. ML result는 preprocessing, data split, random seed, training detail, hardware 차이에 민감하다. 문제는 그 민감성이 paper 밖에 숨을 때다. r/MachineLearning의 에너지는 재현성 위기가 새롭기 때문이 아니라, model과 benchmark가 커질수록 실패 비용도 커졌기 때문에 다시 올라왔다. 이제 claim은 PDF의 문장만이 아니라, 실행 가능한 artifact로 검증되어야 한다는 압력이 커지고 있다.

공유: 긴글

관련 기사

과학

Claude의 단백질 결합 설계 실증 — 15개 중 14개 타겟, 적중률 업계 평균의 두 배

Anthropic이 8월 18일 Claude Mythos Preview를 활용한 단백질 결합체 설계 연구를 발표했다. 15개 표적 중 14개에서 결합 성공이 확인됐으며, 적중률 26.7%는 업계 표준(10~15%)의 두 배를 기록했다. Adaptyv Bio와 Twist Bioscience의 독립 실험실 검증을 통과했다.

1분 소요 5 조회
과학

수컷 초파리 뇌 16만6000개 뉴런 완전 지도…AI가 이은 1억2500만 시냅스의 최대 커넥톰

16만6000개가 넘는 뉴런과 1억2500만 개 시냅스 연결을 담은 수컷 초파리 뇌·중추신경계 지도가 완성됐다. AI로 전자현미경 절편을 3차원 신경망으로 복원한 이 데이터는 성별에 따른 회로 차이와 감각이 행동으로 이어지는 경로를 한 번에 비교할 기반이다.

2분 소요 3 조회