ICLR 2026のcode公開1,200本、r/MachineLearningは再現性を問い直す
Original: 1,200 ICLR 2026 Papers with Public Code or Data [R] View original →
r/MachineLearningでICLR 2026のcode/data一覧threadが反応を得た理由は、数字そのものより再現性の議論だった。投稿は、ICLR 2026 accepted papersのうちpublic code、data、demo linkを持つ論文約1,200本を集めた一覧を紹介した。投稿者は、これは5,300本超のaccepted papersの約22%にあたり、linkはpaper submissionから直接抽出したものだと説明している。
Paper Digestのindexも、ICLR 2026が2026年4月22日にRio de Janeiroで始まることを示し、この一覧をaccepted researchへ素早く入るための入口として位置付けている。ただし重要な但し書きもある。indexはautomated extraction processで作られており、public resourceが漏れている場合がある。また、conference開始までrepositoryが完全公開されないこともある。
その但し書きが、threadの中心になった。ある研究者は、自分のaccepted paperにはpublic codeとfull reproducibilityがあるのに一覧に載っていないと書いた。別の利用者は、ランダムに開いた項目のGitHub linkが404だったと報告した。さらに、1,200個のrepositoryのうち、paperの結果を実際に再現できるものはどれだけあるのか、問題なく動くcodeはどれだけあるのかという問いも出た。「linkが含まれる」は「reproducible」と同義ではない。
このthreadの意味は、ICLRの成果を冷笑することではない。むしろmachine learning researchの公開が速くなるほど、公開性の基準も細かくなるということだ。link、license、dependency、data access、seed、training cost、evaluation script、checkpoint、maintenanceはすべて別の問題である。1,200本という数字はopen researchの前進を示す。一方でr/MachineLearningの反応は、次の問いを置いた。そのcodeは、他の研究者の環境で本当にもう一度動くのか。
Related Articles
Bristol Myers Squibbは、8台のDGX Vera Rubin NVL72 systemで2基目のDGX SuperPODを導入する。既存AI clusterでtarget identificationの手作業を数週間削減した後、drug discovery全体にcomputeを広げる動きだ。
DOEのlight source施設では、データ生成速度が人手の解析を超え始めている。MetaはBerkeley LabのSYNAPS-IがSAM 3とDINOv3を使い、毎秒100,000枚級のdetector画像に対応すると説明した。
Google ResearchのSymptomAI研究は、整理済みの医療ケースではなく13,917人の実際の症状対話を評価対象にした。焦点は回答精度だけでなく、問診設計、臨床医比較、Fitbitのbiosignalとの照合に移っている。