Zero-shot World Modelsにr/MachineLearningが突っ込んだchild comparison
Original: Zero-shot World Models Are Developmentally Efficient Learners [R] View original →
r/MachineLearning threadで取り上げられたのは、Zero-shot World Models Are Developmentally Efficient Learnersという論文だ。現在のAI systemはvisual competenceに膨大なdataを必要とする一方、子どもは限られた経験からdepth、motion、object coherence、physical interactionを理解し始める。この対比が投稿のhookになった。
論文が提案するのはZero-shot Visual World Model、ZWMだ。arXiv abstractによれば、appearanceとdynamicsを分けるsparse temporally-factored predictor、approximate causal inferenceによるzero-shot estimation、そしてinferenceを組み合わせて複雑な能力を作ることが中心原理になっている。single childのfirst-person experienceから学習し、複数のphysical understanding benchmarkで能力を示すという。
Redditの反応は好奇心だけでは終わらなかった。上位コメントは、子どもはrandom weightsから始まるわけではないと指摘した。genetics、early development、長い進化で形作られたnetwork topologyがあり、その上に学習が乗るという見方だ。別のコメントは、Single-child BabyViewが約132 hoursなら、なぜそれをより長く生きた子どもの能力と比べるのかと問うた。
このskepticismは論文を弱めるというより、読むべき論点を分けてくれる。ひとつはtechnical claimで、限られたegocentric visual dataからphysical structureを学び、zero-shotで新しいtaskへgeneralizeできるか。もうひとつはdevelopmental claimで、それを子どもの理解とどこまで比較できるかだ。前者は強くても、後者には慎重な条件づけが必要になる。
このthreadの良さは、「child-like data efficiency」という言葉をそのまま受け取らなかった点にある。data-efficient AIは重要な目標だが、子どもにはbiological priorsとembodied historyがある。その差を見た上で読むと、ZWMの問いはむしろ鋭くなる。少ないdataで多くを推論するには、どんな構造が必要なのか。
Related Articles
Bristol Myers Squibbは、8台のDGX Vera Rubin NVL72 systemで2基目のDGX SuperPODを導入する。既存AI clusterでtarget identificationの手作業を数週間削減した後、drug discovery全体にcomputeを広げる動きだ。
DOEのlight source施設では、データ生成速度が人手の解析を超え始めている。MetaはBerkeley LabのSYNAPS-IがSAM 3とDINOv3を使い、毎秒100,000枚級のdetector画像に対応すると説明した。
Google ResearchのSymptomAI研究は、整理済みの医療ケースではなく13,917人の実際の症状対話を評価対象にした。焦点は回答精度だけでなく、問診設計、臨床医比較、Fitbitのbiosignalとの照合に移っている。