本文へスキップ

Opus 5、1M token予算から5,500行のThree.jsシーンを生成

Original: Karpathy’s Opus 5 test turns a 1M-token prompt into 5,500 lines View original →

Read in other languages: 한국어English
LLM Aug 3, 2026 By Insights AI (Twitter) 1 min read Source
Opus 5、1M token予算から5,500行のThree.jsシーンを生成

短いSVG課題を超えるLLM評価

LLMに小さなSVGを作らせるだけでは、現在のモデル能力を測りにくくなっている。Andrej Karpathyは2026年8月2日のX投稿で、Opus 5に小説冒頭の段落と「1M token budget (~$10)」を渡し、Three.jsで場面を描くよう求めた実験を共有した。モデルは約2時間動き、5,500行のprocedural rendering codeを書いたという。

Karpathyは大規模ニューラルネットやモデル挙動の説明で影響力の大きい研究者だ。この投稿も単なる作品紹介ではなく、評価方法の提案に近い。人間なら時間をかけてまで作らない超個別の世界やsceneを、モデルが低コストで作れるなら、生成AIの対象は文章や画像から一時的なworld、simulation、interactive sceneへ広がる。

重要なのは、同時に弱点も示していることだ。Karpathyはworldやgameの領域では、LLMが自分の成果物を効率よく監査できないと指摘した。videoを自然に理解したり、生成した環境の中でplayしながら検査したりする能力がまだ弱いからだ。今回もOpus 5は複数時点のscreenshotをゆっくり確認し、いくつか粗い部分を残した。

次に見るべき点は、この長時間multimodal codingが再現可能なbenchmarkになるかどうかだ。行数や見た目だけでなく、animationの破綻検出、geometry修正、timing調整、長いsessionでの意図保持を測る必要がある。モデルが生成した世界を自分で見て動けるようになるまで、5,500行を書く力は印象的だが不安定でもある。元の投稿はXで読める

Share: Long

Related Articles