Gemini Robotics 2、焦点は手先から全身制御へ
Original: Gemini Robotics 2 brings whole body intelligence to robots View original →
Gemini Robotics 2で目立つのは、ロボットが言葉を理解するという話だけではない。Google DeepMindは今回、vision-language-action(VLA)、embodied reasoning(ER)、on-device VLAという三つのモデルを組み合わせ、歩く、しゃがむ、手を伸ばす、物をつかむといった全身動作まで扱う方向を示した。
中心になるGemini Robotics 2は、視覚と言語の入力をmotor controlへ変換するVLAモデルだ。Gemini Robotics ER 2は高レベルの計画や人とのやり取りを担当し、On-Device 2はネットワーク遅延や接続性の制約がある現場向けにローカル実行を狙う。DeepMindは、新しいbi-arm robot embodimentにも数時間、通常200未満の例で適応できるとしている。
発表ではApptronikのApollo 2を使い、じょうろを持って棚の下段へ置くような、移動と操作がつながった例が紹介された。手先の器用さも重要なテーマで、22 degree-of-freedomの五指ハンドで結び目を作ったりziplock bagを閉じたりする例、Franka Duoの二本指gripperで詰め込み作業を行う例が挙げられている。
HNでの反応は、期待だけではなく実装上の疑問も含んでいた。Googleがfrontier model、open weight model、画像・動画・音楽生成に加えてroboticsにも力を入れている点を評価する声がある一方、LLMをactuationに近い場所で動かすとlatencyや安定性の問題が出るという指摘もあった。動作制御には従来型の制御理論との組み合わせが欠かせない、という見方だ。
安全面ではASIMOV-Agentic benchmarkが追加された。unsafe tool callの拒否、実行可能性の判断、不確実な場面で人間の介入を求める能力を測るものだ。ER 2は人の接近を検知して安全停止する能力も強調されている。これは家庭用ロボットの完成発表ではなく、身体を持つAIが計画、器用さ、転移、安全をどう結びつけようとしているかを示す節目である。出典はDeepMindとHN議論。
Related Articles
Google DeepMindの新しいロボットモデルは、産業現場の計器読取を23%から93%まで押し上げ、embodied reasoningの前進を数字で示した。4月14日に公開されたGemini Robotics-ER 1.6はGemini APIとGoogle AI Studioでもすぐ試せる。
HNが見ていたのはmodelそのものより、「物理世界で使えるreasoningはどれだけ速くなければならないか」だった。Google DeepMindはGemini Robotics-ER 1.6をspatial reasoning、multi-view understanding、success detection、instrument reading向けのpreviewとして示し、コメント欄ではgauge-reading demo、latency、実deploymentの距離が議論された。
Hugging Faceは2026年3月9日、LeRobot v0.5.0を公開し、初のhumanoidであるUnitree G1対応、新しいrobot learning policy、高速化したdataset pipelineを導入した。Python 3.12+、Transformers v5、EnvHub、NVIDIA IsaacLab-Arena統合も含まれる。