本文へスキップ

Gemini Robotics 2、焦点は手先から全身制御へ

Original: Gemini Robotics 2 brings whole body intelligence to robots View original →

Read in other languages: 한국어English
Humanoid Robots Jul 30, 2026 By Insights AI (HN) 1 min read 1 views Source

Gemini Robotics 2で目立つのは、ロボットが言葉を理解するという話だけではない。Google DeepMindは今回、vision-language-action(VLA)、embodied reasoning(ER)、on-device VLAという三つのモデルを組み合わせ、歩く、しゃがむ、手を伸ばす、物をつかむといった全身動作まで扱う方向を示した。

中心になるGemini Robotics 2は、視覚と言語の入力をmotor controlへ変換するVLAモデルだ。Gemini Robotics ER 2は高レベルの計画や人とのやり取りを担当し、On-Device 2はネットワーク遅延や接続性の制約がある現場向けにローカル実行を狙う。DeepMindは、新しいbi-arm robot embodimentにも数時間、通常200未満の例で適応できるとしている。

発表ではApptronikのApollo 2を使い、じょうろを持って棚の下段へ置くような、移動と操作がつながった例が紹介された。手先の器用さも重要なテーマで、22 degree-of-freedomの五指ハンドで結び目を作ったりziplock bagを閉じたりする例、Franka Duoの二本指gripperで詰め込み作業を行う例が挙げられている。

HNでの反応は、期待だけではなく実装上の疑問も含んでいた。Googleがfrontier model、open weight model、画像・動画・音楽生成に加えてroboticsにも力を入れている点を評価する声がある一方、LLMをactuationに近い場所で動かすとlatencyや安定性の問題が出るという指摘もあった。動作制御には従来型の制御理論との組み合わせが欠かせない、という見方だ。

安全面ではASIMOV-Agentic benchmarkが追加された。unsafe tool callの拒否、実行可能性の判断、不確実な場面で人間の介入を求める能力を測るものだ。ER 2は人の接近を検知して安全停止する能力も強調されている。これは家庭用ロボットの完成発表ではなく、身体を持つAIが計画、器用さ、転移、安全をどう結びつけようとしているかを示す節目である。出典はDeepMindHN議論

Share: Long

Related Articles

Humanoid Robots Hacker News Apr 16, 2026 1 min read

HNが見ていたのはmodelそのものより、「物理世界で使えるreasoningはどれだけ速くなければならないか」だった。Google DeepMindはGemini Robotics-ER 1.6をspatial reasoning、multi-view understanding、success detection、instrument reading向けのpreviewとして示し、コメント欄ではgauge-reading demo、latency、実deploymentの距離が議論された。