Google DeepMindは、ヒューマノイドロボットをはじめとする物理マシンの全身制御に特化した新世代AIモデル「Gemini Robotics 2」を正式発表しました。従来の視覚言語モデル(VLM)が主に画面内の画像認識やテキスト処理に留まっていたのに対し、本モデルはデジタル空間での推論と現実空間でのミリ単位の身体制御を直接統合した点が特徴です。
今回の発表では、二足歩行ロボットが不整地を歩行しながら障害物を回避し、物体を屈んで拾い上げる一連のマルチステップ動作をリアルタイムで制御するデモンストレーションが公開されました。物理空間におけるAIの活用(Physical AI)が実験室レベルから産業利用の段階へと急速に移行しています。
デジタル推論と物理動作を直結する基盤モデル
Gemini Robotics 2は、GoogleのフラッグシップAI「Gemini」の高度なマルチモーダル理解力をベースに構築されています。カメラや各種センサから入力される空間データを即座に3次元座標に変換し、関節のトルクや重心移動の計算を極めて低いレイテンシで処理します。
従来のロボティクス開発では、環境を認識するモジュール、移動経路を設計するモジュール、関節を動かすモジュールが個別に開発され、それらを統合するシステム構築に膨大な工数がかかっていました。Gemini Robotics 2ではこれらを単一のニューラルネットワークで直列処理し、環境の変化に対して即座に適応する柔軟性を獲得しています。
複雑なマルチステップタスクの自律遂行能力
公開された実験データによると、Gemini Robotics 2を搭載したロボットは、人間から「部屋を片付けて工具箱にドライバーを収納して」という抽象的な音声指示を受けると、以下のステップを自律的に判断して実行します。
- 部屋全体の配置を3Dスキャンし、散らかった物体の種類を特定
- ドライバーの向きや重心を考慮した最適な把握ポイントを計算
- 足元の段差を回避しながら移動し、適切な力加減で持ち上げて収納
特に注目されているのは、予期せぬ外部干渉に対する復元力です。作業中に人間が物体をずらしたり障害物を置いたりしても、動作を中断することなく瞬時に行動計画を再計算し、タスクを継続します。
産業界およびハードウェアメーカーの反応
今回の発表に対し、自動車製造ラインや物流倉庫の自動化を進める大手メーカーから強い関心が寄せられています。工場や倉庫のような変化の激しい環境下でも、事前のプログラミングなしに即座に適応できる汎用性が評価されています。
また、Figure AIやBoston Dynamicsといったヒューマノイド開発企業にとっても、自社ハードウェアに組み込む制御知能の有力な候補となります。ソフトウェア層をGoogleの強力な基盤モデルに頼ることで、ハードウェアの開発スピードを大幅に加速させる動きが強まっています。
物理AI分野における今後の展望と課題
Gemini Robotics 2の登場により、AI技術の主主戦場は画面上の情報処理から現実空間の自動化へとシフトしつつあります。製造業の省人化や介護現場でのサポート、災害現場における救助活動など、応用範囲は非常に広範囲に及びます。
一方で、実世界での安全確保や事故発生時の責任の所在など、社会実装に向けた課題も残されています。急激に可動範囲を広げるヒューマノイド技術に対し、国際的な安全基準の整備やハードウェア側のフェイルセーフ機構の標準化が求められています。
まとめ
Google DeepMindが発表したGemini Robotics 2は、AIの知能とロボットの身体性を高次元で融合させた最新モデルです。高度な推論力と高い環境適応力を備えた本技術は、今後の産業構造や労働環境に大きな影響を与えることが期待されます。
コメント