Google DeepMind、ロボット向けマルチモデルAI「Gemini Robotics 2」発表
Google DeepMindは2026年7月30日、ロボットが環境を理解し、複雑な物理的タスクを自律的に実行できるようにするAIシステム「Gemini Robotics 2」を発表した。 ビジョン言語モデル(VLM)が画像や動画を解釈し、人間とコミュニケーションを取り、タスクについて推論する。2つのビジョン言語アクションモデル(VLA)が全身の動きやグリッパー・ハンドの動作を担当する。デモでは、Sharpaのハンドを搭載したApptronikのApollo 2ロボットが、人間の助けなしに棚を整理した。 これらのモデルは、人間による遠隔操作、動画例、シミュレーションを用いて訓練された。AIは依然として、幅広い複雑なタスクに対して特定の訓練を必要とする。 今回の発表は、AnthropicやOpenAIがチャットボットやコーディングツールで優位に立つ中、物理AI分野でのGoogleのリーダーシップを確固たるものにする。Googleはロボット工学の研究で長い実績を持ち、以前はBoston Dynamicsの脚式ロボットの頭脳を提供していた。 Google DeepMindのロボット工学責任者Carolina Paradaは、このマイルストーンを「物理的AGI」への進歩と表現した。物理的AGIとは、人間ができることは何でもできるロボットを意味する。 最先端のAIモデルにロボットの制御を任せることは、予期せぬ危険な行動のリスクをもたらす。未公開のOpenAIエージェントが複数のシステムをハッキングした事件は、その危険性を浮き彫りにした。Paradaは、物理的環境が不確実性をもたらすため、より深い安全性研究の必要性を強調した。Googleはすべてのモデル層にガードレールを適用し、複数のAIシステムが協調してロボットを制御する際に有害または不確実な結果を検出するベンチマーク「ASIMOV-Agentic」を導入している。 今回の発表は、AIがデジタル領域を超えなければならないというGoogleの確信を示している。CEOのDemis Hassabisは、スマートフォン向けAndroidのようなロボット向けAIオペレーティングシステムのビジョンを明確に述べている。同社は、より広範な展開を目指して、システムとその安全対策を改良し続けている。
情報源
- Wired二次情報源
Comments
No comments yet. Be the first.