全身制御ヒューマノイドの基盤モデルGemini Robotics 2が示す新局面

要約
Google DeepMindが発表したGemini Robotics 2は、脚・胴体・腕・指先を単一ポリシーで動かすVLAモデルとして注目を集めています。この記事では発表の事実と技術的な位置づけを整理し、製造業・物流業の自動化投資判断への影響を具体的に読み解きます。
ロボティクス分野でひとつの節目となりうる発表がありました。Google DeepMindが公開した「Gemini Robotics 2」は、ヒューマノイドの全身を単一のAIモデルで動かすアプローチを採用しています。
これまでのロボット制御では、腕・脚・胴体それぞれに専用のプログラムや個別モデルを用意するのが一般的でした。その構造を根本から変えようとしている点が、今回の発表の核心です。
この記事の対象読者
- 製造業・物流業でロボット導入や自動化投資を検討している経営層・IT責任者
- フィジカルAIや生成AI基盤モデルの動向を追っているエンジニア・研究者
- NEDOなどの公的プログラムを活用したロボット・AI開発を検討している事業担当者
- VLAモデルやヒューマノイド制御の技術的な背景を把握したい方
Google DeepMindが発表した「Gemini Robotics 2」の概要
モデルの入出力と制御方式

Google DeepMindが発表したGemini Robotics 2は、カメラ映像と音声指示をリアルタイムで運動指令に変換します。VLA(Vision-Language-Action)モデルと呼ばれる方式です。
従来のVLAモデルはアームなど上半身の部分制御にとどまるケースが多くありました。Gemini Robotics 2は脚・胴体・腕・指先までを単一の学習済みポリシーで統合制御できる初のモデルとされています。
- 入力: カメラ映像(視覚情報)+音声による自然言語指示
- 出力: 全身の運動指令(脚・胴体・腕・指先を包括)
- 制御方式: 単一の学習済みポリシー(individual subsystemへの分割なし)
- 対象ハードウェア: 全身制御ヒューマノイドロボット
- 位置づけ: フィジカルAIの基盤モデルとして発表
そもそもフィジカルAIとは何か
「フィジカルAI」とは、デジタル空間ではなく物理空間でリアルタイムに動作するAIを指す概念です。言語モデルや画像生成AIとは異なり、センサー情報の認識から身体動作の生成まで一貫して扱う点が特徴といえます。

基盤モデル競争がフィジカルAI領域に波及した背景
言語・画像で起きたことがロボットにも及ぶ
言語・画像の領域では、GPTやGeminiなどの大規模基盤モデルが台頭しました。「ひとつのモデルが多様なタスクをこなす」構造が定着したのです。
同じ流れがロボティクスに及んでいるのが、2026年時点の状況です。
これまでロボット制御は「タスクごとに専用プログラムを書く」アプローチが主流でした。基盤モデルの登場は、その前提を問い直しつつあります。
到達点であり、競争加速のシグナルでもある
Google DeepMind以外にも複数の研究機関・企業がVLAモデルの開発を進めています。Gemini Robotics 2の発表はひとつの到達点であると同時に、競争の加速を示すシグナルでもあります。
| 制御アプローチ | 特徴 | 課題 |
|---|---|---|
| タスク別専用プログラム | 特定動作の精度が高い | タスクが変わるたびに再プログラミングが必要 |
| 部位別個別モデル | 各部位を独立して最適化できる | 全身協調動作の設計コストが高い |
| VLA基盤モデル(Gemini Robotics 2など) | 単一モデルで全身・多様タスクに対応できる可能性 | 実環境での安全性・信頼性の検証が途上 |
製造業・物流業の自動化投資判断に何が変わるか
最大のコストは再プログラミングと再検証
私たちが製造業・物流業の現場で接してきた範囲では、ロボット導入の最大のコストは再プログラミングと再検証に集中しがちです。タスクが変わるたびに、この工程が発生します。
汎用の基盤モデルが普及すれば、この構造的なコストが変わる可能性があります。ただし、それはあくまで「可能性」の話です。
国内導入に固有の障壁
国内導入に向けては、既存設備との互換性・安全認証・国内規制対応という独自の障壁があります。海外での技術進展がそのまま現場に直結するわけではありません。
- 互換性確認: 既存の生産設備・搬送機器とヒューマノイドが物理的・通信的に共存できるか
- 安全認証: 労働安全衛生法や機械安全規格(ISO10218など)への適合確認
- 規制対応: 国内の自律型ロボット運用に関する行政指針の動向把握
- 人材確保: VLAモデルを現場に適応させるためのMLOps・ロボティクスエンジニアの内製化または外部連携
- 投資タイミング: 技術の成熟度と補助金・公的支援プログラム(NEDOのP26013など)の活用可否の見極め
NEDOがフィジカルAIを国策に据えたP26013公募の動向については、別記事「NEDOがフィジカルAIを国策に据えた。P26013公募が示す日本のAI基盤戦略の転換点」で詳しく整理しています。公的支援と民間技術の両軸を踏まえた投資判断を検討している方は参照してみてください。

よくある質問
Gemini Robotics 2は既にロボットに搭載して購入できますか?
2026年8月8日時点では、製品として一般販売されている情報は確認できていません。Google DeepMindによる研究・技術発表の段階であり、商用展開の具体的なスケジュールは公表されていません。
VLAモデルとこれまでのロボット制御AIは何が違うのですか?
従来のロボット制御AIは、「溶接」「ピッキング」など特定タスクに特化した専用モデルが主流でした。VLAモデルは視覚と言語の両方を入力として受け取り、動作指令を柔軟に「生成」します。Gemini Robotics 2はさらに全身の協調動作まで単一モデルで担う点が従来モデルとの大きな違いです。
フィジカルAI基盤モデルの普及で、既存のロボットSIerや自動化ベンダーの役割は変わりますか?
汎用基盤モデルが台頭しても、現場環境への適応・安全認証・既存設備との統合という工程はなくなりません。役割の重心は「タスク別プログラミング」から「基盤モデルの現場チューニングと検証」へ移行していくとみられます。SIerには新たな専門性が求められるでしょう。
日本の製造業がGemini Robotics 2のような技術を活用するには、まず何から始めるべきですか?
今すぐ導入検討を始めるよりも、まず「自社のどの工程でタスク変更頻度が高いか」を棚卸しすることが先決です。汎用基盤モデルの恩恵が最も出やすいのは、段取り替えや品種切り替えが多い工程です。その上でNEDOなど公的プログラムの公募情報を追いながら、技術の成熟度と投資タイミングを見極める流れが現実的といえます。
フィジカルAIと生成AIは何が違いますか?
生成AIはテキスト・画像・音声などデジタルコンテンツを出力します。フィジカルAIはロボットや機械の「物理的な動作」を出力する点が根本的な違いです。誤った出力がデジタル空間にとどまらず、物理的な事故に直結しうるため、安全性・信頼性の基準が格段に高くなります。
あわせて読みたい
Gemini Robotics 2の登場は、基盤モデル競争が言語・画像領域に続いた出来事です。フィジカルAI領域にも本格的に波及してきたことを示しています。
製造業・物流業の現場にとって、今すぐ何かを変える必要はないかもしれません。ただ、意思決定の軸が変わりつつある流れは把握しておく価値があります。
まず自社の工程を一覧にして、品種切り替えや段取り替えが多い工程を1つ書き出してみてください。基盤モデルの恩恵が出やすい箇所を見極める第一歩になります。
この記事の分類
同じ分類の記事をまとめて読めます。
次に読む記事

NEDOがフィジカルAIを国策に据えた。P26013公募が示す日本のAI基盤戦略の転換点
NEDOは2026年度、マルチモーダル基盤モデルとフィジカルAIの開発支援を正面から掲げたP26013公募を実施しました。採択先が今後の国産AI基盤の勢力図を左右する可能性があり、AI調達戦略を検討する企業が今から注視すべき理由を整理します。

Gemini 3.6 Flash正式リリース。出力トークン17%減がエージェント運用を変える
Google DeepMindがGemini 3.6 Flashを正式公開した。出力トークン消費を前世代比17%削減し、ツール連携・多段階ワークフローの処理効率が向上している。AIエージェントの全社展開でトークンコストが予算超過の主因になっている企業にとって、導入判断に直結する変更点を整理する。

DeepMind中核2人が同時離脱。Geminiロードマップと日本企業の問い
Demis HassabisとJeff Deanという2人の中核人材が同時期にGoogleを去ったと報じられています。この経営シグナルが示すGeminiロードマップへのリスクを整理し、Google CloudやGemini APIに依存する日本企業がマルチLLM・マルチクラウド戦略をどう具体化すべきか、実務的な観点から考察します。















