ロボットの「脳みそ」はどこに置くべきか?――フィジカルAIの甘い夢と、冷徹な物理の壁

「人型ロボットが自分の頭で考え、人間のようにテキパキと動き回る」――SF映画で何十年も描かれてきたそんな未来が、いよいよ現実味を帯びてきたように見えます。ChatGPTのような画面の向こうの知能が、ついに「身体」を手に入れて物理世界に降り立とうとしているからです。

ですが、ちょっと立ち止まって考えてみてください。そのロボットの「脳みそ」、本当に全部体の中に収まるのでしょうか?

米調査会社SemiAnalysisのレポート「Where Does a Robot Think – On-Device vs Datacenter Inference

」を読み解くと、世間の熱狂とは裏腹に、開発者たちが「物理法則」と「製造コスト」という分厚い壁に直面している現実が浮かび上がってきます。


「モデル優先」の贅沢は、もう通用しない

これまでのLLM(大規模言語モデル)の開発は、言ってしまえば「モデル至上主義」でした。巨大テック企業は惜しげもなく計算資源とデータを注ぎ込み、モデルが完成してから「さて、これをどうやって動かそうか」と推論サーバーを整えてきました。画面の前の私たちが返答を数秒待たされたところで、世界が滅びるわけではありません。

ところが、相手が「物理世界で動くロボット」になると、ゲームのルールが180度ひっくり返ります。

まず、時間の猶予がゼロです。ロボットの手足はミリ秒単位の超高速な制御ループで動いています。思考に1秒でもモタつけば、目の前の段差を踏み外すか、壁に激突して壊れてしまいます。

もう一つが生々しいコストの壁です。Webサービスならサーバー代を大勢のユーザーで頭割りできますが、ロボットに積むチップの費用は、機体の製造原価(ハードウェア原価)にそのまま乗っかってきます。1台に何百万円もの超高性能チップを積んでいたら、量産化なんて夢のまた夢です。

フロンティアLLMが数兆パラメータへと巨大化する一方で、最先端のロボットモデル(Physical Intelligenceの「π0.7」で50億、NVIDIAの「DreamZero」で140億パラメータ程度)が拍子抜けするほど小さく留まっているのは、まさにこの「物理的な制約」があるからなのです。


なぜ、ロボットの頭脳を全部載せられないのか?

「そうは言っても、最近のエッジ向けAIチップは十分速いのでは?」と思うかもしれません。ですが、ロボットが要求する計算の中身は、言語モデルとは根本的に異なります。

ChatGPTのようなテキストモデルは、文章が長くなるほど過去の記憶(KVキャッシュ)を読み出す「メモリの速度(帯域幅)」がボトルネックになります。一方、ロボットは違います。目まぐるしく変わるカメラ映像から未来の動きを映像として予測しながら行動を決めるため、純粋な「計算力(FLOPs)」を力任せに要求してくるのです。

現在最高峰のエッジ向けSoCであるNVIDIAの「Jetson Thor」ですら、データセンター向けGPU(B200)と比べれば10分の1以下の計算力しかありません。未来予測を伴う重いモデルをThor単体で無理やり動かそうとすれば、思考速度は1秒に1回以下まで失速し、立っていることすらできなくなります。

おまけにバッテリーの問題もあります。人型ロボットのバッテリーはせいぜい2kWh程度で、普通に歩くだけでも数百Wを消費します。そこにデータセンター級の爆熱GPU(1kW以上)を積み込んだらどうなるか。水冷装置で機体は重くなり、バッテリーはわずか数分で干上がってしまいます。


必然の答え――「二層分離」のハイブリッド思考

では、どうすればいいのか。業界が導き出しつつある現実解は、生物の神経系と同じ「思考の二層分離(カスケード)」です。

  • クラウドの脳(プランニング層): データセンターの巨大GPUで動かす。「部屋のどこにコップがあり、どういう手順で片付けるか」といった大局的な状況判断や計画を担当。1秒間に数回程度の更新で十分なので、通信のわずかな遅延は問題になりません。
  • 機体の脳(アクション層): ロボット本体の小型省電力チップで動かす。クラウドから届いた大まかな計画をもとに、「指先の力をどう調整するか」「バランスをどう保つか」を1秒間に数百回という超高速ループで実行。万が一通信が途切れても、その場で安全に止まる反射神経を持たせます。

「完全に独立して自律稼働するロボット」という言葉の響きは魅力的ですが、現在の半導体とバッテリーの技術では、知能のすべてを機体に押し込むのは工学的に無理があるのです。


競争の主戦場は「機体」から「通信インフラ」へ

この「外部化」を受け入れた瞬間、ロボティクスの競争軸は大きく変わります。

これまでスマホのネットワークは「動画をダウンロードする(下り)」ために作られてきましたが、クラウド頼みのロボットは「超高解像度のセンサー映像を絶え間なく送り続ける(上り)」という、真逆の通信環境を求めます。人間向けの綺麗な映像ではなく、「AIがいかに低容量で周囲を正しく認識できるか」に特化したカメラ設計や、絶対に途切れない通信基盤が生命線になるわけです。

「人間と同じように単独で考え、動くロボット」という物語は、一度横に置いておくべきでしょう。

これから市場を制するのは、ロボット単体の見栄えやスペックを誇示する企業ではありません。「どこまでを機体に残し、どこからをデータセンターへ逃がすか」という分散処理の境界線を最もクレバーに引けたプレイヤーです。

フィジカルAIの正体は、独立したロボットではなく、データセンターという巨大な神経網の末端にぶら下がった「物理インターフェース」なのかもしれません。

Contents