著者:Zen、PANews
9月8日、Antiochという米国のスタートアップが3200万ドルのシリーズA資金調達を完了した。シリコンバレーの著名ベンチャーキャピタルGreylockがリード投資家を務めた。年初に完了した850万ドルのシードラウンドと合わせると、設立からわずか1年余りの同社の累計調達額は4050万ドルに達している。
Antiochの主な方針は、現実のロボット、センサー、ソフトウェアシステム、実行環境をコンピューターの中に移し、可能な限り現実に近いデジタル世界で、機械の大規模な訓練・テスト・検証を行うことだ。現実ではコストが高く、再現が難しく、危険を伴う故障や極端なシナリオも、ここでは何度でも繰り返し発生させられる。
Antiochは孤立した例ではない。Physical AIがAI業界の新たな投資先となるにつれ、3D空間、デジタルツイン、物理シミュレーション、合成データをめぐる企業群が再び資本の注目を集めている。それらが解決しようとしているのは、いずれも「コンピューターの中に現実に十分近い世界をどう作り出すか」という問題だ。
「仮想世界を構築し、現実のシーンを複製する」という説明だけを見ると、前回の「メタバース」テックブームを思い起こしやすい。しかし違いは、Antiochが手がけているのはユーザーがVRヘッドセットを装着して仮想世界を楽しむことではない点だ。今回、仮想世界に長期的に「住む」必要があるのは、ロボットなのだ。
仮想世界は消えたわけではない。ただ今回は、そこに住み着く「住民」が変わっただけだ。
人類はメタバースに住まなかった
2021年8月、世界で最も重要なコンピューターグラフィックス学会SIGGRAPHで、NVIDIAはOmniverseプラットフォームの拡大を発表した。当時NVIDIAはその位置づけを明確にしていた。Omniverseはシミュレーションと3Dコラボレーションのためのプラットフォームであり、「メタバースの基盤を提供する」ものだと。
その核となる考え方は、もともと異なるソフトウェアに分散していた3Dコンテンツを、同じ仮想世界に集約することだ。
その中で非常に重要な基盤技術がUSD、すなわちUniversal Scene Description(ユニバーサルシーン記述)だ。これはピクサーが当初、複雑なアニメーション映画制作のために開発し、後にオープンソース化した3Dシーン記述の標準規格である。簡単に言えば、3D世界の「共通言語」のようなものだ。仮想シーンにどのような物体があり、それらがどこにあり、どんなマテリアルを使い、どう動き、互いにどんな関係にあるのかを、USDを通じて整理できる。
そのため当時、Blenderのような3Dモデリングソフトを使うデザイナー、Adobe Substance 3Dでテクスチャやマテリアルを作るアーティスト、そして異なるエンジニアリングソフトを使うエンジニアは、USDを通じてそれぞれが制作したコンテンツをOmniverseに接続し、同じ3D世界で協業できた。
NVIDIAは当時、この未来を「3D Internet」とさえ表現した。今日のインターネットがウェブページをつなぐのに対し、未来のインターネットは、リアルタイムに出入りしインタラクションできる無数の3D空間をつなぐかもしれない、と。
同年10月、Facebookは社名をMetaに変更し、メタバースは最も熱狂的な段階に入った。
NVIDIAに比べ、ザッカーバーグが描いた未来はさらに壮大だった。彼の構想では、人々はもはや二次元の画面越しにインターネットを使うのではなく、空間感覚と「存在感」を持つデジタル世界に入り、そこで会議をし、働き、娯楽を楽しみ、買い物をし、交流する。Metaは当時、今後10年程度でMetaverseが10億人をカバーし、巨大なデジタル経済を形成する可能性があると予測していた。
メタバースは何でも放り込める器だった。その後2年間、VR、AR、デジタルヒューマン、バーチャルオフィス、3Dゲーム、デジタルツイン、そしてNFTなどのデジタル資産のナラティブは、すべて「大規模デジタル世界」という統一された想像の中に放り込まれた。
しかし、コンシューマー向けメタバース産業は今に至るまで実現しておらず、当初の参加者の多くは静かに退場していった。Metaは依然としてVR、AR、スマートグラスを諦めていないが、関連事業を支えるReality Labsは依然として極めて高額な長期投資だ。2025年、Reality Labsの通年売上は約22億700万ドルだったが、営業損失は191億9300万ドルに達した。Metaは同時に、2026年の同部門の営業損失はおおむね2025年の水準を維持すると予測している。
対照的に、Omniverseの変化はさらに興味深い。5年前、NVIDIAはOmniverseを「メタバースの基盤」と呼んだ。今やNVIDIA公式サイトの定義は「Physical AIアプリケーションを開発するためのライブラリとマイクロサービスの集合体」に変わっている。
Omniverseの上位ナラティブと製品の重心は、すでに産業用デジタルツイン、ロボットシミュレーション、自動運転開発へと移っている。その下にはIsaac Sim、Isaac Lab、Cosmos、PhysX、Warpといった一連のロボットおよびPhysical AIツールが接続されている。同じプラットフォームが担う最大のナラティブは、すでに変わってしまった。
実際、ロボットシミュレーション、産業用デジタルツイン、物理エンジンの歴史はいずれも「メタバース元年」よりはるかに古い。前回のメタバースブームは、3Dモデリング、リアルタイムレンダリング、デジタルツイン、バーチャルコラボレーション、オープン3D標準、そしてNFTといった、もともと比較的分散していた技術を、「大規模デジタル世界」という統一された想像の中に放り込んだにすぎない。
そのためメタバースの退潮後も、これらのインフラは消えなかった。人々はただ、ロボットは人類以上に仮想世界を必要としているかもしれない、と徐々に気づいただけだ。
ロボットが仮想世界を必要とする理由
NVIDIAは今年のGTCカンファレンスでヒューマノイドロボットの訓練体系を説明する際、非常に直感的な「ロボットデータピラミッド」を再び示した。
最下層は最も量の多いインターネットと人間のデータで、ウェブページ、画像、動画、人間の行動記録などが含まれる。それらはほぼ無尽蔵で、ロボットに世界が何であるか、人が何をしているかを教えられるが、通常はロボットが実際に動作を実行する際に必要な関節角度、力、触覚、制御信号を持たない。
ピラミッドの最頂部は実ロボットのデータだ。ロボットに遠隔操作や自律運転で実際に掴む、運ぶ、歩くことをさせれば、最終タスクに最も近いデータが得られるが、それは最も高価でもある。1台のロボットは1日最大でも24時間しか実際に経験できず、しかも機械、現場、オペレーター、設備メンテナンスが関わる。
その中間にあるのが、シミュレーションと合成データだ。実ロボットデータほど正確ではないが、GPU内で高速に複製・並列生成できる。また、インターネット動画のように単に「人間が何をしているかを見る」だけではなく、ロボットがタスクを実行するために必要な動作、状態、センサーデータを直接生成できる。
NVIDIAはそのため、今後ピラミッド中間の合成データ層を拡大し続け、ロボット訓練の重要なデータソースにしたいと提唱している。
3種類のデータの利害得失は実にシンプルだ。インターネットと人間のデータは安価で規模が大きいが、ロボットの実際の実行からは遠い。実ロボットデータはロボットの実際の展開に最も近く、物理的真実性が最も高いが、高価で遅い。シミュレーションデータはその中間にあり、真実性は多少失われるが、規模、コスト、制御性は実機をはるかに上回る。
まさにそのため、シミュレーションは米国のPhysical AIインフラにおいて、資本と大手企業が最も賭ける方向の一つになりつつある。
そしてそれが解決するのは、データ量の問題だけではない。現実世界の最大の特徴は、自由に複製できないことだ。企業が100台のロボットを持っていれば、同時に100台しか稼働できない。倉庫も、ロボットを訓練するために10分ごとに棚、照明、床、商品をすべて配置し直すことはできない。しかし仮想環境では、同じロボットを数千、数万のデジタル分身に複製できる。
1台のロボットアームは同時に1000種類の卓上レイアウトに向き合える。ロボットは物体の位置、質量、マテリアルを絶えず変えられる。光、カメラ位置、床の摩擦力、さらにはセンサー誤差まで人為的にランダム調整できる。この訓練手法はロボット分野でDomain Randomization(ドメインランダム化)と呼ばれ、ロボットに完璧な仮想環境を丸暗記させるのではなく、意図的に環境を変え続け、モデルがさまざまな変化の下で同じタスクをこなせるように学習させる。
さらに特筆すべきは、「正常に動作する」データに加え、開発者は極端な状況下のデータにも注目する必要があることだ。カメラが突然故障する、ロボットの足元が突然滑りやすくなる、ロボットが転倒する、といったシーンはいずれも克服を検討すべきものだ。現実世界ではデータ収集のために毎日事故を起こすことはできないが、仮想世界ならできる。
これも、ロボット開発が実テスト場に依存し続けてはいけないと考える人々がいる理由の一つだ。実テストには結局、設備、現場、エンジニアリング時間が必要で、しかも極端な故障は再現が難しい。しかしシミュレーションでは、一度のシステム更新で数千の条件に対して即座に並列テストを行える。
メタバースがかつて直面した最大の問題は、「なぜ人は必ず仮想世界に入らなければならないのか」だった。今やロボットはまったく異なる答えを示している。人にとって仮想世界は、現実生活の代替可能な選択肢の一つにすぎない。しかしロボットにとって、仮想世界は現実に入る前の訓練場になり得るのだ。
再びビジネスになった「仮想世界」
Physical AIをめぐって、新たな「仮想世界インフラ」産業が出現しており、しかもこれらの企業の分業はますます細かくなっている。
2026年8月、ドイツ・ミュンヘンに本社を置くNavVisが8500万ドルの資金調達を完了した。
NavVisは空間データ企業だ。その中核事業はロボットの訓練ではなく、モバイルスキャン機器を使って現実の工場、建物、インフラを高精度の3Dデータへと素早くスキャンすることだ。同社の開示によると、2025年だけで、そのシステムが処理・配信した現実空間は10億平方メートルを超える。
今やNavVisはこの事業をPhysical AIの「データ基盤」と直接位置づけている。ロボットが将来、実際の工場で働くなら、まずコンピューターにその工場がどのような形をしているかを正確に知らせる必要があるからだ。
韓国のスタートアップNdotLightが解決するのは、また別の層の問題だ。NdotLightはロボットシミュレーション用3Dアセットを専門に制作するPhysical AIデータ企業だ。今年8月、150億ウォン、約1060万ドルの新規資金調達を獲得し、韓国産業銀行KDBがリード投資家を務めた。
通常の3Dモデルは、十分にリアルであればゲームやアニメーションに使える。しかしロボット訓練にはそれでは到底足りない。この椅子がどれだけ重いか、どこで衝突が起きるか、表面の摩擦力がどれほどか、どの部位が動くのかを知る必要があるからだ。
NdotLightが開発したTRINIXは、通常の3DコンテンツをいわゆるSimReadyアセット、つまりロボットシミュレーターに直接投入できる3Dアセットへと変換するものだ。外観に加えて、質量、摩擦、関節構造、衝突データを補完し、NVIDIA OmniverseとIsaac Simに接続する。それが解決するのは、仮想物体が現実を再現するだけでなく、現実の物体のようにロボットに使えるようにする方法だ。
9月17日には、アイスランドのTrebleが1800万ドルの資金調達を獲得した。Trebleは音響シミュレーション企業だ。仮想空間を構築した後、部屋、建物、その他の環境における音の伝播の仕方をシミュレートし、合成音響データを生成できる。
ロボット、スマートグラス、その他のPhysical AIデバイスが現実環境を理解するためにマイクへの依存を強めるにつれ、同社も自社の音響デジタルツイン技術をPhysical AI訓練に使い始めた。それが主に解決するのは、仮想世界でロボットがどのように現実に近い音を「聞く」かだ。
こうしたタイプの企業を合わせると、実際にはすでにデジタル世界を再び組み立て始めており、それは5年前に人々が口にした「仮想世界」に非常に近づいている。違いは、メタバースが追求するのが没入感であるのに対し、Physical AIが追求するのが真実性である点だ。
これはロボットシミュレーション分野で最も重要な概念「Sim-to-Real」、すなわち「シミュレーションから現実へ」に行き着く。それが探求するのは、ロボットが仮想世界で学んだことが、現実世界に戻った後も果たして使えるのか、ということだ。
これも、NVIDIAのIsaac Simが画面レンダリングだけでなく、剛体力学、関節、衝突、さまざまな仮想センサーを含み、このギャップを可能な限り縮めようとする理由だ。Isaac Labはさらに、開発者が大量のロボット環境を同時に実行し、GPUによる並列処理でロボットのポリシーを訓練することを可能にする。
したがって、今日のロボット仮想世界と多くのコンシューマー向けメタバースの核心的な違いは、前者の価値は最終的に現実世界に戻って検証を受けなければならない点にある。
人類は結局、当初の構想どおりにメタバースへ住み着くことはなかった。しかし、仮想世界のために敷かれた道は完全に荒れ果てたわけではない。ロボットがその道をたどり、現実へと戻ってきている。


