著者:Zen、PANews
この1年、ロボティクス/Physical AIデータは、比較的地味なインフラ領域から、激戦が繰り広げられる新たな競争トラックへと急速に変貌を遂げ、具現化AIの「つるはし売り」とも呼ばれるこの分野に、驚異的なスピードで資本が流入している。
この過熱ぶりは中国市場で特に顕著だ。2026年上半期だけで、中国の具現化AIデータスタートアップ25社が合計170億元を超える資金調達を実施した。なかでも光輪智能は年内に複数回の大型資金調達を連続で実施。智元机器人からスピンアウトしたデータ企業の蜜蜂科技も、設立後速やかに数億元の資金を調達した。
海外市場でも、ロボットのトレーニングデータに特化したスタートアップが相次いで登場している。XDOFは今年6月に7000万ドルの資金調達完了を発表。7月末には、Axis RoboticsがHack VC主導で1200万ドルのシードラウンドを完了した。
Axisは自社を「Physical AIデータエンジン」と位置づけ、現在は分散型コントリビューターネットワークとWebベースのシミュレーションデータ収集を重要な切り口とし、一人称視点やモデルのポストトレーニングなどのデータ形態への拡張を進めている。すでにブラウザ経由の遠隔操作で220万本を超えるロボットの軌道データを収集し、累計データ時間は2万8000時間に達している。
もっとも、資本が十分に流入しているとはいえ、ロボットデータは依然として急速に変化し、なおも形成途上の市場である。データ需要が最終的にどの程度の規模に達するのか、実機、シミュレーション、一人称視点といった異なるアプローチをいかに取捨選択するのか、そしてデータ企業が持続可能なビジネスモデルを構築できるのかどうか、多くの重要な問いがいまだ模索段階にある。
こうした問いや、Axis独自のデータ生産モデル、技術路線、今後の発展計画について、PANewsはAxis Roboticsの創業者Chris Feng氏に話を聞いた。
Physical AI時代のデータギャップ
Chrisがこの業界に入ったきっかけは、ロボット本体やアルゴリズムではなく、コンサルティング、投資、データインフラという経路だった。
彼がロボット分野に本格参入することを決断したのは、Physical AI時代の到来によって顕在化した膨大なデータ不足だった。
「GPT-3を参照すると、そのトレーニングには約1500万時間分の人間のインターネットデータが必要でした」とChrisは語る。一方、ロボットが扱う物理世界はデジタル世界よりもはるかに複雑で、認識能力や論理能力だけでなく、空間、動作、物体の状態、そして動作の結果として何が起きるかを理解しなければならない。
したがって、ロボット分野が自らの「GPTモーメント」を迎えるには、1億時間、あるいはそれ以上のオーダーのデータが必要になる可能性がある。データ規模の明白な差に加え、両者のデータ基盤はまったく同列に論じられるものではない。
大規模言語モデルが登場する以前から、インターネットはすでに数十年にわたって発展してきた。さまざまなウェブページ、書籍、フォーラム、コードリポジトリ、大量のデジタルコンテンツが、長期的な蓄積の中で自然なデータ資源を形成していたのだ。
一方、現実世界における人間の行動は、それに類する体系的な記録の過程を経験していない。人々は毎日料理をし、物を整理し、道具を操作しているが、こうした行動が連続的に記録されることは稀であり、ロボットトレーニングに直接利用できる標準化データへと大規模に変換されることはほとんどなかった。
VLAモデルやワールドモデルなどの技術発展にともない、ロボットモデル企業がこうしたデータの最も直接的な需要者となりつつあり、一部のロボット本体企業もモデルとデータのケイパビリティを同時に構築している。同時に、ロボットの形態自体も急速に分化しており、人型ロボットやロボットアームから、産業用途やサービスシーン向けに設計された専用機器に至るまで、異なるモデルや本体がさらに多様化したデータ需要を生み出している。
需要規模が拡大し続けるなかで、従来のデータ生産方式はすぐに限界を露呈した。
初期のロボット企業は通常、実機の遠隔操作に依存し、人間が直接ロボットを操作してタスクを完了させ、動作軌道を記録していた。この種のデータは実際のロボットに最も近いが、生産速度が遅く、コストが高い。またロボットの台数、作業場、オペレーターの人数による制約も受ける。
さらに重要なのは、現実世界は高い複雑性と多様性を有しており、企業内部の限られたロボットと収集シナリオだけでは、モデルが将来遭遇しうる環境を網羅するのが難しい点だ。ロボットの基盤モデルが最終的に千万時間単位、あるいはそれ以上のデータを必要とするならば、単純にロボットや作業場、遠隔操作の人員を増やし続けるだけでは、経済的に効率的な線形的拡張は実現が難しい。
したがって、制御可能なコストで、拡張性のある方法により、十分に多様で、かつ実際にモデルのパフォーマンスを改善できるデータを持続的に生産する方法が、Physical AIデータ業界が直面する中核的な課題の一つであり、独立系ロボットデータ企業が争奪しつつあるビジネスチャンスでもある。
ロボットデータの「ピラミッド」:精度、規模、汎化の間のトレードオフ
ロボットデータにはさらに複雑な問題がある。異なるソースから得られたデータは、リアリティ、コスト、拡張性、そして異なるロボット本体間での再利用可能性において、明確な差が存在するのだ。
Chrisは現在の主なアプローチを、実機の遠隔操作、シミュレーション、人間の一人称視点データの3つに大別している。データとロボット本体との直接的なマッチング度合いで見ると、大まかに「ピラミッド」を形成することができる。
ピラミッドの頂点に位置するのは実機の遠隔操作である。
操作者が実際のロボットを直接コントロールして、把持、配置、移動などのタスクを実行し、センサーがロボットの関節、エンドエフェクタ、視覚、動作信号を同期して記録する。このデータの最大の利点は、トレーニングデータ自体が実際のロボットから得られているため、物理情報が最も完全であり、ターゲットとする本体との差異も最も小さいことだ。
しかし、実機データのコストと規模の問題も同様に際立っている。業界データによると、1時間の高品質な実機遠隔操作データの総合コストは200ドルに達する可能性がある。さらに重要なのは、この種のデータは通常、特定のロボット本体と高度に結びついており、異なる本体への再利用可能性が限られている点だ。例えば、Unitree G1で収集した動作軌道は、異なる形態のロボットにそのまま適合させることはできない。
ピラミッドの中間に位置するのが、シミュレーションデータだ。
ロボットシミュレーションとは、実際のロボットのサイズ、関節、動作範囲、タスク環境を可能な限り仮想空間に再現し、操作者やプログラムが仮想ロボットを制御してタスクを完了させるものを指す。現在、ロボットの研究開発でよく使われるシミュレーションプラットフォームには、Isaac SimやMuJoCoなどがある。
現実世界と比較したシミュレーションの際立った利点は、スケール化と制御可能性である。現実ではデータ収集のために何千何万ものキッチンや倉庫、工場を繰り返し構築することは不可能だが、仮想環境では同様のシナリオを迅速に複製し、並行稼働させることができる。既存の軌道も、照明、材質、カメラ位置、物体の種類、空間レイアウトなどのパラメータを変更することで、より多様な環境へと拡張できる。
同時に、シミュレーション環境ではタスクの状態もより正確に読み取ることが容易である。例えば、タスクが完了したか、ロボットアームが衝突したか、物体が最終的にどの位置にあるかなどを、環境から直接取得できるため、データの検証や自動選別がより容易になる。
とはいえ、シミュレーションデータの限界も明確だ。仮想環境は現実世界を完全に再現することが常に困難なのである。摩擦、物体の変形、接触状態、センサーノイズ、そして多数の制御不可能な要因が、シミュレーションでは良好なパフォーマンスを示しても、実際のロボットに移行した後に性能が低下する原因となりうる。この「シミュレーションからリアルへのギャップ」をいかに縮小するかも、ロボット研究における長年の核心的課題である。
ここ2年ではっきりと加熱しているもう一つのアプローチが、ピラミッドの底辺に位置する、人間の一人称視点データだ。
この手法は、高価なロボット本体への依存を減らそうとするもので、データ提供者にヘッドマウントカメラやGoProを装着してもらうか、あるいはスマートフォンで直接、料理、洗濯物たたみ、部屋の片付け、道具の操作といった実際の行動を記録してもらう。
その基本的なロジックは、将来のロボットの視覚と動作のロジックが人間と高い類似性を持つのであれば、「人間がどのように世界と相互作用するか」を大規模に記録することで、理論上、ロボットの基盤モデルに極めて豊富なデータを提供できる、というものだ。
一人称視点データの最も魅力的な点は、その潜在的な規模と環境の多様性にある。多数のロボットを配置して遠隔操作を行うのに比べ、一般の人が家庭、工場、ショッピングモールなどの実際のシーンで行動を記録する方が、収集コストも参加のハードルも低く、多様な環境をよりカバーしやすい。
ただしChrisは、人間の一人称データには大きな不確実性があるとも指摘する。そのトレーニング上の価値は、将来のロボットの本体形態に大きく依存するのだ。
もしロボットが車輪型の移動台、ロボットアーム、専用グリッパーといった非人型のデザインを採用する場合、人間の操作データの動作レベルでの直接的な移行価値は明らかに低下する。たとえ将来人型ロボットが主流になったとしても、人間の動作をそのままロボットに複製することはできず、手や身体の動きはモーションリターゲティングを経て、ロボットの関節やロボットハンドが実行可能な軌道に変換する必要がある。
また、見落とされがちな問題が視覚の視点である。一人称データは理想的には人間の視点位置に可能な限り近づけるべきだが、異なる収集デバイスが頭部や胸部など別の位置に装着される可能性がある。視点が変わると、手、物体、カメラの間の空間的関係が大きく変化し、こうした差異は3次元空間や操作の関係を学習する必要があるロボットモデルにとって、大きな課題となる。
したがってChrisの見解では、実機、シミュレーション、一人称データの間に単純な代替関係は存在しない。それらはそれぞれ異なる問題を解決するものであり、実機が精度を保証し、シミュレーションが規模の拡大を担い、人間のビデオが現実世界のシーン多様性を提供する。将来のロボットデータ体系は、むしろ異なるデータソース間の組み合わせと補完となる可能性が高い。
さらに、最近の研究では「最適なデータ」の単一追求を弱める動きも出てきている。Dyna Roboticsが新たにリリースしたDyna-2は、100万時間超の人間の一人称視点動画のみで事前学習するだけで、人間の行動データからロボット能力への転移にスケール効果が観察された。Axisの研究でも、選別・加工されたシミュレーション軌跡がデータ規模の拡大とともにモデル性能を持続的に向上させることが示されている。
データ生産者となり、Physical AIデータエンジンを構築
単一データと対象本体との高度な一致だけを追求するよりも、規模、多様性、そしてそれらが本当にモデルの能力に転化できるかどうかが、重要な指標になりつつある。そのため、ロボットデータ企業は単一の収集方法だけではモデルの持続的に変化するニーズを満たすのが難しい。このことはより本質的な問題を浮き彫りにする。データ企業とは、単に顧客の要求に従って収集・処理を完了するだけの存在なのか、それともモデル訓練に必要なデータの設計と生産に、より深く関与すべきなのか。
Axisが選んだのは後者であり、自らを「Physical AIデータエンジン」と位置づけている。Chris氏の見解では、「データアノテーション」と「データ生産」は同じレベルの業務ではない。
データアノテーションは既存のデータを扱い、何を、どうやってアノテーションするかを顧客が決め、サービス事業者はルールに従って実行する。データ生産はさらに一歩進み、データ企業は収集と処理を完了するだけでなく、モデルに具体的にどのデータが不足しているかを判断し、訓練目標に沿ってタスクを設計し、収集を組織化し、モデルのパフォーマンスに基づいて次回のデータを調整する必要がある。
例えば、ロボットモデルがキッチン操作を学ぶ場合、データ企業はどのタスクを設計すべきか、掴む、押す、引く、開ける、閉めるといった基本動作をどのように組み合わせるか、深度情報が必要か、カメラをどう配置するか、そしてどの失敗事例を重点的に収集すべきかを、さらに判断しなければならない。
Chris氏によれば、AxisとBooster Robotics、擎羽科技などの顧客との商業協力は、単純なデータ納品から「モデル訓練目標に合わせてカスタマイズされたデータ生産ソリューション」へとアップグレードされたという。例えばBooster Roboticsとの協業では、AxisはBooster T1の視覚入力と動作空間に深く適応した専用の基盤モデル(Foundation Models)をテーラーメイドで提供した。この方式は、特定タスクの極めて少数のサンプルでの迅速な移行と反復を支援し、それによって身体性AI開発のハードルとエンジニアリング適応コストを大幅に引き下げる。
これこそ、Axisが「データファクトリー」ではなく「データエンジン」を強調する理由でもある。Chris氏の説明によれば、商業顧客が最初に目標シーンと能力要件を提示し、Axisがそれに基づいてタスクを設計し、分散型コントリビューターネットワークを通じてデータ収集を完了する。
「顧客へのデータ納品に加えて、AXISは自社でもデータセット作成とモデル検証に関する学術研究を行っています」とChris氏は述べる。Axisチームが上半期に発表したAXIS Frankaデータセットは、現在Franka Research 3ロボットアームを対象とした最大規模のオープンソースロボット操作データセットの一つであり、207種類の多様な操作タスク、5万件を超える人間によるデモ軌道、そして6万個以上のタスクシーンのバリエーションを含んでいる。
訓練成果の評価段階では、研究チームはこのデータセットを用いて最先端のVLAモデルπ 0.5の継続的事前訓練を行った。実験結果は、AXIS-100%のデータスナップショットで訓練されたモデルがLIBERO-Plusのロバスト性ベンチマークテストで優れた性能を示し、全体の成功率が88.8%に達したことを示している。
Chris氏はまた、AXIS Frankaデータセットが現実の外乱に対処するモデルの能力を向上させる顕著な効果についても言及した。センサーノイズやカメラ視点のずれなどの課題下で、モデルのロバスト性はそれぞれ13.7%と11.3%向上した。この研究により、データセットのスナップショットが25%から100%に増加するにつれて、モデルの操作汎化能力は安定したスケーリング傾向を示し、データ規模と下流タスクの汎化能力との間に正のスケーリング関係があることが実証された。
単一のデータ形態に賭けず、「ロボティクス分野のSurge AI」を目指す
ロボットデータは依然として急速に変化し、安定したパラダイムがまだ形成されていない市場である。
これまで業界の関心は、実機の遠隔操作からシミュレーション、一人称視点などのデータソースへと徐々に拡大してきた。基盤モデルがより深いポストトレーニング段階に入るにつれて、失敗状態、エラー訂正プロセス、回復軌道をどのように収集するかが、新たなデータ需要として浮上し始めている。
「もし今日の市場が一人称視点データを最も必要としているなら、私は一人称視点データだけを提供しましょう。しかし半年後にそれが不要になったらどうするのか?」だからこそ、Chris氏はAxisをある種のデータだけを扱う企業と定義することを望まない。
彼の考え方は、比較的安定した基盤能力と絶えず変化するデータ収集方法を切り離すことにある。基盤は分散型コントリビューターネットワーク、タスク管理、データ検証、クリーニング、拡張、処理パイプラインなどのインフラで構成され、上位層ではモデルと顧客のニーズに応じて、異なるデータ製品と収集方法を接続する。
現在、Axisはウェブベースのシミュレーションデータ収集から切り込み、一人称視点データやモデルのポストトレーニングへと徐々に領域を拡大している。Chris氏によると、最新の製品にはモデルのバイアスと失敗状態に対するエラー訂正データの収集が追加され、チームはすでにDAggerなどのポストトレーニングデータの収集と処理を進めており、年内に初の大規模なHuman-Gated DAggerポストトレーニングデータセットを発表する予定であるという。
彼の見方では、ロボットモデルが反復を続けるにつれて、データパートナーの価値も変化していく。データ企業の能力を評価する際には、一度にどれだけのデータを納品できるかだけを見るのではなく、高品質のデータを安定的に生産できるかどうか、持続的に稼働するコントリビューターネットワークとデータ処理ツールを持っているかどうか、そしてモデルのパフォーマンスに応じて次回のデータの内容と構造を適時に調整できるかどうかが、より重要になる。
この考え方はある程度、Scale AIやSurge AIの発展経路を参考にしており、Chris氏が特に関心を寄せているのはSurge AIである。彼はAxisが将来的に「ロボティクス分野のSurge AI」になることを望んでいる。
Chris氏によれば、Surge AIの強みは単に大量のデータアノテーションリソースを持っていることだけではなく、そのビジネスが常にモデルの需要変化に密着し、大規模モデルのポストトレーニングからエージェント訓練環境などの新たな段階へとさらに展開している点にある。
特定のデータ形態に自らを縛り付けず、Physical AIモデルの訓練方法の変化に合わせて、提供するデータとツールを継続的に調整していくことこそ、Axisが本当に再現したい能力なのである。
ブロックチェーンを貢献インセンティブとデータ追跡に活用
他の競合他社とは異なり、Axisにはもう一つ比較的特殊なラベルがある――ブロックチェーンだ。
ロボットデータの生産プロセス自体はブロックチェーンを必要としない。シミュレーションは依然として従来のロボティクス環境で実行され、モデルの訓練も他のAI企業と変わらない。ブロックチェーンが真に機能するのは主にデータが生成された後である。Axisは検証済みのデータ軌道に対してデータIDを発行し、タスク、データ、コントリビューター間の関係をBase上に記録する。
Chris氏が言うには、ブロックチェーン技術は主に二つの問題を解決する。
第一に、貢献へのインセンティブである。世界中の分散したユーザーによってデータが生産される場合、異なるユーザーが完了したデータの量も質も異なる。プラットフォームは、誰が何に貢献したか、そしてそれらのデータが本当に要件を満たしているかどうかを知る必要がある。コントリビューターにとっての核心は、多くやることではなく、誰が本当に有効なデータを提供したかである。
第二に、来歴の追跡である。現在のAIモデルの訓練プロセスは非常にブラックボックスに近い。外部からは通常、最終的なモデルしか見えず、特定の能力が具体的にどのデータに由来し、それらのデータが誰によって生産されたのかを知ることは困難である。もしタスク、軌道、コントリビューターの関係が持続的に記録されれば、あるデータが将来顧客に購入される際に、少なくとも比較的完全な来歴記録を保持することができる。
Axisは現在、ユーザーの貢献を記録・測定するためのポイントシステムを既に導入している。Chris氏はさらに、将来トークンを発行する場合、貢献ポイントがインセンティブの根拠となる可能性があり、もしあるコントリビューターのデータが最終的に商業化されれば、企業として将来その収益分配に参加させることも検討していると述べた。
とはいえ、これらのメカニズムは現在も設計・改善の段階にある。Chris氏は、先にトークンエコノミーを構築してからその応用シーンを探すよりも、まずブロックチェーンが具体的にどのような実際の問題を解決できるのかを見極めることを重視している。
「私は自分自身を暗号ロボティクス企業だと思ったことは一度もない。」
彼の定義では、Axisはまずロボットデータ企業であり、ブロックチェーンが貢献インセンティブやデータ来歴の追跡の解決に役立つのであればその部分で使用し、もし実際の価値を生み出せないのであれば、「Crypto+AI」の物語のために無理に導入する必要はない。
次の段階:データカバレッジを拡大し、トップモデル企業のサプライヤーリストに入る
今後6〜12ヶ月の発展について、Axisのロードマップは主に製品、コミュニティ成長、商業化の三つの方向に集中している。
製品面では、Axisは一人称視点データの収集規模を引き続き拡大し、新たにUMIデータやモバイル操作タスク向けの遠隔操作データを追加して、プラットフォームがカバーするデータタイプとタスク範囲をさらに拡大する計画である。
一般ユーザー向けのデータ収集エントリーに加えて、Axisは企業顧客や開発者向けにタスク生成APIとデータ処理ツールを提供し、基盤となるデータ生産能力の一部をさらに製品化する計画も持っている。
コミュニティの成長ももう一つの重点である。Chris氏は、Axisが今後半年でコミュニティ規模を現在の3倍に拡大し、異なる地域市場をさらに開拓したいと述べた。参加者も通常のデータコントリビューターに限定せず、より多くの開発者、研究者、産業従事者の参加を促し、プラットフォームをPhysical AIデータ生産を取り巻くオープンなエコシステムへと徐々に拡大していくことを望んでいる。
商業化については、Axisは現在すでに一部の専門分野でベンチマークとなる顧客を獲得し、シミュレーションデータと一人称視点データでも既に有償の注文が発生している。今後半年、企業が自らに設定した目標は、年間経常収益(ARR)を50万〜100万ドルに引き上げ、トップクラスのロボットモデル企業のサプライヤーリストに入ることである。
収入の数字そのものと比べても、トップクラスのモデル企業の供給体系に入ることこそ、Axisの現在のモデルをよりよく検証するものになるだろう。




