見出し画像

AIの次のフロンティア:空間知能──Fei-Fei Liが語るWorld Labsの世界モデルとロボット工学への展開

▶ 元動画: https://www.youtube.com/watch?v=-tabaM5l3s0


2026年7月28日

概要

a16zのポッドキャストにWorld LabsのFei-Fei Li氏と、新たにチームに加わったScenixのYunzhu氏が登場しました。両者は「空間知能」を次のフロンティアと位置づけ、テキストや画像から3次元の一貫した世界を生成する基盤モデル「Marble」や、現実とシミュレーションを結ぶ「リアル・トゥ・シム・トゥ・リアル」パイプラインについて議論を交わしました。ロボット工学が直面するデータ不足と評価の難しさを、大規模なデジタル世界での学習によって突破する構想が語られます。

対談では、動画モデルではなく幾何的な一貫性を備えたワールドモデルを基盤とすることの意義や、シミュレーションがもたらす反実仮想推論の重要性が強調されました。また、完全な非構造化環境への展開を急がず、倉庫や工場といった半構造化環境から実績を積む現実的なロードマップも示されています。両氏は、ロボティクス企業に対してはいつでも連絡を歓迎しており、汎用ロボットの実現には息の長い取り組みが必要との認識で一致しました。

World Labsの空間知能とMarble

Fei-Fei Li氏は、World Labsが創業2年のフロンティアモデル企業であり、AIの次のフロンティアとして「空間知能」の構築に取り組んでいると説明しました。空間知能とは、物理空間や仮想空間を問わず、環境を理解し、推論し、相互作用する能力をAIに与えることを指します。その実現の中核をなすのが、大型世界モデルの開発です。

同社が公開している基盤モデル「Marble」は、画像や数枚の写真、テキストをプロンプトとして受け取り、ガウシアン・スプラットやメッシュといった3次元形状で幾何的に一貫した世界を生成します。Li氏によれば、ゲームやVFX、デザインなどクリエイティブ分野にとどまらず、こうしたモデルは「マルチバース」とも言うべき多様な空間を構築し、人々がその中で行動できるようにするための技術です。

Scenixの参画とロボティクスへの展開

World Labsに加わったScenixは、ロボットが物理世界をより良く認識し相互作用できるようにすることを目的としたスタートアップです。共同創業者のYunzhu氏は、MITでの博士課程とFei-Fei Li氏の下でのポスドク研究を経て、コロンビア大学で助教授を務めながら、一貫して「ロボットを実環境で動かす」という実践的な目標を追求してきました。

Scenixが着目したのは、汎用ロボットの開発が直面する訓練と評価のボトルネックです。彼らは「リアル・トゥ・シム・トゥ・リアル」パイプラインという手法を開発しました。これは現実の環境をデジタル世界に高精度でマッピングし、デジタル空間上で起こる結果が現実でも同様に起こるように整合させることで、必要なデータ収集や評価作業をスケーラブルなデジタル世界に置き換えるものです。同社にはシミュレーション分野の世界的な研究者であるChangi Jan氏、Amazonに買収されたスタートアップでエンジニアリングを率いたSunonni氏らが名を連ね、ロボティクス、レンダリング、シミュレーションの強力なチームを構成しています。

顧客として始まった相乗効果

両社の協業は、Li氏がYunzhu氏のポスドク指導教員だったという個人的な関係から自然に生まれたわけではありません。Yunzhu氏によれば、World LabsがMarbleの最初のバージョンを公開した際、Scenixは一顧客としてその技術を使い始めました。その後、Li氏がScenixの存在に気づき、直接対話する中で技術面での膨大なシナジーが確認されたといいます。

Li氏は、Scenixがもつロボティクス全体のフルスタック研究力とシミュレーションの深い知見が、World Labsの生成モデルや3次元再構築の強みを補完すると評価します。一方でYunzhu氏は、World Labsのスパース再構築や生成能力が、環境の再構築を重い処理から解放し、より効率的なモデル化を可能にすると期待を寄せました。この補完関係は、言語モデルのようにマルチモーダルな入出力を扱う基盤モデルへと発展し、将来は行動の出力も含む「ロボティクスのための基盤モデル」を生み出す可能性を両氏は否定しませんでした。

シミュレーションの役割と反実仮想推論

対談では、ロボット学習におけるシミュレーションの役割が哲学的な観点も交えて議論されました。Li氏は、人間の知能が頭の中で多くのシミュレーションを行うことを引き合いに出し、シミュレーションが実世界データだけではカバーできない「反実仮想推論(counterfactual reasoning)」を可能にすると指摘しました。人間が、まだ起こっていない、あるいは起こりえない出来事を想定して行動を学ぶのと同じように、ロボットもデジタル世界で無数のシナリオを経験することで、頑健性を獲得するという考え方です。

Yunzhu氏は、シミュレーションがロボティクスにもたらす価値を「信頼性」と「効率性」の二つのレベルで整理しました。信頼性の面では、照明、摩擦、物体の形状や材質といった物理パラメータを系統的に変化させ、ロボットが遭遇しうる状態空間を網羅的にカバーできる点が挙げられます。効率性の面では、遠隔操作では人間の速度が上限となるデータ収集を、シミュレーション上で加速して訓練することで、顧客が求める「人間以上の速度」を実現する基盤となります。Li氏は、自動運転分野でもWaymoが数十億時間のシミュレーションを活用している事実を挙げ、これは最も単純な種類のロボットですらシミュレーションに大きく依存している証拠だと補足しました。

創造的ユースケースと正確さの両立

司会者のMartin氏は、個人的な好奇心として、ロボティクスでは正確さが極めて重視される一方で、World Labsが手がけるクリエイティブ分野のユースケースでは、不正確さがスタイルや意図的な効果になる場合もあるという、二つの方向性の違いに言及しました。技術的な観点から見て、この両者はどのように折り合いをつけられるのか、あるいは常に二つの異なる設計点として存在し続けるのかを問いかけました。

Yunzhu氏は、長期的にはこれらは調和すると答え、ロボティクスにおける環境のモデル化は完璧である必要はないと述べました。飛行機、ドローン、ルンバ、四足歩行ロボット、二足歩行ロボットに至るまで、モデルこそがそれらを機能させ、シミュレーションから実環境への転移を可能にしてきたと説明します。雪や茂みの上を歩く四足歩行ロボットを例にとると、シミュレーターがすべての茂みや雪の状態を極めて精密に再現する必要はなく、問題の本質的な構造を捉え、デジタル環境内で様々なランダム化を施せばよいと指摘しました。Li氏も、自動運転車は最もシンプルな種類のロボットに過ぎず、Waymoが数十億時間のシミュレーションを公に活用している事実を引き合いに出し、シミュレーションがロボット学習に巨大な役割を果たすことを改めて強調しました。

シミュレーションの忠実度とモデルの一貫性

Yunzhu氏は、ロボット工学の歴史を振り返り、飛行機やドローン、Roomba、四足歩行ロボットに至るまで、モデルこそがシミュレーションから実環境への転移を可能にしてきた要であると述べました。重要なのは、雪や茂みの上を歩く四足歩行ロボットの例が示すように、シミュレーターが現実のすべてを精密に再現する必要はないという点です。むしろ、問題の本質的な構造を捉え、デジタル環境の中で照明や摩擦、物体の形状などを幅広くランダム化することで、ロボットは多様な状況に頑健に対処できるようになります。こうした領域ランダム化の思想のもと、SynenixとWorld Labsは共同で、ロボットの訓練をシミュレーションから実世界へ転移させるために必要な「忠実度(fidelity)」の水準を探求していると説明しました。

両氏は、こうしたデジタル世界が備えるべき要件として「一貫性(consistency)」を重視します。一貫性とは、空間、時間、異なる視点、そして多様な相互作用にわたって世界が矛盾なく保たれる性質です。Marbleが生成する3次元世界は、まさにこの一貫性を備えており、ロボットが学習するための信頼できる基盤になります。Yunzhu氏は、既存の多くのビデオ予測モデルでは、ロボットが物体を前に押すとその物体が突然消えてしまうような問題が起き、適切な学習信号を与えられないと指摘しました。こうしたモデルでは、ロボットが何をすべきかを正しく学ぶことはできません。

さらに、将来的な基盤モデルは、フレームやテキスト、画像、深度情報といった多様なモダリティを取り込むマルチモーダルモデルである必要があり、その中心には「行動(アクション)」が位置づけられます。行動を入力として扱う場合、モデルは特定の行動によって環境がどう変化するかを予測するフォワードシミュレータとして機能します。行動を出力とする場合には、与えられた目標に対して実環境で取るべき行動を予測するポリシーモデルとなります。こうしたオムニモデルは、ロボティクスコミュニティに大きな価値を提供すると同時に、個別のロボット応用に向けたファインチューニングの背骨としても役立つと両氏は見通しました。

シミュレーションと実世界データは、互いに矛盾するものではありません。Yunzhu氏は、初期段階では物理ベースのモデルに重点を置いて一貫性と構造を確保し、実際のロボットや顧客との協業を通じて実世界データが蓄積されるにつれて、徐々に学習ベースのモデルへと重心を移していくデータフライホイールの構想を語りました。このデータフローによって、物理と幾何の確かさと、大規模データと計算がもたらす力の両方を享受できるようになります。Li氏も、シミュレーションと実データは二者択一ではなく、すべてが一体となってロボットを機能させると哲学的な補足を加えました。

シミュレーション偏重への批判とワールドカップの具体例

投資家である司会者のMartin氏は、他の研究者、例えばSergey Levine氏が「シミュレーションは常に最終的には物理世界から乖離し、実世界のデータ収集が絶対に重要である」と述べていることを引き合いに出し、シミュレーションを基盤とするアプローチの妥当性について疑問を投げかけました。この点についてYunzhu氏は、両者は矛盾するものではないと答えました。シミュレーションは本質的に、ある行動を取ったときに環境がどう変化するかを予測する世界のモデルです。それは純粋な物理である必要はなく、物理と学習の組み合わせでもかまいません。実世界のデータも収集し活用しますが、重要なのはデータフライホイールのどの段階にいるかだと説明します。初期には物理ベースに重点を置いて正しい一貫性と構造を確保し、データが蓄積されるにつれて学習ベースの環境モデルへと重心を移していくのです。この移行とデータフローこそが、物理と幾何の確かさ、そしてデータと計算がもたらす力の両方を得るための鍵になると述べました。

Li氏もこの議論に哲学的視点を加えました。シミュレーションか、そうでないかという二者択一ではないと断じた上で、人間の知能に言及しました。私たち人間は頭の中で多くのシミュレーションを行っています。そこには実世界データでは果たせない重要な役割、すなわち反実仮想推論があるからです。まだ起こっていないこと、起こりえないこと、あるいは実世界で十分なデータが得られないことを頭の中で展開し、その中でどう行動すべきかを学びます。人間は常にこれを行っているとLi氏は指摘します。

この文脈でLi氏は、司会者と自身がともにワールドカップを観戦していたことに触れ、スペインの優勝を祝福しました。そして、すべての試合の計画において、デジタルであれホワイトボード上であれ、何らかのシミュレーションが行われているはずだと述べ、シミュレーションが果たす役割はまさに反実仮想推論だと論じました。この機能はロボティクスにおいて極めて重要であり、実世界のデータだけではどうしてもカバーしきれない部分を埋めるものです。

人間の効率性への長い道のりとロボットシステムの複雑性

対談の終盤では、ロボットが単純作業において人間の最低賃金レベルの効率性を達成できる時期について、より長期的な見通しが示されました。Yunzhu氏は、ロボットが人間の電力効率に追いつくのは「非常に長い時間がかかる」と明言し、5年で実現するようなものではないという立場をとりました。実環境で動作するロボットは常に「システム」であり、ハードウェア、ソフトウェア、脳の部分だけでなく、指の摩擦係数といった細部に至るまで、考慮すべき要素が山積しています。こうしたシステム全体を噛み合わせて実用化するには、多くの反復が必要であり、人間レベルの効率と能力に到達するまでには長い時間がかかるとの認識です。

一方で、Li氏は「今日のAIで最も難しいのは、正しい尺度の楽観主義(measured optimism)を持つことだ」と述べ、過度な期待と過小評価の間でバランスを取ることの重要性を強調しました。大規模言語モデルでさえ、人間の脳が消費する30ワットという驚異的な電力効率には遠く及んでいないという現実があります。ただし、画像生成やソフトウェアエンジニアリングといった特定の狭いタスクでは、性能対消費電力の面で人間にかなり近づいている可能性があるものの、3次元空間でのナビゲーションや物理的作業を伴うロボティクスでは、まだどこにも近づいていないというのが偽らざる現状です。

そのうえでYunzhu氏は、自身が博士課程を始めた頃と比較すると、現在取り組んでいる問題の水準は想像以上に進歩していると語りました。エコシステム全体が急速に進化し、ロボットシステムを構築するための様々な可動部品が噛み合い始めている手応えがあり、それが現実的な困難と表裏一体の希望にもなっています。

半構造化環境からの現実的なアプローチ

汎用ロボットの展開戦略について、Yunzhu氏はロボティクス応用の進歩が常に「完全構造化」「半構造化」「非構造化」の順を辿ってきたと説明しました。すでに自動化が進んだ工場のような完全構造化環境から、アマゾンの倉庫やレストランのようにある程度の制御が効く半構造化環境を経て、家庭のような非構造化環境へと段階を踏むのが現実的だといいます。

この文脈でヒューマノイドの話題にも触れられました。Li氏は、ヒューマノイドの形状は非構造化環境での生存のために進化したものであり、必ずしも特定のタスクに最適化された形態ではないと指摘します。ビジネスとして成立させるには、むしろタスクに特化した機体を使う方が合理的な場合が多く、だからこそWorld LabsとScenixのプラットフォームは、多様なロボットの身体構造やモデルを問わない設計になっていると説明しました。

実用的ノーススターと現場との連携

Fei-Fei Li氏は自らのノーススターを「ロボットを動かすこと」と端的に表現し、自身を極めて実用的な人間だと述べました。Yunzhu氏もまた、過去の研究で一般の人々にロボットに何をしてほしいかアンケート調査を実施したところ、集まった1000件のタスクのうち3分の1が掃除に関するものだったと明かします。人々は汚れ仕事を嫌がっており、そうしたシナリオこそロボットが解決すべき領域だと両氏は考えています。

Li氏は、Synenixのチームが持つ極めて実践的な姿勢を高く評価しました。共同創業者のYunzhu氏やChangi Jan氏はアカデミア出身でありながら、その第一の本能は常に、業界の研究ラボや倉庫、電子機器の組立現場といった実務の場でデザインパートナーや顧客と手を動かすことでした。Changi Jan氏はWetaやTencentでのVFX経験と起業家としての経歴を持ち、Sunonni氏はAmazonでコンピュータビジョンなど多様な技術スタックに携わってきたエンジニアリングリーダーです。こうした現場主義の文化が、World Labsとの統合を一層魅力的なものにしたとLi氏は語りました。

評価と訓練を加速するデジタル世界

Yunzhu氏が強調したもう一つの要素が「評価」の重要性です。ロボットのモデルを開発する際、あるチェックポイントの性能が90%なのか99.9%なのかを判別するには、実環境での膨大なテストが必要になります。その反復速度は、言語モデルの評価に比べて何桁も遅く、危険やコストも伴います。Scenixのデジタル環境は、シミュレーション上の評価結果が現実の性能と強く整合することをブログ上でも実証しており、顧客はこれを信頼して安全かつ高速な評価サイクルを回すことが可能になりました。

訓練面では、あらゆるパラメータを制御できるシミュレーションの特性により、ロボットがどのようなデータ分布に対して頑健であるかを明確に主張できる点がクライアントに評価されています。データ収集の速度やロボットの台数に制約される実環境と異なり、デジタル世界では情報価値の高いデータを体系的に生成できるためです。

統合戦略とスケーラブルなデジタルワールドの構想

今回の統合により、両社の目標の軌道は根本的に変化したとYunzhu氏は述べています。World Labsとの協業によって環境のモデル化がかつてないほど効率的かつスケーラブルになり、デジタルワールドの構想は大きく前進しました。言語モデルが高度な能力を持つようになっても、人々は航空券の予約やホテルの手配をモデルに盲目的に任せたりはしません。しかしロボットの場合は、最初から実環境で確実に動作しなければならず、そのためのデータもインフラも未だ整っていません。だからこそ、ロボットが学習し評価できるスケーラブルなデジタルワールドを生み出すことで、危険で高コストな実環境データの収集を代替し、ロボットの可能性を飛躍的に広げられるとYunzhu氏は力説しました。

統合の進め方について、Li氏は性急にチームやコードベースを混ぜ合わせるのではなく、慎重に段階を踏む考えを示しました。Synenixは、独立したテックスタックと確立された顧客基盤を持っており、当面はシミュレーションやベースモデル、アクションコンディションモデルの領域から協業を深めていきます。Marbleを社内顧客として利用しながら、両社の強みを丁寧に接合していく道筋です。地理的な面では、Yunzhu氏がサンフランシスコに拠点を移し、World Labsは正式にバイコースタル企業となります。これに伴いニューヨークにもオフィスを開設し、東海岸の人材を惹きつけるとともに、両オフィスにロボットを設置して遠隔から操作・テストできる体制を整えます。これは、いずれ顧客を遠隔支援する上でも不可欠な投資だとLi氏は説明しました。

将来の展望と市場へのメッセージ

Li氏は、統合から2年後の理想的な姿として、少数の重要な垂直ユースケースで実証済みの顧客を獲得し、それを灯台事例(ライトハウス)として事業を拡大するシナリオを描きました。すでにWorld Labsには、Marbleの初期バージョンに対してロボティクスのスタートアップから引き合いが来ていたといいます。両氏は、ロボティクス企業は「早すぎる」ことも「遅すぎる」こともなく、今すぐ連絡してほしいと呼びかけています。

最後に、ロボットが人間の電力効率に追いつくかという問いに対し、Yunzhu氏は「非常に長い時間がかかる」と答えました。言語モデルですら脳の30ワットという効率には遠く及ばない中、ロボットではなおさらです。それでも、自身が博士課程を始めた頃と比べると、現在取り組んでいる問題の水準は驚くほど進歩しており、エコシステム全体の進化の速さに期待を寄せています。Li氏もまた「今日のAIで最も難しいのは、正しい尺度の楽観主義を持つことだ」と述べ、地に足のついた長期的な取り組みの重要性を説きました。

顧客フェーズに応じた柔軟なプラットフォーム

現在の顧客との関わり方について、Yunzhu氏は具体的な利用パターンを紹介しました。顧客の中には、リアルからシムへの変換部分のみを必要とするケースがあります。彼らは、自分たちが注力するタスクをデジタル化し、そのデジタル環境上でロボットシステムの評価を行うことを求めています。一方で、リアル・トゥ・シム・トゥ・リアルのパイプライン全体を必要とする顧客も存在します。彼らは、デジタル世界で訓練したポリシーを自社のハードウェア上で実際に実行させたいと考えており、World Labsのプラットフォームはこうした多様なニーズに柔軟に対応できる設計になっています。

これらのクライアントは、いずれも実運用に極めて近い段階にあります。彼らが取り組んでいるのは極めて実践的なタスクであり、ロボットソリューションが導入されれば即座に価値を生み出す性質のものです。しかも、各クライアントは自動化を検討しているタスクを数十から数百の規模で抱えており、一つのシナリオで成功すれば横展開できる大きな潜在市場が存在していることも、両社がこの分野に注力する理由となっています。

▶ 同じシリーズの前回: a16z解説:Travis Kalanick氏の復活──Uber2011年の逃した提携・ステルスで築いたCloud Kitchens・鉱山や輸送へ広がるAtomsの物理世界コンピューティング https://note.com/yondo/n/nadaf39b1a010

#AI開発 #ポッドキャスト #a16z #WorldLabs #Scenix #Fei -FeiLi #空間知能 #ロボティクス #シミュレーション #世界モデル #AI #Amazon #領域ランダム化 #データフライホイール #一貫性 #産業顧客 #掃除ロボット #ニューヨーク #創造的ユースケース #ワールドカップ #人間の効率性 #ロボットシステム #適度な楽観主義 #垂直ユースケース #自動化ニーズ #柔軟なプラットフォーム

いいなと思ったら応援しよう!

この記事が参加している募集