ロボットポリシーに必要なのは「説明」ではなく「予測」
ロボットマニピュレーションにおける長年の課題は、学習分布外への汎化です。学習シーンでは成功していたポリシーが、物体の形状・位置・照明が変わるだけで破綻するケースは少なくありません。理由はシンプルで、ポリシーがタスクの背後にある物理法則を理解しているのではなく、デモを模倣しているに過ぎないからです。
従来の標準的なアプローチは、事前学習済みVLM(Vision-Language Model)にアクションモジュールを追加してVLA(Vision-Language-Action)を構築する方法でした。この手法は汎用マニピュレーションを大きく前進させましたが、構造的な限界があります。VLMバックボーンは「世界を記述する」ために学習されており、「世界がどう変化するか」を予測するようには学習されていません。
グリッパーでカップを掴んだときカップがどう持ち上がるか、タオルがどう折り畳まれるか、離した物体がどこに落ちるか——こうした動力学(dynamics)はVLMには存在しません。そのためVLAは意味論的な汎化は得意ですが、物理的な汎化は苦手です。ここで登場するのが**World Action Model(WAM)**です。
根拠資料: NVIDIA Developer Blog - Beyond VLAs: How World Action Models Reshape Robot Manipulation
本記事では、WAMとは何か、VLAとどう違うのか、そしてNVIDIAのオープンなワールドモデルCosmos 3がなぜWAMの強力な出発点となるのかを、実務の視点から整理します。

WAMが変えるもの:「行動の学習」から「世界の進化の学習」へ
WAMの本質は一行でまとめられます。言語バックボーンをビデオワールドモデルに置き換える。 バックボーン自体が世界の進化をモデリングするため、post-training段階で物理をゼロから教える必要がありません。すでに物理priorが埋め込まれたモデルを**特化(specialize)**させるイメージです。
NVIDIAの研究論文 World Action Models are Zero-shot Policies は、ビデオとアクションを**同時に予測(joint prediction)**することが、VLAでは容易に獲得できない3つの性質を生み出すと示しています。
1) 多様なデータから学習する
VLAは命令→軌道のマッピングを学ぶため、事実上ほぼ同一のデモが繰り返し必要です。一方WAMは物理(押したらどう動くか、掴んだらどう持ち上がるか、離したらどこに落ちるか)を学びます。つまりあらゆるインタラクションデータが学習信号になります。VLAでは無駄になっていた多様なデータセットがWAMでは資産となり、結果としてデータ収集コストが下がります。
2) オープンワールドで汎化する
物理は意味論よりも普遍的です。物体が落ちる・滑るという現象は物体が変わっても同じです。したがって動力学を学習したモデルは、一度も学習していないシーンやモーションにもその知識をそのまま持ち込みます。
3) 少ないデモで新しいロボットに適応する
物理インタラクションを既に理解しているモデルは、新しいアームやグリッパーへ特化する際に、はるかに少ないタスク固有データで済みます。
Cosmos 3:WAMの強力な出発点
Cosmos 3は**Mixture-of-Transformers(MoT)**アーキテクチャに基づくオムニモーダルなワールド基盤モデルです。
[マルチモーダル入力]
│
▼
[Autoregressive Transformer] ── テキスト/離散トークンの推論
│
▼ (ガイド)
[Diffusion Transformer] ── 画像・動画・音声・アクションを反復デノイジングで生成
- テキストはnext-tokenデコーディング、それ以外(画像/動画/音声/アクション)はiterative denoisingで合成されます。
- サイズは3種類:Cosmos Edge(4B)、Cosmos Nano(16B)、Cosmos 3 Super(64B)。
- 学習データ規模:約7.67億枚の画像、3.48億本の実世界動力学ビデオ、800万件のアクションサンプル(ロボットマニピュレーション・自動運転・カメラモーション・エゴセントリックモーションを含む)。
Cosmos3-Nano-Policy-DROID:ワールドモデル → ロボットポリシー
DROIDプラットフォーム(Franka Panda + Robotiqグリッパー)向けの16Bパラメータポリシーチェックポイントです。言語指示とマルチカメラ観測を受け取り、ロボットのアクション軌道を生成します。4B版(Cosmos3-Edge-Policy-DROID)はオンデバイス配備向けです。
オムニ基盤に由来する3つの性質が実務的に重要です。
- 行動しながら想像する(imagines while it acts)。 アクションを出力する際、それを実行したときにロボットのカメラが見る未来のビデオまで、同一モデルから同時に生成されます。
- オムニアーキテクチャをそのまま維持する。 post-trainingで何も削除しません。ポリシーチェックポイントは関節位置を出すだけでなく、依然として推論しビデオを生成します。
- priorが測定可能である。 同一レシピ・データ・コンピュートで学習したDROIDポリシー2つを比較した場合、ベースチェックポイント出発はRoboLab成功率28.1%、マルチドメインアクションデータで学習したオムニチェックポイント出発は36.8%。スケールではなくアーキテクチャ由来の改善である明確な証拠です。

デプロイメントの観点:WAMはどこに載せるのか
WAMはアクションヘッドだけでなく、生成型ワールドモデル全体を抱えます。コンパクトなVLAより大きいですが、Cosmos 3は単一のトレードオフに押し込むのではなく、デプロイティアを分けて提供します。
| ティア | モデル | ハードウェア | 特徴 |
|---|---|---|---|
| ワークステーション配信 | Cosmos3-Nano-Policy(16B) | 単一NVIDIA RTX PRO 6000 | ロボットの隣で配信、ネットワーク経由で観測ストリーミング・アクションチャンク受信 |
| オンデバイス | Cosmos3-Edge-Policy-DROID(4B) | NVIDIA Jetson Thor | 640×360観測、推論あたり32アクション、15Hzのリアルタイム制御 |
| エッジ拡張 | Edge(4B) | RTX PRO GPU、DGX、GeForce RTX、Jetson(T2000/T3000含む) | 同一ポリシーワークロードを組み込み実行 |
この技術の限界と注意点
- モデルサイズの負担:16B/64B級はロボットオンボードには直接載りません。結局、配信インフラ(ネットワーク遅延含む)が性能の一部になります。
- エンボディメントごとのpost-trainingが必須:Franka、デュアルアーム、UR、WidowXなど、各ロボットごとに別のpost-trainingランが必要です。同じ基盤から出発するというだけでは不十分です。
- 評価指標のバイアス:RoboLab成功率は特定ベンチマークです。実工場/物流環境のロングホライズンタスク性能がそのまま36.8%で出ると期待してはいけません。
- ビデオ生成のオーバーヘッド:「行動しながら想像する」は、推論ごとにビデオデノイジングコストが乗り得ることを意味します。リアルタイム制御ループではアクションヘッドのみを抽出するモードが必要になる場合があります。
日本の開発エコシステムにおける適用文脈
日本では製造業・物流の現場が多く、閉域網オンプレミス配信がデフォルトになりがちです。Cosmos3-Nano-PolicyをRTX PRO 6000に載せ、ロボットと同一ネットワークに配置する構成が現実的でしょう。逆に物流・サービスロボットのようにモバイルエンボディメントであれば、Jetson Thorベースの4B Edgeポリシーが事実上の唯一の選択肢です。ただし日本はDROIDのような大規模オープンデータセットが乏しく、自社データをLeRobotDataset形式に正規化するデータパイプライン構築が導入速度を左右します。
次のステップ学習の方向性
- Cosmos 3オープンコレクションをHugging Face/GitHubから取得し、自社データでpost-trainingを一度回してみる。
- LeRobotDataset形式に慣れる——ロボット学習エコシステムの事実上の標準です。
- VLAとWAMを同一タスク・同一データでA/B比較し、どのタスクでWAMの物理priorが実利をもたらすか確認する。
- ビデオ予測ヘッドを付けるか、アクションのみ抽出するかを推論予算の観点で設計する。

まとめ:「行動を学ぶ」時代から「世界を学ぶ」時代へ
WAMはロボットポリシー学習のパラダイムを行動模倣 → 世界進化のモデリングへと移行させます。Cosmos 3がこのアプローチを実用的にしている理由は3点です。
- オープンな基盤 + SOTA出発点:ベースモデル、データセット、post-trainingレシピ、学習済み重み、評価ツール、配信スタックが商用利用可能なライセンスで公開されています。
- 高速な適応:強力な物理priorにより、新ポリシーに必要なタスク固有データが減ります。自社データをLeRobotDatasetに変換し、公開レシピを実行するだけです。
- 1つの基盤、多数のロボット:Franka、デュアルアーム、UR、WidowXはそれぞれpost-trainingが必要ですが、すべて同一の事前学習済み基盤から出発するため、ワールドモデルをゼロから学習する必要がありません。
最も速い検証方法はシンプルです。現在使っているVLAとCosmos 3ベースのWAMを同じデータでpost-trainingして比較する。 この一度の実験が導入可否を決めてくれるはずです。
あわせて読みたい
- FP8量子化モデルをTensorRTで実配備まで一気に完結(CLIP実践ガイド) — ロボットビジョンバックボーンの配備最適化に直結します。
- CSSで完璧なパイチャートを作る:セマンティクスとアクセシビリティを考慮した実践ガイド — ロボットダッシュボード/モニタリングUIの構築に役立ちます。