ロボット基盤モデルと Sim-to-Real
多くの種類のロボットと作業のデータで学習した汎用のモデルと、シミュレーションで学習した方策を実機で動かす方法。種類、成立条件、両者の関係、実務での判断を整理します。
要点
ロボット基盤モデルは、多くの種類のロボットと作業のデータで学習し、画像や言語の指示から動作を出力する汎用のモデルです。Sim-to-Real は、シミュレーションで学習した動作の方策を実機で動かせるようにすることで、見た目や物理の差(リアリティギャップ)をドメインランダム化などで埋めます。基盤モデルは学習に多様な実機データを必要とし、Sim-to-Real はそのデータの不足を仮想の環境で補うため、両者は互いを前提にします。実務では、作業のばらつきの大きさで学習を使うかを決め、シミュレーションで動いて実機で動かないときは見た目と物理の差を一つずつ確かめます。
このページで分かること
- ロボット基盤モデルと Sim-to-Real の定義と、学習の方法・モデルの種類・移行の手法の分類
- それぞれが成り立つ条件(データの多様さ、リアリティギャップの埋め方)と、両者の関係
- 実務でどう扱うか(学習を使うかの分岐、よくある詰まりと避け方)
ロボット基盤モデルとは、多くの種類のロボットと作業のデータで学習し、画像や言語の指示から動作を出力する汎用のモデルのことで、Sim-to-Real とは、シミュレーションで学習した動作の方策を実機で動かせるようにすることです。前の節「仕組みの全体像: 感知・判断・動作」で見た「判断」を担うモデルと、「シミュレーション」の要素を、この節で掘り下げます。
学習の方法とモデルの種類、移行の手法
学習の方法とモデルの種類は次のように分けられます(LeRobot が扱う範囲)。
| 種類 | 内容 | 入力と出力 |
|---|---|---|
| 模倣学習 | 人の実演データから動作を学ぶ | 観測から動作 |
| 強化学習 | 報酬を手がかりに試行錯誤で学ぶ | 観測から動作 |
| VLA(Vision-Language-Action)モデル | 画像と言語の指示を受けて動作を出す。基盤モデルの代表的な形で、重みを公開したものもある(π0、Isaac GR00T) | 画像と言語から動作 |
| 世界モデル | 行動の結果を予測する。計画や学習の補助に使う | 観測と行動から次の観測 |
Sim-to-Real で差を埋める手法は次の 3 つです(分類は Zhao ほか 2020 のサーベイに沿う)。
| 手法 | 内容 |
|---|---|
| ドメインランダム化 | シミュレーションの見た目や物理の値を無作為に変えて学習し、実世界をその変化の一つとして扱えるようにする(Tobin ほか 2017) |
| システム同定 | 実機の計測値に合わせて、シミュレーターの摩擦や質量などの値を調整する |
| 実機データでの微調整 | シミュレーションで学んだ方策を、少量の実機データで調整する |
成り立つ条件
基盤モデルはデータの多様さで決まる
基盤モデルの汎用性は、学習データに含まれるロボットと作業の多様さで決まります。Open X-Embodiment では 21 の機関が 22 種類のロボットのデータを持ち寄り、学習した RT-X モデルが他のロボットの経験で複数のロボットの能力を高める正の転移を示しています(Open X-Embodiment 2023)。実機だけでは量に限りがあるため、シミュレーターで生成した合成データを足す構成が使われます(Isaac Sim)。
Sim-to-Real はリアリティギャップを埋める
シミュレーションと実機の差は、見た目(照明、質感、カメラ)と物理(摩擦、接触、遅れ)に出ます。ドメインランダム化は、この差を学習時に広く揺らしておき、実機を学習済みの範囲に入れる考え方です。接触を含む多関節の物理を扱う MuJoCo、PhysX または Newton で物理を計算する Isaac Sim、その上で強化学習と模倣学習の手順をまとめた Isaac Lab が、この用途で使われます。
両者は互いを前提にする
基盤モデルがあると作業ごとにゼロから学習せずに済み、Sim-to-Real の出発点がよくなります。Sim-to-Real が成り立つと、基盤モデルの学習データを仮想の環境で増やせます。公開された基盤モデルは、事前学習の後に自分のロボットと作業のデータで微調整して使う前提で提供されています(π0 2024、Isaac GR00T README)。
実務での判断とよくある詰まり
最初の分岐は、作業のばらつきの大きさです。物と位置が決まっているなら従来の教示で足り、学習は要りません。ばらつくなら学習を検討し、人の実演で集められる量で足りるなら模倣学習から、危険が伴うか大量の試行が要るならシミュレーションから入ります。
よくある詰まりは 3 つです。実機で動かないときに、原因が見た目か物理か分からないまま学習をやり直すこと。実機のカメラの位置や照明を学習時と揃えないこと。基盤モデルを使えばそのまま動くと考え、自分の作業のデータでの微調整と確認を省くことです。原因は一つずつ変えて確かめ、微調整と確認は手順に含めます。