
車輪付き四脚ロボットUnitree B2-Wを対象に、Isaac Sim上でPPOによる不整地歩行の学習を実施。脚12関節と車輪4輪を扱う学習環境の構築、報酬・観測設計、シミュレーション映像を紹介します。実機動作は本事例の検証範囲に含みません。
課題と担当範囲
車輪と脚を持つB2-Wを、凹凸や坂道のあるシミュレーション環境で歩かせることを対象にしました。学習環境の構築、PPOによる学習、姿勢・脚・車輪の報酬設計、観測入力の検討、学習経過の映像化を行いました。
シミュレーション映像
B2-Wの不整地歩行シミュレーション。実機での走行映像ではありません。
開発環境
成果と検証範囲
学習の初期から歩行する段階までの映像を収録しました。当時の公開記録に記載した学習時間は約8時間(28,110秒)です。掲載映像は個別の動作例であり、全条件での成功率や転倒率を示すものではありません。
本事例はシミュレーションでの学習・動作確認です。実機への搭載、センサ誤差への頑健性、現場での連続運用は検証範囲に含みません。
技術的な切り分け
姿勢の報酬、転倒時の終了条件、脚と車輪の評価、観測入力の論点はB2-Wの歩行学習で見直した報酬・終了条件・観測の設計に整理しています。各変更の効果を分離した比較実験の結果ではなく、記録に残る設計変更と、次に確かめる項目です。
学習の進行過程
シミュレーション内の2,048体のロボットが、試行錯誤を通じて歩行を獲得していく様子

1
学習開始直後 — ロボットが転倒し、まだ歩行できない状態

2
学習初期 — 一部のロボットが立ち上がり始める

3
学習中盤 — 多数のロボットが不整地上で歩行を開始

4
学習後半 — より難しい地形にも適応し始める

5
学習完了間近 — 安定した歩行ポリシーを獲得