2026年9月6日改訂。シミュレーションでの設計検討を扱います。
B2-Wの歩行学習で当時の公開記録に残っている問題は、「立つが前進しない」ことでした。見直した項目には姿勢の報酬、転倒時の終了条件、脚と車輪の評価、ポリシーへの観測入力があります。本記事では、それぞれが何を変える設計なのかを整理します。対象や動作映像はB2-Wの開発事例にまとめています。
姿勢を保つことと、前に進むことを分けて見る
当時の記事には、体高へのペナルティを見直し、上向きの姿勢を評価するupward報酬へ変更したと記録されています。ただし、姿勢を保てることだけでは、速度指令に追従できたとは判断できません。
同じ問題を調べるなら、合計報酬に加えて、姿勢に関する項目と速度追従に関する項目を別々に記録します。実際の前進速度も併せて見ることで、「倒れなくなった」と「前に進むようになった」を区別できます。報酬値の上昇だけを歩行改善と扱わないための確認です。
転倒時の終了条件も、報酬と一緒に確認する
公開記録では、転倒ですぐにエピソードを終了する設計を見直し、転倒後も学習を続ける構成が記載されています。終了条件を変えると、学習中に経験する状態も変わります。
ただし、これだけで「転倒を許容すれば歩行が改善する」とは言えません。比較するなら報酬と初期条件を揃え、終了条件だけを変えて、前進距離・転倒回数・復帰の有無を確認します。転倒後もエピソードが続く場合、エピソードが終わらないことを「転倒なし」と数えないことも大切です。
脚と車輪は、関節ごとの動きまで確認する
B2-Wは脚12関節と車輪4輪を持ちます。記録には脚と車輪の報酬を分けた変更がありますが、その変更だけの効果を測った比較結果までは確認できていません。
切り分けでは、脚の関節運動と車輪の回転、機体の実際の移動を併せて見ます。車輪が回っていても機体が進んでいない場合と、脚だけで移動している場合では、次に確かめる項目が変わります。動画に加えて関節ごとの値を残すと、合計報酬では見えない違いを追えます。
観測を減らす設計と、実機で動くことは別に確認する
当時の記事には、直線速度を観測から除外するBlind Policy設計も記載されています。これはポリシーへ渡す情報の選び方です。観測を減らしたことだけで、実機のセンサ誤差への強さや実機動作を証明するものではありません。
実機へ接続する際は、観測の順序・単位・履歴、関節の対応、制御周期を確認したうえで評価する必要があります。本記事では実機での効果を検証したとは扱っていません。
この記録から言える範囲
本記事は当時の公開記録に残る設計変更を整理したものです。各変更の効果を分離した比較試験や、歩行成功率を示すものではありません。設計上の仮説と、測定によって確かめた効果を区別して読む必要があります。
次に同じ問題を評価するなら、基準となる構成を保存し、変更項目を一つずつ比較します。速度指令、地形、初期条件、試行時間を揃え、成功・失敗の判定を先に決める。そのうえで複数試行のログと映像を残すことで、設計上の仮説を検証できる形にします。
対象ロボットとシミュレーション映像を見る →