LeRobot Pathに戻る

政策 を 評価 する

モデルや実際のロボットで ACTポリシーを評価し,成功率を測定し,失敗モードを診断し,改善するか展開するか判断します. ~1時間

6件中5件 · 評価 · ~1時間

訓練されたチェックポイントをシミュレーションで リアルロボットで実行し 構造化された20回のテストプロトコルで 成功率を測定し ポイントを低下させる最高失敗モードを特定します

シミュレーション評価

シンボットの評価は迅速で安全で 再訓練後,再現可能な基数を与えます.

source ~/lerobot-env/bin/activate # 最良のチェックポイントを評価する (ステップ_050000 をチェックポイントステップに置き換える) python -m lerobot.scripts.eval \ --pretrained-policy-name-or-path \ ~/lerobot-policy/pick-place-v1/checkpoint/step_050000 \ --env.name gym_pusht/PushT-v0 -- \eval.n-episodes 20 \eval --.use-async-envs false # Outputs:成功_rate, mean_reward, episode_videos/

期待する内容: 50つのシムデモをうまく訓練した政策は,Mujokoでの成功率60~85%を達成すべきである.40%以下はデータセットの品質の問題を示唆する.85パーセント以上は,タスクがあまりにも簡単であるか,シム環境があまりにも許容的であるかを意味します.

リアルロボット安全チェックリスト

テストされていない政策は 予想外の方法で 動かす可能性があります.

  • 作業の一部でないオブジェクトの作業空間を清掃する.特定の視覚的な文脈で行動することを学んだポリシー 意外なオブジェクトは不規則な行動を引き起こす可能性があります.
  • 緊急停止 (E-stop) に留まり,または評価セッション全体にわたって Ctrl+C を押す準備をしてください.実行方針から離れることはありません.
  • 速度を最大50%に制限して始め テストが不正確で 動きが悪い場合は30%に減らします
  • 位置を同じ角度で設定し,同じ光線で同じ物体の色を同じ角度で設定する. 分布シフトは,ゼロの実世界の成功率の最も一般的な原因です.
  • ロボット関節の物理的な停止制限を超えて評価しないでください. 最初の実行前にロボットの設定でそれらをチェックしてください.

リアルロボット評価プロトコル

試験を正確に20回実行します.これは信頼できる成功率推定 (±10%で95%信頼度レベル) に十分なサンプルを提供します.すべての試験をビデオで記録します.

# リアルロボット python -m lerobot.scripts.control_robot \ --robot-path lerobot/configs/robot/so100.yaml \ --control-mode eval \ --pretrained-policy-name-or-path \ ~/lerobot-policy/pick-place-v1/checkpoints/step_050000 \ --eval.n-episodes 20 \ --record-video 1

試行ごとに,手動でスコアを付けます. 完成した作業の成功は1で,失敗は0で (部分的な把握,落下,失敗) になります. 成功率は合計を20で割ります.

失敗 の 方法 を 診断 する

ビデオを視聴して失敗を分類する.失敗は3つのカテゴリーのうちの一つに該当します.

データ品質

腕は決して完全に握りにコミットしない

訓練データでは,複数の把握戦略を平均しています.これは,いくつかのデモが左から右から近づくと,またはグリッパーの閉じるタイミングが不一致するときに起こります.修正:すべてのデモ中に単一の意図的な戦略で再記録します.

モデル容量

軌道は合理的なようだが 精度は12cmに一貫して 偏っている

モデルが正しい行動を学びながらも,正確性を発揮できない. 部品のサイズが短すぎると (計画視界が不足している) または,フードフードが小さすぎると,このことが起こります. 修正:部品のサイズを150に増やし,再訓練します. またはネットワークを規則化するために,より多様なデモを追加します.

配分シフト

ポジションによっては完璧で機能し,他のポジションでは完全に機能しません

評価中のオブジェクトポジションは,あなたのトレーニングデータの分布の外にある.ポリシーでは,これらのポジションは以前に見られなかった.修正:より多様なオブジェクトポジションを持つより多くのデモを収集するか,あなたの評価をトレーニングデータでよく表現されたポジションに制限します.

ユニット5が完成したら...

試験は, sim でまたは実際のロボットで実施され,成功率を測定した.すべての失敗モードのビデオを視聴し,主要な失敗がデータ品質,モデル容量,または配分シフトかどうか確認した.この診断を書き下ろした.

[← 経路概要に戻る]