Booster K1 Pathに戻る

列車と部署

訓練作業流,評価メトリック,安全なライブデプロイプロトコルなど

5つのユニット 5 · 電車&部署 · ~6時間

学習の全身模倣方針をデータセットで訓練し,シミュレーションで評価し,安全モニタリングで実際のK1に展開します.目標:示範作業の成功率60%以上.

ステップ1: データセットをLeRobotフォーマットに変換する

python convert_k1_to_lerobot.py \
  --input-dir ./recordings/session_001/ \
  --output-dir ./dataset/k1-pick-place/ \
  --repo-id your-username/k1-pick-place \
  --success-only  # filters to episodes labeled success=true

ステップ 2: 拡散政策 を 採用 する

拡散ポリシーは,多モダルのアクション分布を処理し,スムーズな軌道を生成するため,全体作業にうまく機能します.NVIDIA GPU (16 GB VRAM推奨) でトレーニングは3~6時間かかります.

python -m lerobot.scripts.train \
  --dataset_repo_id=your-username/k1-pick-place \
  --policy.type=diffusion \
  --policy.obs_as_global_cond=true \
  --training.num_epochs=300 \
  --training.batch_size=64 \
  --output_dir=./checkpoints/k1-diffusion-v1

# Monitor training (open in browser)
tensorboard --logdir=./checkpoints/k1-diffusion-v1/logs/

訓練損失と検証損失曲線を注意してください. 検証損失が少なくとも20つの時代をかけて平らになったとき,トレーニングは完了します. 壁時間のみに基づいて訓練を早期に停止しないでください.

ステップ3: MuJoCo シミュレーションで評価する

python eval_policy_sim.py \
  --checkpoint=./checkpoints/k1-diffusion-v1/checkpoint_300.pt \
  --env=booster_gym/envs/pick_place.py \
  --num_episodes=20 \
  --render

目標:実用ハードウェアに導入される前にシミュレーションの成功率 ≥60% もし 60%未満なら,より多くのデモを収集 (ユニット4に戻る) またはデータ品質を確認する.

ステップ 4: リアルK1でのライブ展開

ポリシーを導入する際にすべての安全プロトコルは適用されます. 検出器が現れて,電子ストップテストされ,3m × 3m のクリアエリアがあります.最初のライブランニング中に,電子ストップに手を置きます.このポリシーは,エッジケースでは予期せぬ動きを生成します.

python deploy_policy.py \
  --checkpoint=./checkpoints/k1-diffusion-v1/checkpoint_300.pt \
  --robot-ip=192.168.10.102 \
  --cameras head_cam,external \
  --task "pick up the red block" \
  --max-episode-duration=30 \
  --safety-monitor=true

T5旗は,関節速度またはトークが安全基準を超えると自動DAMP倒れを可能にします.始発部署中に常にこの機能を有効にします.

政策 を 評価 する

統計的に意味のある成功率を得るために 20 つの評価試験を実行します

python eval_policy_live.py \
  --checkpoint=./checkpoints/k1-diffusion-v1/checkpoint_300.pt \
  --robot-ip=192.168.10.102 \
  --num-trials=20 \
  --log-results=./eval_results/k1-diffusion-v1-eval.json

各試行では,シーンをトレーニングデモと同じスタート設定にリセットしてください.失敗した試行における成功/失敗結果と失敗モードを記録します.一般的な失敗モードは:シーン変異 (照明,オブジェクト位置),simと実際の訓練データとの領域変更.

データ フライホイール

最初の展開後

  1. 評価ログからトップ3の失敗モードを特定します
  2. これらの故障モードを対象とした示範を収集する (ユニット4に戻る).
  3. 新しいエピソードを元のデータセット (50/50または失敗に重量化) に混ぜます.
  4. 目標達成率に達するまで繰り返します

ユニット5が完成したら...

訓練を受けた拡散政策またはACTチェックポイントがシミュレーションで ≥60%の成功率を達成している.K1に直接展開し,少なくとも10回の実世界の評価試験を実行している.トップの失敗モードを特定し,次のデータ収集セッションの計画を立てている.

道のり 完了

プースターK1で安全な電源から全身模倣学習方針に移行しました. RCSVフォーラム で結果を共有し, [データセット登録](T7にデータセットを寄与してください.

[← 経路概要に戻る]