列車と部署
訓練作業流,評価メトリック,安全なライブデプロイプロトコルなど
5つのユニット 5 · 電車&部署 · ~6時間
学習の全身模倣方針をデータセットで訓練し,シミュレーションで評価し,安全モニタリングで実際のK1に展開します.目標:示範作業の成功率60%以上.
ステップ1: データセットをLeRobotフォーマットに変換する
python convert_k1_to_lerobot.py \
--input-dir ./recordings/session_001/ \
--output-dir ./dataset/k1-pick-place/ \
--repo-id your-username/k1-pick-place \
--success-only # filters to episodes labeled success=true
ステップ 2: 拡散政策 を 採用 する
拡散ポリシーは,多モダルのアクション分布を処理し,スムーズな軌道を生成するため,全体作業にうまく機能します.NVIDIA GPU (16 GB VRAM推奨) でトレーニングは3~6時間かかります.
python -m lerobot.scripts.train \
--dataset_repo_id=your-username/k1-pick-place \
--policy.type=diffusion \
--policy.obs_as_global_cond=true \
--training.num_epochs=300 \
--training.batch_size=64 \
--output_dir=./checkpoints/k1-diffusion-v1
# Monitor training (open in browser)
tensorboard --logdir=./checkpoints/k1-diffusion-v1/logs/
訓練損失と検証損失曲線を注意してください. 検証損失が少なくとも20つの時代をかけて平らになったとき,トレーニングは完了します. 壁時間のみに基づいて訓練を早期に停止しないでください.
ステップ3: MuJoCo シミュレーションで評価する
python eval_policy_sim.py \
--checkpoint=./checkpoints/k1-diffusion-v1/checkpoint_300.pt \
--env=booster_gym/envs/pick_place.py \
--num_episodes=20 \
--render
目標:実用ハードウェアに導入される前にシミュレーションの成功率 ≥60% もし 60%未満なら,より多くのデモを収集 (ユニット4に戻る) またはデータ品質を確認する.
ステップ 4: リアルK1でのライブ展開
python deploy_policy.py \
--checkpoint=./checkpoints/k1-diffusion-v1/checkpoint_300.pt \
--robot-ip=192.168.10.102 \
--cameras head_cam,external \
--task "pick up the red block" \
--max-episode-duration=30 \
--safety-monitor=true
政策 を 評価 する
統計的に意味のある成功率を得るために 20 つの評価試験を実行します
python eval_policy_live.py \
--checkpoint=./checkpoints/k1-diffusion-v1/checkpoint_300.pt \
--robot-ip=192.168.10.102 \
--num-trials=20 \
--log-results=./eval_results/k1-diffusion-v1-eval.json
各試行では,シーンをトレーニングデモと同じスタート設定にリセットしてください.失敗した試行における成功/失敗結果と失敗モードを記録します.一般的な失敗モードは:シーン変異 (照明,オブジェクト位置),simと実際の訓練データとの領域変更.
データ フライホイール
最初の展開後
- 評価ログからトップ3の失敗モードを特定します
- これらの故障モードを対象とした示範を収集する (ユニット4に戻る).
- 新しいエピソードを元のデータセット (50/50または失敗に重量化) に混ぜます.
- 目標達成率に達するまで繰り返します
ユニット5が完成したら...
訓練を受けた拡散政策またはACTチェックポイントがシミュレーションで ≥60%の成功率を達成している.K1に直接展開し,少なくとも10回の実世界の評価試験を実行している.トップの失敗モードを特定し,次のデータ収集セッションの計画を立てている.
道のり 完了
プースターK1で安全な電源から全身模倣学習方針に移行しました. RCSVフォーラム で結果を共有し, [データセット登録](
[← 経路概要に戻る]







