LinkerBot O6 Pathに戻る

列車と部署

O6 データセットに ACT や ディフュージョン ポリシーを訓練して,それをライブに展開します. 継続的な改善のためにトレーニングワークフロー,評価プロトコル,データフライホイール. ~3時間.

5つのユニット5 · 電車&部署 · ~3時間

50話のデータセットで模倣学習方針を訓練し,オフラインで評価し,O6でライブ展開する.目標:実世界の評価試験20件で70%以上の成功率.

政策構造を選択する

初心者向けに推奨

ACT (トランスフォーマーでアクション・チャンキング)

速トレーニング (12h 16GB GPU). ピックアンド・プレスと短距離の作業に最適. O6テーブルタップ操作のデフォルト選択.

拡散政策

ゆっくりとしたトレーニング (35h) が多モードアクション分布をよりうまく処理する.複数の有効な完了経路を持つ作業に使用する.

ステップ1: ACTで訓練する

python -m lerobot.scripts.train \
  --dataset_repo_id=your-username/o6-pick-place \
  --policy.type=act \
  --policy.chunk_size=100 \
  --training.num_epochs=200 \
  --training.batch_size=32 \
  --training.lr=1e-4 \
  --output_dir=./checkpoints/o6-act-v1

# Monitor training loss
tensorboard --logdir=./checkpoints/o6-act-v1/logs/

ACTトレーニングは通常50エピソードデータセットで100~150エピソード以内に安定します.停止する前にプラトーへの検証損失を注意してください.トレーニング時間のみに基づいて早めに停止しないでください.

ステップ 2: オフライン評価

ハードウェアに展開する前に,データセットから終了したエピソードに関するチェックポイントを評価してください.

python -m lerobot.scripts.eval \
  --pretrained_policy_name_or_path=./checkpoints/o6-act-v1 \
  --env.type=linker_bot_o6_sim \
  --eval.n_episodes=20 \
  --eval.batch_size=10

システムにシムモデルがない場合は,データセットを再現評価器を使用してください.

python -m lerobot.scripts.visualize_dataset \
  --repo-id your-username/o6-pick-place \
  --episode-index 0 \
  --policy-checkpoint ./checkpoints/o6-act-v1

ステップ3:O6でのライブ展開

python -m lerobot.scripts.control_robot \
  --robot.type=linker_bot_o6 \
  --control.type=evaluate \
  --pretrained_policy_name_or_path=./checkpoints/o6-act-v1 \
  --control.fps=30 \
  --control.num_episodes=20 \
  --control.episode_time_s=30

各試験:

  1. 標準のスタート位置に物体を置く.
  2. 腕がホームポジションで確認する
  3. 腕が自分と接触するまでは介入しないでください
  4. 失敗または成功を記録し,失敗モードを記入する.

解釈結果

Success Rate Action
≥70% Path complete. Share your results and contribute your dataset.
50–69% Collect 20–30 more episodes targeting your top failure mode. Retrain.
Below 50% Review dataset quality. Check camera alignment and starting position consistency. Consider a simpler task variant.

データ フライホイール

最初の展開後,継続的な改善:

  1. 評価日記から23の失敗モードを識別する.
  2. これらの失敗をカバーする20~30件の標的示例を収集する.
  3. 新しいエピソードを元のデータセット (50/50または失敗への重量) に混ぜます.
  4. ゼロから再訓練 (チェックポイントからではなく 新たに訓練された場合,小さなデータセットで壊滅的な忘れるのを避ける).
  5. 目標達成率に達するまで繰り返す

成果を分かち合う

# Push your trained policy to HuggingFace Hub
python -m lerobot.scripts.push_policy_to_hub \
  --pretrained_policy_path=./checkpoints/o6-act-v1 \
  --repo-id=your-username/o6-pick-place-act

ユニット5が完成したら...

あなたのACT (または拡散ポリシー) チェックポイントは,O6での20回のライブ評価試験で ≥70%の成功率を達成しています.あなたはすべての試験結果を記録し,残りの故障モードを特定しました.あなたのデータセットとポリシーチェックポイントはバックアップされ,オプションとして HuggingFace Hubで共有されます.

道のり 完了

リンクボットO6の解き放つから,生産中の模倣学習政策へと移行しました. RCSVフォーラム で結果を共有し,データセットを [データセットレジストリ](T6に寄与します.

[← 経路概要に戻る]