列車と部署
O6 データセットに ACT や ディフュージョン ポリシーを訓練して,それをライブに展開します. 継続的な改善のためにトレーニングワークフロー,評価プロトコル,データフライホイール. ~3時間.
5つのユニット5 · 電車&部署 · ~3時間
50話のデータセットで模倣学習方針を訓練し,オフラインで評価し,O6でライブ展開する.目標:実世界の評価試験20件で70%以上の成功率.
政策構造を選択する
初心者向けに推奨
ACT (トランスフォーマーでアクション・チャンキング)
速トレーニング (1
拡散政策
ゆっくりとしたトレーニング (3
ステップ1: ACTで訓練する
python -m lerobot.scripts.train \
--dataset_repo_id=your-username/o6-pick-place \
--policy.type=act \
--policy.chunk_size=100 \
--training.num_epochs=200 \
--training.batch_size=32 \
--training.lr=1e-4 \
--output_dir=./checkpoints/o6-act-v1
# Monitor training loss
tensorboard --logdir=./checkpoints/o6-act-v1/logs/
ACTトレーニングは通常50エピソードデータセットで100~150エピソード以内に安定します.停止する前にプラトーへの検証損失を注意してください.トレーニング時間のみに基づいて早めに停止しないでください.
ステップ 2: オフライン評価
ハードウェアに展開する前に,データセットから終了したエピソードに関するチェックポイントを評価してください.
python -m lerobot.scripts.eval \
--pretrained_policy_name_or_path=./checkpoints/o6-act-v1 \
--env.type=linker_bot_o6_sim \
--eval.n_episodes=20 \
--eval.batch_size=10
システムにシムモデルがない場合は,データセットを再現評価器を使用してください.
python -m lerobot.scripts.visualize_dataset \
--repo-id your-username/o6-pick-place \
--episode-index 0 \
--policy-checkpoint ./checkpoints/o6-act-v1
ステップ3:O6でのライブ展開
python -m lerobot.scripts.control_robot \
--robot.type=linker_bot_o6 \
--control.type=evaluate \
--pretrained_policy_name_or_path=./checkpoints/o6-act-v1 \
--control.fps=30 \
--control.num_episodes=20 \
--control.episode_time_s=30
各試験:
- 標準のスタート位置に物体を置く.
- 腕がホームポジションで確認する
- 腕が自分と接触するまでは介入しないでください
- 失敗または成功を記録し,失敗モードを記入する.
解釈結果
| Success Rate | Action |
|---|---|
| ≥70% | Path complete. Share your results and contribute your dataset. |
| 50–69% | Collect 20–30 more episodes targeting your top failure mode. Retrain. |
| Below 50% | Review dataset quality. Check camera alignment and starting position consistency. Consider a simpler task variant. |
データ フライホイール
最初の展開後,継続的な改善:
- 評価日記から2
3の失敗モードを識別する. - これらの失敗をカバーする20~30件の標的示例を収集する.
- 新しいエピソードを元のデータセット (50/50または失敗への重量) に混ぜます.
- ゼロから再訓練 (チェックポイントからではなく
新たに訓練された場合,小さなデータセットで壊滅的な忘れるのを避ける). - 目標達成率に達するまで繰り返す
成果を分かち合う
# Push your trained policy to HuggingFace Hub
python -m lerobot.scripts.push_policy_to_hub \
--pretrained_policy_path=./checkpoints/o6-act-v1 \
--repo-id=your-username/o6-pick-place-act
ユニット5が完成したら...
あなたのACT (または拡散ポリシー) チェックポイントは,O6での20回のライブ評価試験で ≥70%の成功率を達成しています.あなたはすべての試験結果を記録し,残りの故障モードを特定しました.あなたのデータセットとポリシーチェックポイントはバックアップされ,オプションとして HuggingFace Hubで共有されます.
道のり 完了
リンクボットO6の解き放つから,生産中の模倣学習政策へと移行しました. RCSVフォーラム で結果を共有し,データセットを [データセットレジストリ](
[← 経路概要に戻る]







