DK1 Pathに戻る

双手 政策 を 実行 し,改善 する

DK1双手学習経路のユニット6 双手学習経路の2つの腕で推論を展開し,双手評価プロトコルを実行し,共通の双手障害モードを修正し,データフライホイールを起動します ~2時間

6の6つのユニット · 展開・改善 · ~2時間

訓練されたチェックポイントがあります 両腕に同時に配置し 双手プロトコルを使って 厳密に評価し システム的に改善できるように 双腕調整に特有の 障害モードを理解します

2つの腕のインフェルセンスの設定

双手推論は,両腕のアクションを同時に実行する単一のポリシーネットワークを実行します.観察-アクションループは,トレーニングデータと同じ周波数で 50Hz で実行されます. 両腕のフォロワー両腕はそれぞれのアクションブロックを同期的に実行します.

source ~/dk1-env/bin/activate # 最初の3つの評価エピソードでE-ストップの近くを保つ python -m lerobot.scripts.eval \ --policy-checkpoint ~/dk1-policy/cube-handoff-v1/checkpoint_XXXXX \ --robot-path ~/dk1-config.yaml \ --robot-type dk1_bimanual \ --device cuda \ --num-eval-episodes 10 \ --record-video \ --output-dir ~/dk1-evals/v1 # # ステップXXXXXをあなたの最高のチェックポイント (Unit 5の損失曲線から) と置き換える # --record-videoは,失敗分析のために両腕の異なる mp4ファイルとして保存します

予備式は,最初の12話で意外な動きを起こす.実態環境に適応する際に,二手式はしばしば意外な動きを生む. 310話は,意義ある評価データである. 政策が最終的に失敗しても 政策は一貫して同じ作業の段階 (アプローチ,把握,移転,場所,家) に達しているかどうかを確認します

双手による評価プロトコル

構造化されたプロトコルを使用します. 非公式な評価は"うまくいっているようです" 双手政策では信頼性が低いため,部分的な成功はより多いため,根本的に破綻した交付を隠すことができます.

Protocol Item Bimanual Specification
Number of episodes 10 minimum; 20 for high-confidence results before adding more data
Cube starting position Fixed, tape-marked position — same as your Unit 4 training setup
Lighting Must match training conditions. Even opening a window can shift lighting enough to affect the workspace camera
What counts as full success Cube starts on right side, ends on left side, both arms return to home pose, no human contact during episode
What counts as partial success Correct grasp achieved but transfer fails, or transfer succeeds but placement is off-target. Log these separately.
Failure classification Log: (A) grasp failure, (B) handoff failure — arm-to-arm transfer drops, (C) placement failure, (D) timeout. The handoff failure category (B) is unique to bimanual and most informative for improvement.
Report metric Full success rate (episodes with all 4 phases correct). Also report partial success rate. Example: "4/10 full, 7/10 reached handoff phase".

共通した二手作業障害モード

これらの故障モードは,単臂故障から区別され,双手による特定修正が必要である.

  • **腕は交付地点に異議性的に到着する:**一腕が交付地点に到達し,待ち伏せする.もう一方の腕は遅刻する.政策は腕間の相対的なタイミングを学んでいない.修正:両腕が交付地点に明示的に12秒間休止する20回の示例を追加する.これは,交付完了する前に,データを明示的に同期する必要性を高める.
  • **Handoff drop キューブは両腕の間に落ちる:**最も一般的な双手間特有の故障.受信腕は,与える腕の放出に対して,グリッパーを早すぎ,遅すぎに閉じる.修正:特に25%の速度で15回の遅動のハンドオフデモを収集する.過度にタイミングは,グリッパー状態の移行シーケンスについて政策により明確な信号を与える.
  • **政策は,単腕戦略に収束する.**政策は,他の腕の能力を無視して,一つの腕だけで任務を完了することを学んでいる.これは,一方の腕の示範が他の腕よりも一貫しているときに起こります.修正:訓練曲線 (ユニット 5) からそれぞれの腕のアクションエラーをレビューし,特に弱い腕の段階をターゲットとする追加デモを収集します.
  • 両腕間の衝突: 両腕が同じ作業場位置を占領しようと試みる.これは安全イベントです. 評価中にDK1ハードウェアサーバー (T0 dk1-config.yaml) で衝突回避を可能にします. 安全な腕の分離を一貫して尊重するデモの訓練によりほとんどの衝突が防止されます. ハードウェアレベルの警備は端ケースを処理します.
  • ** 配備時に段階の解同化:** ポリシーは正しいアクションを実行しますが,正しい時間順に実行されません.

双手改良のためのデータフライホイール

単臂ポリシーで動作する改善ループは,双手動で動作し,双手動の特定の追加があります.タスクシーケンスの _first_失敗モードを常にターゲットにします.ハプ (フェーズB) がまだ不一致である場合は,ハンドオフ (フェーズA) を改善することはできません.タスクシーケンスの順序で失敗を修正します.

1 年間

評価する

10話を実行する.各失敗を段階 (A/B/C/D) に別別別する

2 について

ターゲット

最初の失敗段階を特定する.その段階を特定する20~30のデモを収集する

3 について

訓練を繰り返す

ターゲットデモをデータセットに追加します.ゼロから訓練または最高のチェックポイントを細かく調整します

4 について

評価する

10話を再生して 完全成功率が改善されたか? 次の失敗段階に移ります

接下来は

立方交差は,より複雑な作業の基礎です.

[ 固定リンク ]

変速電波操作

圧力の反射が最適な運動速度を変える接触型作業のための速度適応式テレ操作

T2)

優雅 な 手 を 添え

手操作を精密にする作業で指のレベルの技巧を高めるために DK1腕とオークハンドを組み合わせる.

T3)

データをスケールする

操作者,タスク,およびハードウェア構成を介して二手動データ収集をスケールする技術.

T4)

成果を分かち合う

DK1フォーラムに成功率やデータセット,ポリシーを掲載します 双手作業の結果はコミュニティが収集する最も価値のあるものです

T5)

ユニット6 完成する...

DK1 は,構造化評価で少なくとも6/10の完全な成功率で,キューブハンドオフタスクを自動で完了します.すべての失敗エピソードを段階 (A/B/C/D) に別類し,どの段階がほとんどの失敗に責任があるかを特定しました.失敗ビデオを見ていて,何が間違っていたかを具体的に述べることができます. 更に改善の再演算を計画するのに十分な 双手データフライホイールを理解しています

機械学習システムを作りました

リーダー/フォロワーアーキテクチャを構成し,同期化された2つの腕のデモを収集し,ゼロから調整されたポリシーを訓練し,実際のハードウェアに展開しました.このレベルでの二手操作は研究ラボが活動する場所です.ここで構築した基盤は,この道を始める前に到達できない組み立て,調理,接触豊富な作業にスケールします.

[← 経路概要に戻る]