OpenArm Pathに戻る

展開し 改善する

学習経路の6単位.実力的な腕で訓練された方針を実行し,体系的に評価し,データフライホイールを起動します. 目標: 7/10 自律的な成功率.

6つのユニット 6 部署・改善 · ~1.5時間

訓練された方針があります. リアルな腕にそれを入れ,厳格な評価をして,改善する方法を理解します. ここでデータフライホイールが始まります.

真の腕に 推論を 実行する

部署は,実時での訓練されたチェックポイントの実行,ネットワークにライブカメラと共同観測を供給し,物理的な腕で出力アクションを実行することを意味します.

source ~/openarm-env/bin/activate # ROS 2 が実行されていることを確認します (実硬件モード,ユニット 1 から) python -m lerobot.scripts.eval \ --policy-checkpoint ~/openarm-policy/pick-and-place-v1/checkpoint_XXXXX \ --device cuda \ --num-eval-episodes 10 \ --record-video \ --output-dir ~/openarm-s/v1 \ #

初期展開では,E-stopの近くで手を保持してください.新しい展開されたポリシーは,実際のハードウェア環境に暖かくなっている間に,時々予期せぬ動きを起こす可能性があります.最初の23エピソードではこれは普通です.その後,行動は安定する必要があります.

安全封筒や監視犬タイマーを含む包括的な部署と生産ガイドについては, [OpenArm Production Guide]T1を参照してください.

評価方法

政策を非公式に評価しないでください 構造化されたプロトコルを使用します 変更 (より多くのデータ,異なるチェックポイント,異なるタスクフレーム) が実際にパフォーマンスを向上させましたか?

Protocol Item Specification
Number of episodes per evaluation 10 minimum, 20 for high-confidence results
Object starting position Fixed. Use tape marks. Same position every episode.
Object type Same object as training. Lighting must match training conditions.
What counts as success Object placed within 3cm of target. Arm returns to home. No human intervention during episode.
Failure classification Log failure type: missed grasp / dropped object / wrong target / timeout. This tells you what to fix.
Report metric Success rate = successful episodes / total episodes. Report with episode count (e.g., "7/10 = 70%").

データのフライホイール: 改善する方法

機械学習の核心ループはデータフライホイールです.

1 年間

収集

失敗事例を含む 現行の政策の闘い

2 について

列車

拡張されたデータセットを新しいデモを追加で再訓練 (または細かな調整)

3 について

評価する

構造化評価プロトコルを実行します 成功率は改善されたか?

4 について

分析する

失敗動画を見て ポリシーが壊れた特定の状態を特定し 標的データを収集する

飛行車の重要な洞察: ターゲットデータがランダムデータより勝っている.50回のランダムデモを記録する代わりに,失敗ビデオを見て,物事がうまくいかない瞬間を正確に特定してください.その困難な状態を具体的にカバーする20回のデモを記録してください (例えば,作業場の端の把握,または異常な角度でオブジェクト). ランダムな50個よりも 20個目のデモで 成功を収めるでしょう

失敗 の 常見 な 方法 と その 解決 の 方法

  • Armは把握位置を超越する: ポリシーのアクションブロックは大きすぎたり,データには高速差がある. 把握点近くで遅い速度で10回のデモを記録する.またはトレーニング設定では100から50のT0を削減する.
  • **Armはトレーニングオブジェクトで成功するが,わずかに異なるオブジェクトで失敗する:**あなたのトレーニングデータはオブジェクト位置の多様性がない.10cm半径内の5つの異なる位置でオブジェクトを記録する20のデモ.これは政策を一般化することを教えます.
  • ポリシーが凍結または繰り返し動作を発生させる: CVAE スタイル変数は崩壊している.これはしばしばデータセットの変異度があまりにも多いことを意味します.

ユニット6 完成する...

腕は,構造化された評価実行で10回のうち7回で自律的にピックアンドプレイス作業を完了します. 3つの失敗ビデオを見て何が間違っていたかを特定しました.次の改善再演を計画するのに十分なデータフライホイールを理解しています.これは構造化された経路の終わりです.

やってくれた

ロボットを開箱にするから 訓練し,真似学習政策を導入するに至りました. ロボット腕を触った人の99%よりも先立つのです. ここで構築したものは, 遠隔操作の設定,データパイプライン,トレーニングワークフロー,あらゆるタスクやハードウェアにスケールします.

接下来は

基礎はここにあります ここから行くべきは

[ 固定リンク ]

OpenArm 生産ガイド

安全封筒 ウォッチドッグタイム 複数の腕のセットアップ 長期展開パターン

T2)

広報政策について

複数の戦略が有効である多モードタスクを訓練する. いくつかのタスクタイプではACTよりも優れた一般化です.

T3)

DK1 バイマン્યુઅલキット

双手作業の2つの同期腕 次のハードウェアステップは接触豊富な操作研究です

T4)

成果を分かち合う

コミュニティはすべての結果から学ぶ.

T5)

[← 経路概要に戻る]