展開し 改善する
学習経路の6単位.実力的な腕で訓練された方針を実行し,体系的に評価し,データフライホイールを起動します. 目標: 7/10 自律的な成功率.
6つのユニット 6 部署・改善 · ~1.5時間
訓練された方針があります. リアルな腕にそれを入れ,厳格な評価をして,改善する方法を理解します. ここでデータフライホイールが始まります.
真の腕に 推論を 実行する
部署は,実時での訓練されたチェックポイントの実行,ネットワークにライブカメラと共同観測を供給し,物理的な腕で出力アクションを実行することを意味します.
source ~/openarm-env/bin/activate # ROS 2 が実行されていることを確認します (実硬件モード,ユニット 1 から) python -m lerobot.scripts.eval \ --policy-checkpoint ~/openarm-policy/pick-and-place-v1/checkpoint_XXXXX \ --device cuda \ --num-eval-episodes 10 \ --record-video \ --output-dir ~/openarm-s/v1 \ #
初期展開では,E-stopの近くで手を保持してください.新しい展開されたポリシーは,実際のハードウェア環境に暖かくなっている間に,時々予期せぬ動きを起こす可能性があります.最初の2
安全封筒や監視犬タイマーを含む包括的な部署と生産ガイドについては, [OpenArm Production Guide]
評価方法
政策を非公式に評価しないでください 構造化されたプロトコルを使用します 変更 (より多くのデータ,異なるチェックポイント,異なるタスクフレーム) が実際にパフォーマンスを向上させましたか?
| Protocol Item | Specification |
|---|---|
| Number of episodes per evaluation | 10 minimum, 20 for high-confidence results |
| Object starting position | Fixed. Use tape marks. Same position every episode. |
| Object type | Same object as training. Lighting must match training conditions. |
| What counts as success | Object placed within 3cm of target. Arm returns to home. No human intervention during episode. |
| Failure classification | Log failure type: missed grasp / dropped object / wrong target / timeout. This tells you what to fix. |
| Report metric | Success rate = successful episodes / total episodes. Report with episode count (e.g., "7/10 = 70%"). |
データのフライホイール: 改善する方法
機械学習の核心ループはデータフライホイールです.
1 年間
収集
失敗事例を含む 現行の政策の闘い
2 について
列車
拡張されたデータセットを新しいデモを追加で再訓練 (または細かな調整)
3 について
評価する
構造化評価プロトコルを実行します 成功率は改善されたか?
4 について
分析する
失敗動画を見て ポリシーが壊れた特定の状態を特定し 標的データを収集する
飛行車の重要な洞察: ターゲットデータがランダムデータより勝っている.50回のランダムデモを記録する代わりに,失敗ビデオを見て,物事がうまくいかない瞬間を正確に特定してください.その困難な状態を具体的にカバーする20回のデモを記録してください (例えば,作業場の端の把握,または異常な角度でオブジェクト). ランダムな50個よりも 20個目のデモで 成功を収めるでしょう
失敗 の 常見 な 方法 と その 解決 の 方法
- Armは把握位置を超越する: ポリシーのアクションブロックは大きすぎたり,データには高速差がある. 把握点近くで遅い速度で10回のデモを記録する.またはトレーニング設定では100から50のT0
を削減する. - **Armはトレーニングオブジェクトで成功するが,わずかに異なるオブジェクトで失敗する:**あなたのトレーニングデータはオブジェクト位置の多様性がない.10cm半径内の5つの異なる位置でオブジェクトを記録する20のデモ.これは政策を一般化することを教えます.
- ポリシーが凍結または繰り返し動作を発生させる: CVAE スタイル変数は崩壊している.これはしばしばデータセットの変異度があまりにも多いことを意味します.
ユニット6 完成する...
腕は,構造化された評価実行で10回のうち7回で自律的にピックアンドプレイス作業を完了します. 3つの失敗ビデオを見て何が間違っていたかを特定しました.次の改善再演を計画するのに十分なデータフライホイールを理解しています.これは構造化された経路の終わりです.
やってくれた
ロボットを開箱にするから 訓練し,真似学習政策を導入するに至りました. ロボット腕を触った人の99%よりも先立つのです. ここで構築したものは, 遠隔操作の設定,データパイプライン,トレーニングワークフロー,あらゆるタスクやハードウェアにスケールします.
接下来は
基礎はここにあります ここから行くべきは
[ 固定リンク ]
OpenArm 生産ガイド
安全封筒 ウォッチドッグタイム 複数の腕のセットアップ 長期展開パターン
広報政策について
複数の戦略が有効である多モードタスクを訓練する. いくつかのタスクタイプではACTよりも優れた一般化です.
DK1 バイマン્યુઅલキット
双手作業の2つの同期腕 次のハードウェアステップは接触豊富な操作研究です
成果を分かち合う
コミュニティはすべての結果から学ぶ.
[← 経路概要に戻る]







