Paxini Gen3 Pathに戻る

触覚 を 意識 する 政策 を 訓練 する

ACTまたは拡散ポリシーに触覚を観察モードとして追加し,データセットでトレーニングし,接触豊富な操作作業の視力ベースラインに比べて評価します.

5つ目のユニット 5 列車と部署 〜1.5時間 (+訓練時間)

分析の最終単位.ACTや拡散政策に触覚を観察方法として追加し,データセットから正常化統計を計算し,トレーニングを実行し,視力のみの基線を比較して評価します.

ステップ 1 タクチルモダリティを追加する

政策設定の延長

触覚観測は,完全な圧力地図 (空間,フレームあたり64値) または累積スケラー (合計_force_n) として追加できます.スケラーから始めると,ほとんどの操作作業に正常化し,十分です.あなたの作業に空間接触情報が必要であれば圧力地図を追加します (例えば,端対中央接触を区別する).

#レロボット/コンフィギュス/ポリシー/アクション_パクシニ.yaml ポリシー:名:アクションデータセット: repo_id:ローカル/パクシニ-グラスプ・プレイス観測_機能: -観測.状態 #関節位置 (7,) -観測.画像.腕時計 #腕時計カメラ (H,W,3) -観測.触動.総_力_n #スケール力 (1,) -観測.触動.接触_エリア_mm2 #スケールエリア (1,) #オプション:完全な圧力地図 # -観測.触動.圧力_地図 # (8, 8) 関節位置を平坦に (64,) \ 行動_機能: -行動 _領域 _平方mm2 #スケールエリア (1,) #オプション:完全な圧力地図 # -標的位置の観測 #

ステップ 2 計算標準化統計

標準化統計は,データセットから

標準化統計を常に特定データセットから計算する. 硬いコード値を使用しないでください. Paxini SDK は,このためのユーティリティを提供します.

# パクシニから記録されたデータセットから統計を計算します.データインポート計算_データセット_stats =計算_データセット_stats"./タクシール_データセット/") print(stats.to_yaml()) # 予想された出力 (例値): # 観測.タクシール.総_力_n: # 平均: 2.84 # std: 1.93 # min: 0.0 # max: 14.2 # 観測.タクシール.コンタクト_エリア_mm2: # 平均: 22.4 # std: 18.6 \ 保存保存する設定統計.save"./act_paxini_stats.yaml")

Tactile の 標準化 が 重要 な の は なぜか 力の 値 (020 N) は,関節 位置 (通常 ±π 半径) と ピクセル 値 (0255) と 全く 異なる 規模 で ある.

ステップ 3 訓練

訓練司令部

触覚設定で ACTトレーニングを開始します 訓練時間は8GBのGPUで45分,CPUで3時間

#LeRobotをインストールする インストールしていない場合は, pipをインストールする #Train ACTをタクティルのモードでインストールする #Train ACT python lerobot/scripts/train.py \ --config-name act_paxini \ --dataset-path ./tactile_dataset/ \ --stats-path ./act_paxini_stats.yaml \ --output-dir ./checkpoints/act_tactile/ \ --num-epochs 300 \ --batch-size 8 \ --seed 42 # 訓練損失をモニターする (別々の端末で) tensorboard --logdir ./checkpoints/act_tactile/logs/

テストは,検証損失の平原に達すると完了します. 100 Hz で50話の間,200250の頃の収束を期待します.TensorBoard のタクチル_obs_loss メトリックは,主要アクション損失とともに,安定的に減少します.

ステップ 4 評価と視力のみベースライン

視力 の 改善 を 評価 する

同じデータセットで視力+自感 (触覚チャネルなし) をのみ使用して2番目のポリシーを訓練します.これはベースラインです.目標課題の各ポリシーに対して20以上の展開を評価します.

# 視覚のみベースラインを訓練する (同じ設定,マイナスタクティブキー) python lerobot/scripts/train.py \ --config-name act_vision_only \ --dataset-path ./tactile_dataset/ \ --output-dir ./checkpoint/act_baseline/ # 両方策定を評価する 20回のロロロットはそれぞれ python lerobot/scripts/evall.py \ --checkpoint ./checkpoint/act_tactile/best.ck \ --num-episodes 20 \ ----name "tactile" python lerobot/scripts/evall.py --checkpoint ./checkpoint/act_baseline/best.ispt \ --num-epodes 20 \ --evall-line"

把握安定度指標の改善を図る 滑りやすい物体における作業成功率と配置段階における平均保持期間を図る.触覚意識の政策は,通常,変形可能および変量重量のある物体において最大の改善を示します.

タクチルの性能が向上しない場合はどうすればよいか まず,データセットの連絡先イベントがビデオと一致していることを確認してください (Unit 4品質チェック). 観測として 圧力マップを 足すのではなく スケーラー ではなく 濃厚な空間文脈を提供する

接下来は

次へ

[ 固定リンク ]

多センサー融合

指に触れる装置を 5本まで設定する デクステロスの手指ガイドは 多センサーのポリシーアーキテクチャをカバーします

フォース制御ループ

阻害制御のための反発信号として Gen3のリアルタイムストリームを使用する 検出された滑り事件に基づいて動的に握力調整する.

触覚からの報酬

補強学習の補習訓練の初期模倣学習の後に 補強学習の補習訓練のオンライン報酬信号として触覚からグレープ品質を使用します

道のり 完了

センサーの読み取りから触覚意識の操纵政策へと移行しました 接触に富んだあらゆる作業に適用できる ハードウェア,データ,ポリシーの完全なパイプラインがあります

ユニット5が完成したら...

訓練は誤りなく完了し,チェックポイントを生み出します.タクティブ・検証の損失は減少し,トレーニング中に高原化します.タクティブ・ポリシーと視覚のみベースラインの両方で20回の評価を実行し,比較のために成功率を記録しました.