Guidesに戻る

アクション・チャンキング・トランスフォーマー (ACT): ロボット模倣学習のための完全なガイド (2026)

マスターACT (アクションチャンキングトランスフォーマー):建築,実際のロボットデータに関するトレーニング,チャンクサイズ調整,OpenArmおよびモバイルALOHAでの展開.PyTorchコード,ハイパーパラメーターガイド,データセットフォーマット仕様を含む.

[←ガイド]

ロボット操作のための最も効率的なデータ模倣学習アルゴリズムであるACTに深く潜入する.アーキテクチャ,CVAEコンディショニング,部品サイズ調節,PyTorchとLeRobotとのトレーニング,ハイパーパラメータ最適化,ハードウェア選択,故障モード,展開戦略をカバーする.

行動 減量 は 何 です か

標準行動クローンでは,現在の観測から次の行動が予測される.これは理論的には有効だが,実践では崩壊する.小規模な予測誤差が時間とともに蓄積され,ロボットは訓練中に見られなかった状態に漂うことが原因となる.この _compounding error_問題は,天才的な行動クローンにおける根本的な制限である.

アクションチャンキングは,将来のアクションの連続を同時に予測することで解決する.通常は50~100時間ステップです. "ロボットは今何をすべきか?"という質問の代わりに,モデルは"ロボットが次の2秒間に何をすべきか?"と答える.これはネットワークを騒音なステップ・バイ・ステップ予測ではなく,一貫した,時間的に一貫した軌道を生成するよう強制します.

洞察は単純です.カップを握ると,あなたは独立して毎ミリ秒を決定しません.あなたは単一の単位として滑らかな移動を計画します.アクション・チャンキングはモデルに同じ構造を与えます. 重要なことに,重複する塊は タイムロアサンブルングによって混ざり合わされ,その平均は隣接する塊からの予測を構成し,軌道をさらに平滑させ,塊の境界線での緊張を軽減します.

ACT(Action Chunking with Transformers) は,2023年にスタンフォード大学でトニー・シャオ等が導入した.このアクション・チャッキングのアイデアをCVAE (Conditional Variational オートエンコーダー) トランスフォーマーアーキテクチャと組み合わせた.結果として,最もデータ効率的な模倣学習アルゴリズムが利用可能となった.

暫定抽象:有効な視野を縮小する

標準BCでは,各予測化合物がエラーを発生させる. 100の部品サイズで,同じ作業には 35の部品予測のみが必要.効果的な意思決定の視界は2050x縮小し,学習問題を劇的に容易にする.

ACTは,観察から7DOFアクション (典型的なロボット腕) にマッピングを学ぶ代わりに,観察から100×7アクション軌道を学習します.軌道の構造は強い自己監督を提供します.

ACT 建築 深層ダイビング

ACTは,トランスフォーマーエンコード・デコーダーバックboneを搭載した条件変異自動エンコード (CVAE) を使用している.このアーキテクチャを理解することは効果的なトレーニングとデバッグに不可欠である.

CVAE 枠組み

CVAE は標準のエンコード・デコーダーパイプラインに潜伏変数 z を追加する.訓練中に,エンコードは現在の状態と ground truth action sequence を両方観察し,それらを z の分布に圧縮する.デコーダーはこの分布と現在の観測からサンプルを取り,アクションシーケンスを再構築する.

結論付けの際に,エンコードは捨てられます.デコードは**先からサンプル (標準正常分布) を受信し,現在の観測からアクション部分を生成します. KL 差分期は,後部が先部に近い状態を維持することを保証します.したがって,試験時に先部からサンプルを採取すると合理的なアクションシーケンスが生成されます.

CVAE構造は重要な目的を果たしている.この構造はイントラデモ・変性を捕捉する.単一の作業でも,正確な軌道はデモ間 (略微異なる把握角度,タイミング,接近路線) に異なる.潜伏変数 _z_はこの変数を捕捉し,デコッダーが多様なが有効な軌道を生成できるようにする.

暗号化アーキテクチャ

ACTエンコードは,多モダルの入力処理を行う.

  • カメラ画像:視覚の背骨を通過 (デフォルトとしてResNet-18,ViTオプション).複数のカメラビュー (腕 +上頭) は独立してコンカネ化され処理されます.
  • **関節位置 (qpos) **:現在のロボット関節角,通常は腕1つに67 DOFとグリッパー状態.
  • **アクションシーケンス (訓練のみ) **: _k_将来のアクションの基本真実部分,CVAEエンコードが後の分布を計算するために使用する.

入力はトークン化され,トランスフォーマーエンコードに入力されます.出力は,後部分布の平均と変異に投影される潜伏表現です.

解読器アーキテクチャ

解読器は,学習可能なアクションクエリを**つなぐ標準的なトランスフォーマー解読器である. _k_クエリがある (部分の時間ステップごとに1つ),それぞれが学習された埋め込みとして初期化される.解読器は,暗号化された観測トークンとサンプルされた latente z を交互的に処理し,線形投影ヘッドを通じて _k_アクションベクトルを出力する.

予測された動作は,関節位置目標 (67 DOF/腕) とグリッパー開閉/閉じるコマンドを含むベクトルである.予測された動作と地面真実の動作の間には,損失はL1 (平均絶対エラー) と,Bで重量化された KL差項が加算される.

損失機能

# ACT loss computation (simplified)
L_reconstruction = L1_loss(predicted_actions, target_actions)  # [batch, chunk_size, action_dim]
L_kl = KL_divergence(posterior_mean, posterior_logvar, prior)  # regularize latent space
L_total = L_reconstruction + beta * L_kl                       # beta typically 10-20

KL 項における β 体重は,再構築精度と潜伏空間規則性との間の妥協を制御する.あまりにも低い:モデルは先のものを無視し,テスト時に不一致な行動を生成する.あまりにも高い:モデルは平均的な行動に崩壊し,表現力を失います.

数学的な直感: 部品サイズ選択

部品サイズ k は ACT の最も重要な超パラメーターである. これはモデルが各ステップで予測する将来のアクションを決定する.

制御周波数関係

50 Hz制御 (ほとんどのロボット腕の標準) で,小型の大きさの地図は予測の視界に直接表示される.

Chunk Size Prediction Horizon Best For
25 0.5 seconds Very fast reactive tasks, contact transitions
50 1.0 second Quick pick-and-place, single-arm tasks under 3 seconds
100 2.0 seconds Default — most tabletop manipulation tasks
150 3.0 seconds Slow precision tasks (insertion, assembly)
200 4.0 seconds Long-horizon smooth motions (pouring, wiping)

理想的な部品サイズは,約1つの完全なサブモーションをカバーする必要があります.ピックアンド・プレスタスクでは, リーチ-to-Grab 動作は1.5秒かかります. chunk_size=75100は全体のアプローチを捕捉します. 部品が短すぎると,モデルは完全な動きを計画することはできません. モデルが長くすぎると,次の部品がとにかく覆う遠い将来の行動を予測する能力を浪費します.

臨時組成

ACTは,部署中に,各時間ステップ (または数時間ステップ) で新しい部品を生成します.各制御ステップで,実行されたアクションは重量平均で重複する部品予測です.

# Temporal ensembling (exponential weighting)
# w controls the blending — lower w gives more weight to recent predictions
w = 0.01  # default temporal ensembling weight
for t in range(episode_length):
    new_chunk = policy.predict(observation_t)  # shape: [chunk_size, action_dim]
    for i in range(chunk_size):
        all_predictions[t + i].append(new_chunk[i])

    # Weighted average with exponential decay
    weights = [np.exp(-w * j) for j in range(len(all_predictions[t]))]
    action_t = np.average(all_predictions[t], weights=weights, axis=0)

時間の集合量 w (通常は0.01) は,古い予測がどのように急速に衰退するかを制御する.より小さな w は,古い予測により多くの重量を与え (柔らかいが反応する速度が遅い).より大きな w は,最も最近の予測 (より反応的が緊張する可能性がある) を好む.

ACTに関するデータ収集要件

ACTはデータ効率が非常に高いが,データ品質は極めて重要です. ごみ出しは, ごみ出しは,強く適用されます 清潔なデモ50件は,騒音なデモ500件を上回ります.

最低のエピソード数

Task Category Episodes Needed Expected Success Rate Collection Time
Simple pick-and-place 50–100 85%+ 2–4 hours
Bimanual coordination 100–200 80%+ 4–8 hours
精度(再現性) insertion (peg-in-hole) 200–400 70%+ 1–2 days
Complex multi-step tasks 500+ 60%+ 2–5 days
Dexterous manipulation 500–1,000 50%+ 1–2 weeks

データ品質チェックリスト

  • 一貫した示例: 1 つのオペレーター (または非常に類似したスタイルを持つオペレーター) を使用する.ACT は単模的アクション分布を前提とする.
  • 固定物体配置ゾーン:物体はほぼ同じ領域からスタートする (差異は5cm).ACTは,明確に訓練されていない限り,大きな空間変化にうまく一般化しない.
  • クリーンスタート/エンド状態:各エピソードは同じホームポジションから始まり,クリーンに終わらなければならない (物体にグリッパーを閉じて,物体をターゲットに配置する). 切り落としたまたは失敗したエピソードは除外されるべきである.
  • 一貫したタイミング: デモンストレーションで同じ速度で作業を実行してみてください. 時間の大きな変動により,アクション分布は曖昧になります.
  • カメラ安定:カメラはしっかりと設置する必要があります.エピソード間のカメラの変更はパフォーマンスを大幅に低下させます.

HDF5 データフォーマット

RCSVは,ACTトレーニングの標準であるHDF5形式で収集されたすべてのデータを提供します.各エピソードは以下の構造を持つ単一のHDF5ファイルとして保存されます.

# HDF5 episode structure for ACT training
episode_0.hdf5
├── observations/
│   ├── qpos          # [T, 7] — joint positions (6 DOF + gripper)
│   ├── qvel          # [T, 7] — joint velocities
│   ├── images/
│   │   ├── cam_high  # [T, 480, 640, 3] — overhead camera
│   │   └── cam_wrist # [T, 480, 640, 3] — wrist camera
│   └── effort        # [T, 7] — joint torques (optional)
├── action            # [T, 7] — target joint positions
└── attrs/
    ├── sim           # False (real robot data)
    ├── compress      # True
    └── num_timesteps # T

ACT準備のデータ収集サービスについては, [RCSVデータサービス]T7を参照してください. 私たちは,高品質管理,およびHDF5またはLeRobot Parquet形式でキャリブレットされたマルチカメラ設定,訓練されたオペレーター,配送を提供しています.

カメラの設置に関する勧告

ACTの性能はカメラの構成に依存する.オリジナルの ALOHA設定では3台のカメラを使用している.

  • **Overhead camera (required) **:作業場から0.81.2m上を設置し,直下に向いている.シーンとオブジェクトの位置を全視する.解像度:最小640×480
  • **手首カメラ (強く推奨) **:ロボットの手首や前腕に搭載されている. 握り込みと挿入中に近視を提供する. 上のカメラが細かい詳細を解決できない精密な作業に不可欠である.
  • **サイドカメラ (オプション) **: 上の頭と腕の視界が欠けている深度情報を提供します. 垂直の積み重ねや高度に敏感な配置を含む作業に最も役立ちます.

USB 3.0 カメラ (Logitech C920 または Intel RealSense D405) を使用し,固定曝光とホワイトバランスをとる.自動曝光は,エピソード間の画像明るさが不一致する原因で,トレーニングを劣化します.

訓練 進行

このセクションでは,LeRobotの枠組みとPyTorchの直接実装の両方を利用してACT政策のトレーニングを進みます.

レロボット (推奨) の訓練

ハグジング・フェイスの [LeRobot]T8) は2026年にACTトレーニングの最もアクセス可能なフレームワークです.

# Step 1: Install LeRobot
pip install lerobot

# Step 2: Convert HDF5 data to LeRobot format
python -m lerobot.scripts.convert_dataset \
  --raw-dir ./my_episodes/ \
  --repo-id my-org/pick-place-task \
  --raw-format hdf5_aloha

# Step 3: Train ACT policy
python -m lerobot.scripts.train \
  policy=act \
  dataset_repo_id=my-org/pick-place-task \
  training.num_epochs=2000 \
  training.batch_size=8 \
  policy.chunk_size=100 \
  policy.n_action_steps=100 \
  policy.dim_model=512

# Step 4: Evaluate
python -m lerobot.scripts.eval \
  --pretrained-policy-name-or-path outputs/train/act_pick-place-task/checkpoints/last/pretrained_model \
  --env-name real_world \
  --n-episodes 20

訓練は通常,1回 RTX 4090 で28時間間で100200エピソード間収束する.L1のアクション損失を監視する.

直線パイトーク訓練設定

訓練ループのコントロールを高めたい,または ACTをカスタマイズされたパイプラインに統合したいチームのために:

# ACT training configuration — direct PyTorch implementation
import torch
from act.policy import ACTPolicy
from act.train import train_bc

config = {
    # Architecture
    'chunk_size': 100,          # action chunk length (timesteps)
    'hidden_dim': 512,          # transformer hidden dimension
    'dim_feedforward': 3200,    # feedforward network dimension
    'num_encoder_layers': 4,    # transformer encoder layers
    'num_decoder_layers': 7,    # transformer decoder layers
    'nheads': 8,                # attention heads
    'latent_dim': 32,           # CVAE latent dimension

    # Training
    'lr': 1e-5,                 # learning rate (Adam)
    'weight_decay': 1e-4,       # L2 regularization
    'num_epochs': 2000,         # total training epochs
    'batch_size': 8,            # batch size (8 fits on 24 GB VRAM)
    'kl_weight': 10,            # beta for KL divergence term
    'seed': 42,

    # Data
    'camera_names': ['cam_high', 'cam_wrist'],
    'image_size': [480, 640],   # H, W
    'action_dim': 7,            # 6 DOF + gripper
    'state_dim': 7,             # joint positions

    # Augmentation
    'color_jitter': True,       # random brightness/contrast
    'random_crop': True,        # spatial augmentation
}

# Initialize and train
policy = ACTPolicy(config)
optimizer = torch.optim.AdamW(policy.parameters(), lr=config['lr'], weight_decay=config['weight_decay'])
train_bc(policy, optimizer, dataloader, config)

訓練 の 技巧

  • 学習率: 1e-5からスタートする. ACTは学習率に敏感です. 学習の速度はあまりにも高い (1e-4) で,トレーニングの不安定性が生じ,あまりにも低い (1e-6) で,非常にゆっくりと収束します.
  • ** バッチサイズ**: 24 GB VRAM (RTX 4090) に 8 を使用する. 12 GB VRAM (RTX 3060) に 4 に減らする. A100 の大きなバッチ (1632) は安定性を向上させる.
  • Epochs: 2000年代間の電車最低. ACTは長い高原の後,しばしば 1000~1500年代周辺の急激な改善を示します.
  • チェックポイントは500回ごとに保存します 保存されたチェックポイントをすべて評価します チェックポイントは常に最適ではありません
  • アクション正常化:データセット統計を使用して動作を[-1, 1]に正常化します.関節因子訓練失敗ごとに異なるスケールで非正常化された動作.

ハイパーパラメーター調整ガイド

ACTは Diffusion Policyよりも低量のハイパーパラメータを持っていますが,新しいタスクごとに注意深く調整する必要があります.

パーツサイズ (パーツサイズ)

決定の過程を 実行する

  1. 作業中の単一のサブモーションの平均期間を測定する (例えば,オブジェクトに到達する時間: 1.5 s).
  2. 制御周波数で倍する: 1.5 s × 50 Hz = 75 時間のステップ.
  3. 丸め直して25に 丸め直して
  4. 作業が非常に異なる段階 (到達,把握,引き戻り) を構成している場合は,その部分は少なくとも1つの完全な段階をカバーする必要があります.

間違ってるのさ

  • 機械は過渡時に躊躇し 動きが鈍い 動きの中途中に引っ掛かります
  • 機械は任務の終結を過度に予測し 早期に動きをしたり 未来を予測する必要のない訓練能力を無駄にしたりします

KL重量 (kl_重量 / β)

CVAEの調整を制御する デフォルトは10

  • β = 0: CVAE の 規則化 は ない.モデル は 標準 的 な 行動 克ロニング に 堕落 し て いる (隠れ 変数 は ない). これを ベースライン として 使い て ください. しかし, より 悪い 性能 を 期待 する.
  • β = 10 (デフォルト):ほとんどの作業に適したバランス. 潜伏空間は崩壊せずに示範変性性を捕捉します.
  • β = 2050:より強い規則化により,より一貫した (変数少ない) 軌道を生み出す.示例が既に非常に一貫している場合,有用である.
  • β > 100: 強いすぎます. モデルはデータを無視し,平均的な行動を生み出します. 避けましょう.

查询数 (数_查询数)

初期 ACT では,num_queries は chunk_size (時間ステップごとに1つのクエリ) に等しい.一部の実装では,これらのクエリを分離させ,アップサンプリングレイヤーでクエリを少なくする.これを変更する具体的な理由がない限り,num_queries = chunk_size を保持してください.

視覚の脊椎

ResNet-18はデフォルトで,ほとんどのタスクではうまく動作します.

  • **ViT (DINOv2) **: 細かい視覚的理解 (ラベルを読む,正確な調整) を要求する作業に最適です. 訓練時間を23倍増やす.
  • ResNet-50: ほとんどの操作作業ではResNet-18よりも限界改善が多く,メモリ使用量を倍増します.
  • EfficientNet: コンピュータが限られているモバイルデプロイメントに適した妥協点.

ハードウェアの推奨事項

ACTは様々なロボットプラットフォームで検証されています.RCSVを通じて利用可能な最良のオプションは以下の通りです:

Robot Platform Price Configuration Best ACT Use Case Lease from RCSV
OpenArm 1 $4,500 6-DOF, leader-follower, open-source Single-arm ACT research, entry-level imitation learning from $800/mo
DK1 Bimanual $12,000 Dual 6-DOF arms, ALOHA-compatible Bimanual ACT (original ALOHA workflow), folding, assembly from $1,500/mo
Unitree G1 $16,000 23-DOF humanoid, dual arms + locomotion Whole-body ACT, mobile manipulation, loco-manipulation from $2,500/mo
Unitree Go2 $2,800 四足歩行ロボット, arm attachment option Locomotion + arm manipulation, outdoor tasks from $800/mo

計算要件

GPU VRAM Max バッチサイズ Training Time (200 eps) Inference レイテンシ
RTX 3060 12 GB 4 8–16 hours ~20 ms
RTX 4090 24 GB 8 2–8 hours ~12 ms
A100 40/80 GB 16–32 1–3 hours ~8 ms
H100 80 GB 32–64 <1 hour ~5 ms

ACTは最も効率的な模倣学習アルゴリズムの一つである.消費者のRTX 3060はトレーニングとリアルタイム展開に十分で,小型研究室や個々の研究者に利用可能になる.

常識 の 障害 方法 と 修正

ACT訓練は比較的簡単ですが,部署失敗はよくあります.

1 任務中途半端にロボットが軌道から離れる

原因: 十分な示例がないか,一貫性のない示例品質がある.

修正: 漂移が起こる正確な地域に焦点を当てて,さらに50回のデモを集める.すべてのデモが同じ戦略に従うことを確認する.カメラの位置が変わっていないことを確認する.

2. 揺れる動き

原因: 体重が大きすぎた時帯,または小すぎた時帯.

** Fix**: タイムロマリング・ペイストを減らし (0.005 を 0.01 の代わりに試す) 部品のサイズを 2550 に増やします. 動作正常化統計が正しく計算されていることを確認します.

3 機械は,握り/放出の移行時に凍結する

理由: デモデータでは曖昧なグリッパーコマンドがある. デモは早期に,遅い時に把握し,ACTが平均して半開いている2つの分布を作り出す.

修正: 連続的なグリッパー位置ではなく二重グリッパーコマンド (しきい値) を使用する.

4.訓練損失の高原が性能が低い

原因: KL重量が高く (β > 50),後部崩壊を引き起こします.モデルは潜伏変数を無視し,平均行動を予測します.

Fix:Kl_weightを10以下に減らして,訓練中にKL損失を別々に監視する

5.訓練対象に作業するものの,新しい対象に失敗する

原因: ACTはデフォルトで新しいオブジェクトに一般化しません.

修正:様々なオブジェクト (異なる色,サイズ,形状) のデモを収集する.イメージ拡張 (色の振動,ランダム作物) を使用する.真のオブジェクト概括のために,VLAモデルに切り替えることを検討してください (私たちの [模倣学習ガイド](T17 参照).

6 双手調整が崩れ

武器は独立して予測され 調整タイミングが失われます

Fix: 両腕の動作が同じ動作ベクトル (14-DOF: 7 腕あたり) にあることを確認する.

ACT vs. Diffusion Policy: いつどれを使えばいいのか

Dimension ACT Diffusion Policy
Data efficiency 50–200 demos 100–500 demos
Multi-modal actions Limited (CVAE helps but not fully multimodal) Excellent (denoising naturally captures multiple modes)
Inference speed 50+ Hz (single forward pass) 10–30 Hz (iterative denoising)
軌跡 smoothness Good (temporal ensembling) Excellent (inherent to diffusion process)
Training time 2–8 hours (RTX 4090) 4–16 hours (RTX 4090)
Hyperparameter sensitivity Low (mainly chunk_size and kl_weight) Medium (noise schedule, denoising steps, network architecture)
Language conditioning Not supported natively Not supported natively (extensions exist)
Framework support LeRobot, robomimic LeRobot, robomimic, diffusion_policy repo
Best for Fast prototyping, single-strategy tasks, limited data budgets Multi-strategy tasks, contact-rich manipulation, diverse operator data

指令: ACTから始めましょう. ACTは,より速く訓練し,データ収集を少なくし,データ収集パイプラインを迅速に検証することができます. 多モード障害 (二つの戦略間のロボット平均) を観察する場合にのみ,または接触豊富な作業のためによりスムーズな経路が必要であれば,拡散ポリシーに切り替える.

リアルロボットに部署

ACT ポリシーを導入すると,モデルをロードして制御ループで実行します.

# ACT deployment on real robot (pseudocode)
import torch
import numpy as np
from act.policy import ACTPolicy

# Load trained policy
policy = ACTPolicy.load("checkpoints/act_epoch_2000.pt")
policy.eval()
policy.cuda()

# Initialize robot and cameras
robot = RobotInterface(port="/dev/ttyUSB0", hz=50)
cameras = CameraInterface(names=["cam_high", "cam_wrist"])

# Action buffer for temporal ensembling
all_actions = {}
temporal_weight = 0.01

for t in range(max_steps):
    # Get observation
    images = cameras.get_images()   # dict of [H, W, 3] arrays
    qpos = robot.get_joint_positions()  # [7]

    # Predict action chunk
    with torch.no_grad():
        obs = preprocess(images, qpos)   # normalize, resize, to_tensor
        action_chunk = policy(obs)       # [chunk_size, action_dim]
        action_chunk = action_chunk.cpu().numpy()

    # Temporal ensembling
    for i in range(len(action_chunk)):
        if (t + i) not in all_actions:
            all_actions[t + i] = []
        all_actions[t + i].append(action_chunk[i])

    if t in all_actions:
        preds = np.array(all_actions[t])
        weights = np.exp(-temporal_weight * np.arange(len(preds)))[::-1]
        action = np.average(preds, weights=weights, axis=0)
    else:
        action = action_chunk[0]

    # Execute action
    robot.set_joint_positions(action[:6])
    robot.set_gripper(action[6])
    robot.step()

robot.go_home()

進歩した話題

VLA プレトレーニングの ACT

最近の研究 (20252026) は,ACTのアクションチャンキングとVLAプレトレーニングを組み合わせています.アイディアは:視覚エンコードとして,プレトレーニングされたビジョン言語モデルを使用し,ACTのチャンキングアクションデコーダーを付加します.これは,ACTのデータ効率と推論速度を基礎モデルの通用化能力と組み合わせます.VLAモデルの詳細については,私たちの [模倣学習ガイド]T18) を参照してください.

優雅な操作のための行為

ACTを巧妙な手 (例えば17DOFの [Orca Hand]T19) に適用するには,調整が必要です.

  • 動作_dim を増やして,手 DOF に一致する (例えば, 6-DOF 腕 + 17-DOF 手には23).
  • 巧妙な操作動作は,遅いし,より複雑です.
  • 首手腕カメラを主要視覚入力として使用します 上部カメラは指の設定を解決することはできません.
  • 展示を500件以上集める 高い次元でのアクションスペースにはより多くのデータが必要です

多重タスク ACT

標準的なACTは単作業です 多作業操作では,2つのアプローチが実践的に機能します

  1. タスク条件 ACT:エンコード入力にタスクを埋め込む (単熱または学習) を追加.複数のタスクからの混合データについて訓練. 35関連タスクに動作します.
  2. 言語条件 ACT: 凍結された CLIP または SigLIP モデルでコードされた言語指示で組み込み作業を置き換える. より柔軟性のあるが,タスクごとにより多くのデータを要求する.実装については [LeRobot]T20) と [robomimic]T21) のようなツールを参照してください.

よく 聞かれる 質問

変形器 (ACT) で行動の重複とは

ACTは,スタンフォード大学で2023年にトニー・シャオ等が導入したロボット模倣学習アルゴリズムである.これは,通常50Hzで100時間のステップを予測し,次の動作の代わりに2秒の動きをカバーする.これは複合エラーを削減し,わずか50人の示範から滑らかで一時的に一貫したロボット軌道を生成する.

ACTには何回のデモが必要ですか?

シンプルなピックアンド・プレス,双手調整100200,精密挿入200400,複雑な多段階または巧妙な作業500+.品質は量よりも重要だ 単一の熟練した操作者を使用し,一貫した示範スタイルを維持する.

どのサイズで使うべきか?

速度が50Hz (2秒) で100から始めましょう. 3秒未満の高速作業では合計を50に減らします.遅い精度作業では150200に増加します. 部品は作業の1つの完全なサブモーションをカバーする必要があります.

ACTは複数の有効な戦略を処理できるのか?

ACTのCVAE潜伏変数は多動性があるが,基本的には単動行動分布のために設計されている.あなたのタスクが本当に異なる有効な戦略 (例えば,左から右に握る) を持っている場合,ACTはそれらを平均して,失敗した中位軌道を生成します.多動的なタスクのために [diffusion Policy] ((T22) を使用します.

ACTはどのデータフォーマットを期待しているのでしょうか?

HDF5は標準形式である.各エピソードには,関節位置 (qpos),関節速度 (qvel),カメラ画像,ターゲットアクションが含まれています.RCSVの [データ収集サービス]T23) は,このフォーマットでデータを提供し,トレーニングに準備されています.詳細な仕様については,当社の [データフォーマットガイド]T24]を参照してください.

2,500ドルから ACT準備訓練データを収集する

RCSVはACTトレーニングのためのエンドツーエンドデータ収集を提供している. カリバー化されたマルチカメラセットアップ,訓練されたテレオペレータ,品質管理,およびHDF5またはLeRobot Parquet形式の配信.パイロットプロジェクトは100エピソードで2,500ドルから開始;500+エピソードで8,000ドルから完全なキャンペーン.

[データ収集サービス] T25] [パイロットのためのハードウェアを借りる]