アクション・チャンキング・トランスフォーマー (ACT): ロボット模倣学習のための完全なガイド (2026)
マスターACT (アクションチャンキングトランスフォーマー):建築,実際のロボットデータに関するトレーニング,チャンクサイズ調整,OpenArmおよびモバイルALOHAでの展開.PyTorchコード,ハイパーパラメーターガイド,データセットフォーマット仕様を含む.
[←ガイド]
ロボット操作のための最も効率的なデータ模倣学習アルゴリズムであるACTに深く潜入する.アーキテクチャ,CVAEコンディショニング,部品サイズ調節,PyTorchとLeRobotとのトレーニング,ハイパーパラメータ最適化,ハードウェア選択,故障モード,展開戦略をカバーする.
行動 減量 は 何 です か
標準行動クローンでは,現在の観測から次の行動が予測される.これは理論的には有効だが,実践では崩壊する.小規模な予測誤差が時間とともに蓄積され,ロボットは訓練中に見られなかった状態に漂うことが原因となる.この _compounding error_問題は,天才的な行動クローンにおける根本的な制限である.
アクションチャンキングは,将来のアクションの連続を同時に予測することで解決する.通常は50~100時間ステップです. "ロボットは今何をすべきか?"という質問の代わりに,モデルは"ロボットが次の2秒間に何をすべきか?"と答える.これはネットワークを騒音なステップ・バイ・ステップ予測ではなく,一貫した,時間的に一貫した軌道を生成するよう強制します.
洞察は単純です.カップを握ると,あなたは独立して毎ミリ秒を決定しません.あなたは単一の単位として滑らかな移動を計画します.アクション・チャンキングはモデルに同じ構造を与えます. 重要なことに,重複する塊は タイムロアサンブルングによって混ざり合わされ,その平均は隣接する塊からの予測を構成し,軌道をさらに平滑させ,塊の境界線での緊張を軽減します.
ACT(Action Chunking with Transformers) は,2023年にスタンフォード大学でトニー・シャオ等が導入した.このアクション・チャッキングのアイデアをCVAE (Conditional Variational オートエンコーダー) トランスフォーマーアーキテクチャと組み合わせた.結果として,最もデータ効率的な模倣学習アルゴリズムが利用可能となった.
暫定抽象:有効な視野を縮小する
標準BCでは,各予測化合物がエラーを発生させる. 100の部品サイズで,同じ作業には 3
ACTは,観察から7DOFアクション (典型的なロボット腕) にマッピングを学ぶ代わりに,観察から100×7アクション軌道を学習します.軌道の構造は強い自己監督を提供します.
ACT 建築 深層ダイビング
ACTは,トランスフォーマーエンコード・デコーダーバックboneを搭載した条件変異自動エンコード (CVAE) を使用している.このアーキテクチャを理解することは効果的なトレーニングとデバッグに不可欠である.
CVAE 枠組み
CVAE は標準のエンコード・デコーダーパイプラインに潜伏変数 z を追加する.訓練中に,エンコードは現在の状態と ground truth action sequence を両方観察し,それらを z の分布に圧縮する.デコーダーはこの分布と現在の観測からサンプルを取り,アクションシーケンスを再構築する.
結論付けの際に,エンコードは捨てられます.デコードは**先からサンプル (標準正常分布) を受信し,現在の観測からアクション部分を生成します. KL 差分期は,後部が先部に近い状態を維持することを保証します.したがって,試験時に先部からサンプルを採取すると合理的なアクションシーケンスが生成されます.
CVAE構造は重要な目的を果たしている.この構造はイントラデモ・変性を捕捉する.単一の作業でも,正確な軌道はデモ間 (略微異なる把握角度,タイミング,接近路線) に異なる.潜伏変数 _z_はこの変数を捕捉し,デコッダーが多様なが有効な軌道を生成できるようにする.
暗号化アーキテクチャ
ACTエンコードは,多モダルの入力処理を行う.
- カメラ画像:視覚の背骨を通過 (デフォルトとしてResNet-18,ViTオプション).複数のカメラビュー (腕 +上頭) は独立してコンカネ化され処理されます.
- **関節位置 (qpos) **:現在のロボット関節角,通常は腕1つに6
7 DOFとグリッパー状態. - **アクションシーケンス (訓練のみ) **: _k_将来のアクションの基本真実部分,CVAEエンコードが後の分布を計算するために使用する.
入力はトークン化され,トランスフォーマーエンコードに入力されます.出力は,後部分布の平均と変異に投影される潜伏表現です.
解読器アーキテクチャ
解読器は,学習可能なアクションクエリを**つなぐ標準的なトランスフォーマー解読器である. _k_クエリがある (部分の時間ステップごとに1つ),それぞれが学習された埋め込みとして初期化される.解読器は,暗号化された観測トークンとサンプルされた latente z を交互的に処理し,線形投影ヘッドを通じて _k_アクションベクトルを出力する.
予測された動作は,関節位置目標 (6
損失機能
# ACT loss computation (simplified)
L_reconstruction = L1_loss(predicted_actions, target_actions) # [batch, chunk_size, action_dim]
L_kl = KL_divergence(posterior_mean, posterior_logvar, prior) # regularize latent space
L_total = L_reconstruction + beta * L_kl # beta typically 10-20
KL 項における β 体重は,再構築精度と潜伏空間規則性との間の妥協を制御する.あまりにも低い:モデルは先のものを無視し,テスト時に不一致な行動を生成する.あまりにも高い:モデルは平均的な行動に崩壊し,表現力を失います.
数学的な直感: 部品サイズ選択
部品サイズ k は ACT の最も重要な超パラメーターである. これはモデルが各ステップで予測する将来のアクションを決定する.
制御周波数関係
50 Hz制御 (ほとんどのロボット腕の標準) で,小型の大きさの地図は予測の視界に直接表示される.
| Chunk Size | Prediction Horizon | Best For |
|---|---|---|
| 25 | 0.5 seconds | Very fast reactive tasks, contact transitions |
| 50 | 1.0 second | Quick pick-and-place, single-arm tasks under 3 seconds |
| 100 | 2.0 seconds | Default — most tabletop manipulation tasks |
| 150 | 3.0 seconds | Slow precision tasks (insertion, assembly) |
| 200 | 4.0 seconds | Long-horizon smooth motions (pouring, wiping) |
理想的な部品サイズは,約1つの完全なサブモーションをカバーする必要があります.ピックアンド・プレスタスクでは, リーチ-to-Grab 動作は1.5秒かかります. chunk_size=75
臨時組成
ACTは,部署中に,各時間ステップ (または数時間ステップ) で新しい部品を生成します.各制御ステップで,実行されたアクションは重量平均で重複する部品予測です.
# Temporal ensembling (exponential weighting)
# w controls the blending — lower w gives more weight to recent predictions
w = 0.01 # default temporal ensembling weight
for t in range(episode_length):
new_chunk = policy.predict(observation_t) # shape: [chunk_size, action_dim]
for i in range(chunk_size):
all_predictions[t + i].append(new_chunk[i])
# Weighted average with exponential decay
weights = [np.exp(-w * j) for j in range(len(all_predictions[t]))]
action_t = np.average(all_predictions[t], weights=weights, axis=0)
時間の集合量 w (通常は0.01) は,古い予測がどのように急速に衰退するかを制御する.より小さな w は,古い予測により多くの重量を与え (柔らかいが反応する速度が遅い).より大きな w は,最も最近の予測 (より反応的が緊張する可能性がある) を好む.
ACTに関するデータ収集要件
ACTはデータ効率が非常に高いが,データ品質は極めて重要です. ごみ出しは, ごみ出しは,強く適用されます 清潔なデモ50件は,騒音なデモ500件を上回ります.
最低のエピソード数
| Task Category | Episodes Needed | Expected Success Rate | Collection Time |
|---|---|---|---|
| Simple pick-and-place | 50–100 | 85%+ | 2–4 hours |
| Bimanual coordination | 100–200 | 80%+ | 4–8 hours |
| 精度(再現性) insertion (peg-in-hole) | 200–400 | 70%+ | 1–2 days |
| Complex multi-step tasks | 500+ | 60%+ | 2–5 days |
| Dexterous manipulation | 500–1,000 | 50%+ | 1–2 weeks |
データ品質チェックリスト
- 一貫した示例: 1 つのオペレーター (または非常に類似したスタイルを持つオペレーター) を使用する.ACT は単模的アクション分布を前提とする.
- 固定物体配置ゾーン:物体はほぼ同じ領域からスタートする (差異は5cm).ACTは,明確に訓練されていない限り,大きな空間変化にうまく一般化しない.
- クリーンスタート/エンド状態:各エピソードは同じホームポジションから始まり,クリーンに終わらなければならない (物体にグリッパーを閉じて,物体をターゲットに配置する). 切り落としたまたは失敗したエピソードは除外されるべきである.
- 一貫したタイミング: デモンストレーションで同じ速度で作業を実行してみてください. 時間の大きな変動により,アクション分布は曖昧になります.
- カメラ安定:カメラはしっかりと設置する必要があります.エピソード間のカメラの変更はパフォーマンスを大幅に低下させます.
HDF5 データフォーマット
RCSVは,ACTトレーニングの標準であるHDF5形式で収集されたすべてのデータを提供します.各エピソードは以下の構造を持つ単一のHDF5ファイルとして保存されます.
# HDF5 episode structure for ACT training
episode_0.hdf5
├── observations/
│ ├── qpos # [T, 7] — joint positions (6 DOF + gripper)
│ ├── qvel # [T, 7] — joint velocities
│ ├── images/
│ │ ├── cam_high # [T, 480, 640, 3] — overhead camera
│ │ └── cam_wrist # [T, 480, 640, 3] — wrist camera
│ └── effort # [T, 7] — joint torques (optional)
├── action # [T, 7] — target joint positions
└── attrs/
├── sim # False (real robot data)
├── compress # True
└── num_timesteps # T
ACT準備のデータ収集サービスについては, [RCSVデータサービス]
カメラの設置に関する勧告
ACTの性能はカメラの構成に依存する.オリジナルの ALOHA設定では3台のカメラを使用している.
- **Overhead camera (required) **:作業場から0.8
1.2m上を設置し,直下に向いている.シーンとオブジェクトの位置を全視する.解像度:最小640×480 - **手首カメラ (強く推奨) **:ロボットの手首や前腕に搭載されている. 握り込みと挿入中に近視を提供する. 上のカメラが細かい詳細を解決できない精密な作業に不可欠である.
- **サイドカメラ (オプション) **: 上の頭と腕の視界が欠けている深度情報を提供します. 垂直の積み重ねや高度に敏感な配置を含む作業に最も役立ちます.
USB 3.0 カメラ (Logitech C920 または Intel RealSense D405) を使用し,固定曝光とホワイトバランスをとる.自動曝光は,エピソード間の画像明るさが不一致する原因で,トレーニングを劣化します.
訓練 進行
このセクションでは,LeRobotの枠組みとPyTorchの直接実装の両方を利用してACT政策のトレーニングを進みます.
レロボット (推奨) の訓練
ハグジング・フェイスの [LeRobot]
# Step 1: Install LeRobot
pip install lerobot
# Step 2: Convert HDF5 data to LeRobot format
python -m lerobot.scripts.convert_dataset \
--raw-dir ./my_episodes/ \
--repo-id my-org/pick-place-task \
--raw-format hdf5_aloha
# Step 3: Train ACT policy
python -m lerobot.scripts.train \
policy=act \
dataset_repo_id=my-org/pick-place-task \
training.num_epochs=2000 \
training.batch_size=8 \
policy.chunk_size=100 \
policy.n_action_steps=100 \
policy.dim_model=512
# Step 4: Evaluate
python -m lerobot.scripts.eval \
--pretrained-policy-name-or-path outputs/train/act_pick-place-task/checkpoints/last/pretrained_model \
--env-name real_world \
--n-episodes 20
訓練は通常,1回 RTX 4090 で2
直線パイトーク訓練設定
訓練ループのコントロールを高めたい,または ACTをカスタマイズされたパイプラインに統合したいチームのために:
# ACT training configuration — direct PyTorch implementation
import torch
from act.policy import ACTPolicy
from act.train import train_bc
config = {
# Architecture
'chunk_size': 100, # action chunk length (timesteps)
'hidden_dim': 512, # transformer hidden dimension
'dim_feedforward': 3200, # feedforward network dimension
'num_encoder_layers': 4, # transformer encoder layers
'num_decoder_layers': 7, # transformer decoder layers
'nheads': 8, # attention heads
'latent_dim': 32, # CVAE latent dimension
# Training
'lr': 1e-5, # learning rate (Adam)
'weight_decay': 1e-4, # L2 regularization
'num_epochs': 2000, # total training epochs
'batch_size': 8, # batch size (8 fits on 24 GB VRAM)
'kl_weight': 10, # beta for KL divergence term
'seed': 42,
# Data
'camera_names': ['cam_high', 'cam_wrist'],
'image_size': [480, 640], # H, W
'action_dim': 7, # 6 DOF + gripper
'state_dim': 7, # joint positions
# Augmentation
'color_jitter': True, # random brightness/contrast
'random_crop': True, # spatial augmentation
}
# Initialize and train
policy = ACTPolicy(config)
optimizer = torch.optim.AdamW(policy.parameters(), lr=config['lr'], weight_decay=config['weight_decay'])
train_bc(policy, optimizer, dataloader, config)
訓練 の 技巧
- 学習率: 1e-5からスタートする. ACTは学習率に敏感です. 学習の速度はあまりにも高い (1e-4) で,トレーニングの不安定性が生じ,あまりにも低い (1e-6) で,非常にゆっくりと収束します.
- ** バッチサイズ**: 24 GB VRAM (RTX 4090) に 8 を使用する. 12 GB VRAM (RTX 3060) に 4 に減らする. A100 の大きなバッチ (16
32) は安定性を向上させる. - Epochs: 2000年代間の電車最低. ACTは長い高原の後,しばしば 1000~1500年代周辺の急激な改善を示します.
- チェックポイントは500回ごとに保存します 保存されたチェックポイントをすべて評価します チェックポイントは常に最適ではありません
- アクション正常化:データセット統計を使用して動作を[-1, 1]に正常化します.関節因子訓練失敗ごとに異なるスケールで非正常化された動作.
ハイパーパラメーター調整ガイド
ACTは Diffusion Policyよりも低量のハイパーパラメータを持っていますが,新しいタスクごとに注意深く調整する必要があります.
パーツサイズ (パーツサイズ)
決定の過程を 実行する
- 作業中の単一のサブモーションの平均期間を測定する (例えば,オブジェクトに到達する時間: 1.5 s).
- 制御周波数で倍する: 1.5 s × 50 Hz = 75 時間のステップ.
- 丸め直して25に 丸め直して
- 作業が非常に異なる段階 (到達,把握,引き戻り) を構成している場合は,その部分は少なくとも1つの完全な段階をカバーする必要があります.
間違ってるのさ
- 機械は過渡時に躊躇し 動きが鈍い 動きの中途中に引っ掛かります
- 機械は任務の終結を過度に予測し 早期に動きをしたり 未来を予測する必要のない訓練能力を無駄にしたりします
KL重量 (kl_重量 / β)
CVAEの調整を制御する デフォルトは10
- β = 0: CVAE の 規則化 は ない.モデル は 標準 的 な 行動 克ロニング に 堕落 し て いる (隠れ 変数 は ない). これを ベースライン として 使い て ください. しかし, より 悪い 性能 を 期待 する.
- β = 10 (デフォルト):ほとんどの作業に適したバランス. 潜伏空間は崩壊せずに示範変性性を捕捉します.
- β = 20
50 :より強い規則化により,より一貫した (変数少ない) 軌道を生み出す.示例が既に非常に一貫している場合,有用である. - β > 100: 強いすぎます. モデルはデータを無視し,平均的な行動を生み出します. 避けましょう.
查询数 (数_查询数)
初期 ACT では,num_queries は chunk_size (時間ステップごとに1つのクエリ) に等しい.一部の実装では,これらのクエリを分離させ,アップサンプリングレイヤーでクエリを少なくする.これを変更する具体的な理由がない限り,num_queries = chunk_size を保持してください.
視覚の脊椎
ResNet-18はデフォルトで,ほとんどのタスクではうまく動作します.
- **ViT (DINOv2) **: 細かい視覚的理解 (ラベルを読む,正確な調整) を要求する作業に最適です. 訓練時間を2
3倍増やす. - ResNet-50: ほとんどの操作作業ではResNet-18よりも限界改善が多く,メモリ使用量を倍増します.
- EfficientNet: コンピュータが限られているモバイルデプロイメントに適した妥協点.
ハードウェアの推奨事項
ACTは様々なロボットプラットフォームで検証されています.RCSVを通じて利用可能な最良のオプションは以下の通りです:
| Robot Platform | Price | Configuration | Best ACT Use Case | Lease from RCSV |
|---|---|---|---|---|
| OpenArm 1 | $4,500 | 6-DOF, leader-follower, open-source | Single-arm ACT research, entry-level imitation learning | from $800/mo |
| DK1 Bimanual | $12,000 | Dual 6-DOF arms, ALOHA-compatible | Bimanual ACT (original ALOHA workflow), folding, assembly | from $1,500/mo |
| Unitree G1 | $16,000 | 23-DOF humanoid, dual arms + locomotion | Whole-body ACT, mobile manipulation, loco-manipulation | from $2,500/mo |
| Unitree Go2 | $2,800 | 四足歩行ロボット, arm attachment option | Locomotion + arm manipulation, outdoor tasks | from $800/mo |
計算要件
| GPU | VRAM | Max バッチサイズ | Training Time (200 eps) | Inference レイテンシ |
|---|---|---|---|---|
| RTX 3060 | 12 GB | 4 | 8–16 hours | ~20 ms |
| RTX 4090 | 24 GB | 8 | 2–8 hours | ~12 ms |
| A100 | 40/80 GB | 16–32 | 1–3 hours | ~8 ms |
| H100 | 80 GB | 32–64 | <1 hour | ~5 ms |
ACTは最も効率的な模倣学習アルゴリズムの一つである.消費者のRTX 3060はトレーニングとリアルタイム展開に十分で,小型研究室や個々の研究者に利用可能になる.
常識 の 障害 方法 と 修正
ACT訓練は比較的簡単ですが,部署失敗はよくあります.
1 任務中途半端にロボットが軌道から離れる
原因: 十分な示例がないか,一貫性のない示例品質がある.
修正: 漂移が起こる正確な地域に焦点を当てて,さらに50回のデモを集める.すべてのデモが同じ戦略に従うことを確認する.カメラの位置が変わっていないことを確認する.
2. 揺れる動き
原因: 体重が大きすぎた時帯,または小すぎた時帯.
** Fix**: タイムロマリング・ペイストを減らし (0.005 を 0.01 の代わりに試す) 部品のサイズを 25
3 機械は,握り/放出の移行時に凍結する
理由: デモデータでは曖昧なグリッパーコマンドがある. デモは早期に,遅い時に把握し,ACTが平均して半開いている2つの分布を作り出す.
修正: 連続的なグリッパー位置ではなく二重グリッパーコマンド (しきい値) を使用する.
4.訓練損失の高原が性能が低い
原因: KL重量が高く (β > 50),後部崩壊を引き起こします.モデルは潜伏変数を無視し,平均行動を予測します.
Fix:Kl_weightを10以下に減らして,訓練中にKL損失を別々に監視する
5.訓練対象に作業するものの,新しい対象に失敗する
原因: ACTはデフォルトで新しいオブジェクトに一般化しません.
修正:様々なオブジェクト (異なる色,サイズ,形状) のデモを収集する.イメージ拡張 (色の振動,ランダム作物) を使用する.真のオブジェクト概括のために,VLAモデルに切り替えることを検討してください (私たちの [模倣学習ガイド](
6 双手調整が崩れ
武器は独立して予測され 調整タイミングが失われます
Fix: 両腕の動作が同じ動作ベクトル (14-DOF: 7 腕あたり) にあることを確認する.
ACT vs. Diffusion Policy: いつどれを使えばいいのか
| Dimension | ACT | Diffusion Policy |
|---|---|---|
| Data efficiency | 50–200 demos | 100–500 demos |
| Multi-modal actions | Limited (CVAE helps but not fully multimodal) | Excellent (denoising naturally captures multiple modes) |
| Inference speed | 50+ Hz (single forward pass) | 10–30 Hz (iterative denoising) |
| 軌跡 smoothness | Good (temporal ensembling) | Excellent (inherent to diffusion process) |
| Training time | 2–8 hours (RTX 4090) | 4–16 hours (RTX 4090) |
| Hyperparameter sensitivity | Low (mainly chunk_size and kl_weight) | Medium (noise schedule, denoising steps, network architecture) |
| Language conditioning | Not supported natively | Not supported natively (extensions exist) |
| Framework support | LeRobot, robomimic | LeRobot, robomimic, diffusion_policy repo |
| Best for | Fast prototyping, single-strategy tasks, limited data budgets | Multi-strategy tasks, contact-rich manipulation, diverse operator data |
指令: ACTから始めましょう. ACTは,より速く訓練し,データ収集を少なくし,データ収集パイプラインを迅速に検証することができます. 多モード障害 (二つの戦略間のロボット平均) を観察する場合にのみ,または接触豊富な作業のためによりスムーズな経路が必要であれば,拡散ポリシーに切り替える.
リアルロボットに部署
ACT ポリシーを導入すると,モデルをロードして制御ループで実行します.
# ACT deployment on real robot (pseudocode)
import torch
import numpy as np
from act.policy import ACTPolicy
# Load trained policy
policy = ACTPolicy.load("checkpoints/act_epoch_2000.pt")
policy.eval()
policy.cuda()
# Initialize robot and cameras
robot = RobotInterface(port="/dev/ttyUSB0", hz=50)
cameras = CameraInterface(names=["cam_high", "cam_wrist"])
# Action buffer for temporal ensembling
all_actions = {}
temporal_weight = 0.01
for t in range(max_steps):
# Get observation
images = cameras.get_images() # dict of [H, W, 3] arrays
qpos = robot.get_joint_positions() # [7]
# Predict action chunk
with torch.no_grad():
obs = preprocess(images, qpos) # normalize, resize, to_tensor
action_chunk = policy(obs) # [chunk_size, action_dim]
action_chunk = action_chunk.cpu().numpy()
# Temporal ensembling
for i in range(len(action_chunk)):
if (t + i) not in all_actions:
all_actions[t + i] = []
all_actions[t + i].append(action_chunk[i])
if t in all_actions:
preds = np.array(all_actions[t])
weights = np.exp(-temporal_weight * np.arange(len(preds)))[::-1]
action = np.average(preds, weights=weights, axis=0)
else:
action = action_chunk[0]
# Execute action
robot.set_joint_positions(action[:6])
robot.set_gripper(action[6])
robot.step()
robot.go_home()
進歩した話題
VLA プレトレーニングの ACT
最近の研究 (2025
優雅な操作のための行為
ACTを巧妙な手 (例えば17DOFの [Orca Hand]
- 動作_dim を増やして,手 DOF に一致する (例えば, 6-DOF 腕 + 17-DOF 手には23).
- 巧妙な操作動作は,遅いし,より複雑です.
- 首手腕カメラを主要視覚入力として使用します
上部カメラは指の設定を解決することはできません. - 展示を500件以上集める 高い次元でのアクションスペースにはより多くのデータが必要です
多重タスク ACT
標準的なACTは単作業です 多作業操作では,2つのアプローチが実践的に機能します
- タスク条件 ACT:エンコード入力にタスクを埋め込む (単熱または学習) を追加.複数のタスクからの混合データについて訓練. 3
5関連タスクに動作します. - 言語条件 ACT: 凍結された CLIP または SigLIP モデルでコードされた言語指示で組み込み作業を置き換える. より柔軟性のあるが,タスクごとにより多くのデータを要求する.実装については [LeRobot]
T20 ) と [robomimic] T21 ) のようなツールを参照してください.
よく 聞かれる 質問
変形器 (ACT) で行動の重複とは
ACTは,スタンフォード大学で2023年にトニー・シャオ等が導入したロボット模倣学習アルゴリズムである.これは,通常50Hzで100時間のステップを予測し,次の動作の代わりに2秒の動きをカバーする.これは複合エラーを削減し,わずか50人の示範から滑らかで一時的に一貫したロボット軌道を生成する.
ACTには何回のデモが必要ですか?
シンプルなピックアンド・プレス,双手調整100
どのサイズで使うべきか?
速度が50Hz (2秒) で100から始めましょう. 3秒未満の高速作業では合計を50に減らします.遅い精度作業では150
ACTは複数の有効な戦略を処理できるのか?
ACTのCVAE潜伏変数は多動性があるが,基本的には単動行動分布のために設計されている.あなたのタスクが本当に異なる有効な戦略 (例えば,左から右に握る) を持っている場合,ACTはそれらを平均して,失敗した中位軌道を生成します.多動的なタスクのために [diffusion Policy] ((
ACTはどのデータフォーマットを期待しているのでしょうか?
HDF5は標準形式である.各エピソードには,関節位置 (qpos),関節速度 (qvel),カメラ画像,ターゲットアクションが含まれています.RCSVの [データ収集サービス]
2,500ドルから ACT準備訓練データを収集する
RCSVはACTトレーニングのためのエンドツーエンドデータ収集を提供している. カリバー化されたマルチカメラセットアップ,訓練されたテレオペレータ,品質管理,およびHDF5またはLeRobot Parquet形式の配信.パイロットプロジェクトは100エピソードで2,500ドルから開始;500+エピソードで8,000ドルから完全なキャンペーン.
[データ収集サービス]







