Blogに戻る

ALOHA vs UMI: どのデータ収集システムが適しているのでしょうか?

ロボット模倣学習のためのALOHAとUMIデータ収集システムの詳細な比較.コスト,設定,データ品質,移植性,タスクタイプ,各システムを何時使用するかをカバーする.

高品質の示範データを収集することは,模倣学習の瓶頸である.主导的なアプローチとして2つのシステムが生じた.ALOHA (双面的なリーダー・フォロワー・テレオペレーション) とUMI (ユニバーサル・マニピュレーション・インターフェイス,手持ちデータ収集装置). 根本的に異なるメカニズムで 同じ問題を解決します 適切な選択は 任務 チームサイズ 部署目標 予算に依存します このガイドは 詳細な技術比較を提供します

ALOHA の 働き方

ALOHA leader-follower teleoperation arms

[ALOHA] (Bimanual 遠隔操作 の低コストオープンソース ハードウェアシステム) は,リーダーとフォロワー の構成でマッチされたロボット腕のペアを使用します.オペレーターはリーダー腕を物理的に移動し,フォロワー腕はリアルタイムでそれらの動きを反映します.リーダーとフォロワー腕の両方のコードーは,腕と上部カメラ画像とともに50Hzで同期位置軌跡を記録します.

**キーメカニズム:**リーダーとフォロワー腕は,動力的に同一 (両者はViperX 300 6-DOF腕で,Dynamixel servos).操作者がリーダー腕関節を動かすとき,対応するフォロワー腕関節が一致する方向に動きます. フォローアームが物体と相互作用する 直接感受する操作者は リーダーアームのセルボフィードバックを通して 感受します 真のフォースフィードバックではなく 経験豊富な操作者が 直感的な接触感を 培うための ポジショナルの結合です

データ形式: ALOHAは,関節位置 (14 値: 6 関節 + 1 握手),関節速度,カメラ画像 (通常,2~4 カメラが480p/30fps で) とタイムスタンプを記録する.データはロボットネイティブである.関節軌跡は,フォロワー腕に直接再生したり,再ターゲットステップなしでポリシーを訓練するために使用することができます.

双手利用: ALOHAの特徴は双手遠隔操作です.両腕を同時に制御します.これは双手作業 (容器を開くとそれを保持する際,織物を折り畳む,ボトルからカップに注ぐ) のデータ収集を可能にします. ACTの政策構造は,ALOHAの双手動行動空間を扱うために特別に設計された.

UMI の 働き方

RCSV UMI handheld data collection device

[UMI (ユニバーサル・マニプレーション・インターフェース) ]T4) はカメラとIMUを搭載した手持ちグリッパーです.操作者はUMIを道具のように握り,操作作業を直接実行します.データ収集中にロボット腕はありません. 外部追跡 (ArUcoマーカーまたはSLAM) は環境におけるUMIの6DOF姿勢を記録し,機内カメラはグリッパーの視野を記録し,指エンコードはグリッパーの開口を記録する.

キーメカニズム: UMIはロボットハードウェアからのデータ収集を分離します.オペレーターはロボット動力学,作業空間制限,またはサーボ帯域幅によって制限されない人間の速度と巧みに動作します.記録された軌跡 (時間とともにエンドエフェクターポーズ) は,逆動力学を使用して,後には部署ロボットに再標的化されます. このリターゲティングステップは,使用されている特定のロボット腕の関節角軌道をカーテジアンポーズ軌道を変換します.

データ形式: UMIはエンドエフェクター6DOFポーズ (位置 +方向),グリッパーアパチュア,腕カメラ画像,タイムスタンプを記録する.ポーズは世界フレームで,ロボットの関節空間ではなく. 訓練の前に 軌道が目標ロボットに 再定向されなければなりません 計算的に軽いステップですが IK近似と動力差による 2~5mmのエンドエフェクター位置エラーが 導入されます

可搬性優位性: UMIは,キッチン,工場床,オフィス,屋外などどこにでも使用できます.オペレーターは,UMIデバイスやノートPC以外のロボット,ワークステーション,またはインフラストラクチャを必要としません.これは実際の展開環境でデータ収集を可能にします.実際の照明,混乱,オブジェクト変異により,ラボでの収集よりも多様なトレーニングデータを生成します.

デックス-UMI: デックステラス エクステンション

RCSV Dex-UMI dexterous manipulation data collection glove

[Dex-UMI] (T5) はUMIを巧妙な操作に拡張します.並行爪のグリッパーではなく,Dex-UMIは指関節角 (20+ DOF),指尖接触力,腕姿勢を捕捉する楽器用手袋を使用します.これは,複数の指の調整を必要とする作業のためのデータ収集を可能にします.ピンチ握手,手中再向,ツール操作,そして細かい組み立て.

Dex-UMIを使用する時: 部署ロボットが巧妙な手 (LEAP Hand, Allegro Hand,または類似の多指端効果器) を備えている場合,作業には指レベル制御が必要であれば,Dex-UMIは唯一の携帯データ収集オプションです.標準的なUMIはグリッパーのみを開く/閉じます.ALOHAリーダー腕には単一のDOFグリッパーのみがあります. Dex-UMIは,シンプルなグリッパーデモと完全な巧妙な操作データとの間のギャップを埋めます.

迅速な決定

双手動? → ALOHA. 携帯性? → UMI. 巧妙な? → Dex-UMI.

比較 対象

Criterion ALOHA UMI Dex-UMI
Cost $3,000-$4,000 (full system) $800 per unit $1,200 per unit
Setup time 2-4 hours (assembly + calibration) 15-30 minutes 30-45 minutes
Operator training 2-4 hours (bimanual coordination) 10-15 minutes 30-60 minutes
Demos per hour 20-60 (single system) 60-100 per operator 40-70 per operator
Parallelizable No (1 operator per system) Yes (N operators = N units) Yes (N operators = N units)
Data quality High (robot-native joints) Medium (retargeting error) Medium (finger retargeting)
Retargeting needed No Yes (IK solve) Yes (finger mapping + IK)
Bimanual support Native (2 arms) Limited (2 UMIs, no sync) No
Portability Low (robot + table + power) High (handheld + laptop) High (glove + laptop)
Dexterous tasks No (1-DOF gripper) No (1-DOF gripper) Yes (20+ DOF fingers)
Environment diversity Low (fixed lab setup) High (any location) High (any location)
Policy frameworks ACT, Diffusion Policy, LeRobot Diffusion Policy, ACT (retargeted), VLA Diffusion Policy, custom

データ品質: 重要な違い

ALOHAはロボットネイティブ関節軌道を生成する.操作者がリーダー腕をX位置に移動すると,フォロワー腕のエンコードはX位置に到達するために必要な正確な関節角を記録する.このデータはフォロワー腕で再生したり,いかなる変換もせずに直接政策訓練に使用することができます. 唯一の騒音源はセルボ量化と反響です. これは小規模でDynamixel XMシリーズでは関節あたり0.1-0.3度です.

UMIは,部署ロボットに再ターゲットにしなければならないカーテジアンエンドエフェクター軌道を生成する. 再ターゲット設定のステップでは,3つの源からエラーが導入されます: (1) IK溶解器の近似 (溶解器はロボットが自然に使用する正確な構成を特定することができない), (2) 人間の操作者の腕とロボット腕の間の運動不一致 (異なるリンク長さ,関節制限,作業空間形状),および (3) 外部ポーズ推定からの追跡騒音 (ArUcoマーカーには距離と照明に応じて1~3mmの位置騒音があります).

実態では: 5mm+の位置付け容量 (ほとんどのピック・アンド・ प्लेस,倒し,混ぜ) の作業では,UMIリターゲティングエラーは軽視され,両システムは同様の政策性能を生成する. 精度が極めて重要であれば,ALOHAを使用するか,または UMIデータを細かな調整のために,より小さなロボット上の示範セットで補完してください.

スケーリングデータ収集: UMIが勝った場所

UMIの基本的なスケーリング上の利点は,並行性である. ALOHA システムでは,一度に1つのオペレーターからデータを収集できます.10の UMI デバイスは,10の異なる環境で10のオペレーターから同時にデータを収集することができ,時間単位に10倍ものデータ多様性を生成します.

デモ費用対比:

  • ALOHA: 4,000ドルシステム,40ドル/時間,100ドル/時間オペレーターコスト = 2.50ドル/デモ償還 (ハードウェア償還を除く)
  • UMI (単行): 装置800ドル,デモ80ドル/時間,オペレータ費用30ドル/時間 (専門家でない) =デモあたり0.38ドル.
  • UMI (10デバイス,10オペレーター): 合計8000ドル 硬件 800デモ/時間 300ドル/時間 総オペレーターコスト = デモンストレーションあたり0.39ドル しかし,通過力20倍

千ものデモを必要とするプロジェクト (VLAトレーニング,多タスクデータセット,環境間一般化) において,UMIのコストと吞吐力優位性は決定的です RCSVの [データ収集サービス]T6) は,大規模なキャンペーンのためにUMIチームを部署することができます.

任務型決定の枠組み

この決定木を使って,特定の作業のために ALOHA と UMI を選択してください.

  1. あなたの作業は同時に2つの腕が必要ですか? もしそうなら: ALOHA. UMIは同期双手データを取得できません.例:洗濯物を折り畳み,容器を開く,両手組成.
  2. **あなたの作業には手腕操作が必要ですか?**もしそうなら: Dex-UMI.ALOHAも標準 UMIも複数の指のデータを捕捉していません.例:ツール使用,手動のリオーリントレーション,ペン操作.
  3. さまざまな現実環境からのデータが必要ですか? もしそうなら:UMI. 20つの異なるキッチンでデータを収集することは,一つのラボで20倍以上のデータを収集するよりもより強力なポリシーを生み出します.例:ホームロボットの作業,異なる混乱で物体を収集する.
  4. **1000以上のデモが必要ですか?**もしそうなら:UMI.並行スケーリングにより,大規模なデータセットが経済的に実現可能になります.例:VLAの微調整,多タスクトレーニング,オブジェクト横断一般化.
  5. **あなたの作業は2mm以下の精度が必要ですか?**もしそうなら:ALOHA (またはロボット上の遠隔操作).UMIデータにおけるリターゲティングエラーは精度作業を悪化させる.例:ペーグ挿入,コネクタ配合,回路板組成.
  6. ** ALOHA ハードウェアに展開するのですか?** もしそうなら: ALOHA.ゼロリターゲティングエラーは,この特定の ハードウェアで可能な限り最高のポリシーパフォーマンスを意味します.
  7. その他すべて: UMIを素早く柔軟性のために開始し,政策のパフォーマンスが平原であればロボット上のデモで補完します.

ALOHAと UMI を組み合わせる

データの収集戦略は2つのシステムを使用します.

  1. フェーズ 1 - UMI 幅 (1~2週間): UMI デバイスを展開して,さまざまな環境,オブジェクト,オペレーターにわたって500~2,000のデモを収集します.これは高度な変異性のある基礎データセットを構築します.自然的なタスク実行をキャプチャするために非専門家のオペレーター (最小訓練) を使用します.
  2. **フェーズ2 - 深度のためのALOHA (34週間):**FAZ1で特定された最も困難なサブタスクの100300件を高品質の示例として収集するALOHAを使用します.精密な操作手順,双手調整,およびUMIデータ不足のエッジケースに焦点を当てます. 最大データ品質のために専門のオペレーターを使用します.
  3. フェーズ3 -- コートレーニング: 組み合わせたデータセットに関する政策を訓練し,精度・重要なタスクセグメントに対してALOHA示範をより高く重量化します. [Fearless Data Platform] (T8) は,示範ごとに品質量重量を持つ混合ソースデータセットをサポートします.

この組み合わせのアプローチは,UMIの環境多様性とALOHAのロボットネイティブ精度を組み合わせることで,システム単独よりも15-30%の政策パフォーマンスを得ます.

ハードウェアの互換性

ALOHAとUMIのデータの両方も,幅広いロボット腕に配備するためのポリシーを訓練することができます.

Deployment Robot ALOHA Data UMI Data Notes
Mobile ALOHA Native (zero retargeting) Retarget via IK Best results with ALOHA data
OpenArm Retarget (different kinematics) Retarget via IK Both require retargeting; UMI more natural
Franka FR3 Retarget (different kinematics) Retarget via IK 7-DOF IK has more solutions; quality depends on solver
UR5e Retarget (different kinematics) Retarget via IK UR analytical IK gives deterministic retargeting
AgileX Piper Retarget (different kinematics) Retarget via IK Shorter reach may clip some UMI trajectories

カメラ設定比較

カメラの配置は両システム間で大きく異なるため,政策訓練のために利用可能な視覚観測には影響を与える.

ALOHAカメラ: 通常,34台のカメラ:腕1枚 (1枚2枚) と12枚のオーバーヘッド/サードパーソンカメラ.腕のカメラは腕とともに動き,グリッパー-アイビューを一貫して提供します.オーバーヘッドカメラは固定されています.すべてのカメラはロボットベースフレームに相対的に校正され,視覚観測と関節位置の間の一貫した空間関係を提供します.

UMIカメラ: UMIデバイスごとに1台のオンボード腕カメラ,加えてオプションの外部カメラ.腕カメラはグリッパーに固く固定され,ALOHA腕カメラと同じグリッパー視野を提供します.使用された場合,外部カメラは各収集セッションでArUcoマーカーフレームに校正する必要があります. 重要な違いは:UMIの外部カメラは,ロボットではなく,操作者の手と腕を映し出しているため,UMIの第三者視野を訓練したポリシーは,部署時に人間の手からロボット腕の姿まで一般化する必要があります.

実用的な推奨事項: 腕カメラのみのポリシー (腕の視野付きのACT,目入りの拡散ポリシー) に対して,ALOHAとUMIは,同等の視覚データを作成します.第三者の視野を使用するポリシーでは,視覚的外観が部署に一致しているため,ALOHAデータは好ましい. 3人目のカメラで UMI を使用する場合,腕カメラのビューのみでトレーニングするか,外観差を埋めるためにドメインランダム化を使用してください.

データの増幅層としてRC G1タクチルグローブ

[RC G1 タクチルグローブ] (T14) は,データ収集作業に触覚センサーを追加します.ALOHAの遠隔操作中に使用すると,リーダー腕握手上での操作者の指接触力記録されます.UMIの収集中に使用すると,UMIのハンドルに指の接触力記録されます. この触覚データによって 接触力に対する反応を 示す 政策を訓練できます 滑り方検出 握り力調節 対象の硬さ感知 視覚のみの政策の能力を超えてです

よく 聞かれる 質問

ALOHA と UMI の違いは何ですか?

ALOHAは,操作者が動作を遂行するためにマッチしたロボット腕を制御する双面リーダー・フォロワー遠隔操作システムである.フォロワー腕は関節軌道を記録する.UMIは,操作者が直接環境で使用する手動グリッパー装置である.データ収集中にロボット腕は必要ありません. ALOHAはロボットとネイティブの共同データを記録し,UMIは任務空間軌跡を記録し,再定向するロボットを記録する.

ALOHA または UMI はデータ収集に最適ですか?

ALOHAは,双手データ,ロボットネイティブコアント・トレイクトリー,または ALOHAハードウェアに展開される場合により良い.UMIは,移植性 (ロボットなしでどこにでもデータを収集する),多くの非専門家のオペレーター間でデータ収集を並行したい,または複数のロボットプラットフォームに展開する予定である場合によりよい. UMIデータにはリターゲティングステップが必要です ALOHAデータはすぐに訓練に準備されています.

ALOHAと UMIの費用はどのくらいですか?

[モバイル ALOHA] (T15) は,完全なシステム (2 リーダー腕 + 2 フォロワー腕 + モバイルベース) に約4,000ドルかかります.静止型 ALOHA (ベースなしの 4 ViperX腕) は約3,000ドルです. [RCSV UMI] (T16) は,単位あたり800ドルで,並行データ収集のために複数のユニットを同時に展開できます.

ALOHAのポリシーを訓練するために UMIデータを利用できますか?

逆動力学を用いて,ALOHA腕の関節角に変換しなければならない.この再標的にすると,いくつかのエラー (通常2-5mmの末標標位置誤差) が導入されますが,ほとんどの操作作業に適しています.レロボットと[Fearless Data Platform]T17) はどちらもUMI-to-ALOHA再標的にサポートします.

デックス-UMIとは?

[Dex-UMI] (T18) はUMIの巧妙な操作バージョンです.並行爪握手データを捕捉する代わりに,Dex-UMIは複数の指の示範を撮影するために楽器の手袋を使用します.個々の指の位置,接触力,腕の姿.Dex-UMIデータはLEAP HandやAllegro Handのようなロボットの手のポリシーを訓練します. 標準 UMIと ALOHA が捉えることができない巧妙な作業 (ツールの使用,手動の再方向化) に関するデータ収集を可能にします.

ALOHA vs UMIで1時間に何回のデモを集められるか?

ALOHA: 時給2040回の双手演示,または時給4060回の単腕演示.リーダー・フォロワー設定では,ロボットは物理的に存在し,電力を入れなければならない.UMI: 時給60~100回の演示,複数のオペレータを同時に実行できます. UMIデバイスを搭載した5人のオペレーターのチームは,毎時間300-500個のデモを収集できる.

関連: 模倣学習のための最高のロボット2026 · ALOHA ロボットガイド · モバイル ALOHAセットアップ · ACTポリシー説明 · RCSVストア