ALOHA ロボット:スタンフォードのオープンソースの双手通信システム
完全な ALOHA ロボットガイド:それが何であるか,完全な BOM とコスト ($17K-$32K), ROS2 と ACT の設定,双手作業訓練,そして 4,500 $ から費用対効果的代替品.
[←ガイド]
ALOHAについて知っておくべきことは全て 機械学習の2つのメカニズムを あらゆる研究室に利用できるようにしたプラットフォームです 建築やコストから 設置,訓練,代替品までです
ALOHAとは何か?
ALOHAは 双手通信のための低コストのオープンソースハードウェアシステムを表しています. スタンフォード大学ではトニー・シャオ,ヴィカッシュ・クマール,セルゲイ・レヴィン,チェルシー・フィンによって開発され,ALOHAデータと動作するように設計された模倣学習アルゴリズムであるACT(Action Chunking with Transformers) とともに2023年の論文"低コストハードウェアで精細な二手操作を学ぶ"で導入された.
ALOHA以前は,二手操作研究には高価な産業ロボット (フランカ・エミカ・パンダ2台8万ドル+またはバクスター2万5000ドル) と,大規模なカスタムエンジニアリングが必要でした. ALOHAはリーダーフォローの配置で 2つの消費者向けロボット腕が 効果的な操作政策を訓練する 高品質の双手式デモデータを 収集できると示しました これは以前のシステムのコストの約10分の"です
このシステムは世界中の数十のラボで複製され,いくつかのバリエーションが生まれた.特に Mobile ALOHA (全身のテレオペレーションのための車輪ベースを追加) と ALOHA 2 (より優れたハードウェア寛容性を持つGoogle DeepMindの改良版) は,完全にオープンソースです.
アロハ が 重要 な の は なぜ です か
ALOHAの重要性はハードウェアそのものではなく 基本的に机器人手がテーブルに縛られているものです その影響は3つの貢献から生まれます
- **民主化された二手動データ収集.**リーダー・フォロワーデザインは,人間の操作者が任意の作業員にプログラミングなしで二手動作業を示せるようにします.操作者はリーダーの手を握って,自然に作業を実行します.フォロワー腕は,カメラが観測を記録する間に動きを反映します.これは大学の研究室にアクセス可能なコストで最初の大規模な二手動態デモデータセットを生産しました.
- **ACT(Action Chunking with Transformers) **ACTアルゴリズムは,一度に1つのアクションではなく,同時に100の将来のアクションを予測する.これは,以前の模倣学習アプローチを苦しめた複合エラーを劇的に減少させ,以前の方法が20-40%を達成した課題で80〜90%の成功率を達成する.
- オープンソースの再生可能性. CADファイル,BOM,ROS2ドライバ,データ記録スクリプト,ACTトレーニングコード,およびプリトレーニングモデルなどすべてのコンポーネントが公開されています. これによりロボットコミュニティ全体で迅速な採用と繰り返しが可能になりました.
固定型ALOHA vs モバイル型ALOHA
ALOHAプラットフォームは2つの主要な構成で存在します.何を建設するか,何を購入するか決める前に区別を理解することが不可欠です.
| Feature | Stationary ALOHA | Mobile ALOHA |
|---|---|---|
| Base | Fixed table mount | AgileX Tracer wheeled base |
| Follower arms | 2x ViperX 300 S2 | 2x ViperX 300 S2 |
| Leader arms | 2x WidowX 250 S | 2x WidowX 250 S |
| Action space | 14-DOF (7 per arm) | 16-DOF (14 arm + 2 base velocity) |
| Cameras | 2 wrist + 1 overhead | 2 wrist + 1 overhead + 1 side (optional) |
| Hardware cost | $17,000-22,000 | $28,000-35,000 |
| Setup time | 2-4 weeks | 4-8 weeks |
| Best for | Tabletop bimanual tasks | Tasks requiring locomotion + manipulation |
ほとんどのチームにとって,静止のALOHAは正しい出発点です.モバイルALOHAは移動能力のために10,000-15,000ドルと重要な統合複雑性を追加します.あなたの作業が単一の作業所で起こると - 組み立て,梱包,キッチン準備,ラボ操作 -静止のALOHA (またはOpenArm DK1]
移動型バージョンの詳細なコスト別別については, [Mobile ALOHA Cost Breakdown](
ALOHAシステムアーキテクチャ
ALOHAのアーキテクチャを理解することで,そのアーキテクチャを構築するか,代替品を購入するか,またはデータ収集を完全に外出するかを評価することができます.
ハードウェア:リーダー・フォロワー・テレオペレーション
ALOHAはリーダー・フォロワー (マスター・スラブとも呼ばれている) の構成を使用している.各腕ペアは以下の構成で構成されている.
- フォローアーム (ViperX 300 S2): 作業を実行し物体と相互作用するロボットアーム.Dynamixel XM/XHシリーズセルボを使用し,全拡張で750gの役に立たない.テレ操作中に,リーダーアームの関節位置を50Hzで反映します.
- リーダー腕 (WidowX 250 S): 人間の操作者が抱いて動かしている腕.フォロワーよりも軽く短距離で,長時間データ収集セッションで操作を快適にします.重力補償を通じて力フィードバックを提供します.
リーダーとフォロワー腕は,ダイナミクセル U2D2 アダプターを通じてUSBを通じて同じ機内コンピュータに接続します.制御ループは,リーダー腕から50Hzで関節位置を読み取っていて,フォロワー腕に一致する位置コマンドを送信します. 透明なテレ操作のために,全体的な端から端の遅延は10 ms未満でなければならない (オペレーターは,動きとフォロワーの応答の間に遅延を感じてはならない).
カメラシステム
ALOHAは3つの位置でインテルRealSense深度カメラを使用します:
- 両腕カメラ (RealSense D405): フォローアーム腕に搭載され,操作作業場を近距離で見ることができます.D405の最低深さ範囲は7cmで,握り中に近場感知に適しています.
- 1つのオーバーヘッドカメラ (RealSense D435): 作業場の上部に設置され,空間文脈を上から下へと眺める.このカメラは両腕と作業場布局の相対的な位置を捕捉します.
記録されたデータには有効なポリシーを訓練するために,すべての3台のカメラが一時的に同期する必要があります (10 ms以内に).インテルマルチカメラ同期ケーブルはハードウェアレベルの同期を提供します.それなしでは,ソフトウェアタイムスタンプの調整は30~60 msのジートを導入し,トレーニングパフォーマンスを10%~20%低下させます.
計算スタック
搭載コンピュータ (通常はIntel NUCまたは相当のミニPC) は,同時に3つの作業を処理します.
- リアルタイム制御: ダイナミクセルセルボスで50 Hzでリーダーの関節位置とフォロワーの関節位置を読み取る.
- カメラキャプチャ: 3台のカメラから30fpsで同期RGBフレームを記録する.
- データ記録: センサーのすべてのデータを (関節位置,速度,カメラフレーム,タイムスタンプ) 後で訓練するために HDF5ファイルに書き込む.
ロボットにはGPUが不要.ポリシートレーニングは別々のワークステーション (RTX 4090またはクラウドGPU) でオフラインで行われます.NUCのCPUで実行できます. ACTモデルでは,前進パスごとに10 ms未満が必要です.
固定的なALOHAコスト割引
静止のALOHA構成 (移動ベースなし) は,建設に大幅に安く,速くなります.
| Component | Cost | Notes |
|---|---|---|
| 2x ViperX 300 S2 follower arms | $9,600 | $4,800 each, Dynamixel XM/XH servos |
| 2x WidowX 250 S leader arms | $6,200 | $3,100 each, lighter weight for operator comfort |
| 2x Custom gripper assemblies | $400-800 | Parallel-jaw with Dynamixel XL330 |
| 3x Intel RealSense cameras | $950 | 2x D405 wrist ($300 ea) + 1x D435 overhead ($350) |
| Intel NUC 13 Pro (onboard computer) | $800-1,200 | i7, 32GB RAM, 1TB NVMe |
| U2D2 adapters, USB hub, cables | $350-500 | 4x U2D2 ($50 ea), powered USB hub, cabling |
| Mounting hardware, table clamps | $200-400 | Camera mast, arm base plates, clamps |
| Stationary ALOHA total | $18,500-19,700 | Hardware only, before labor |
| Training workstation (RTX 4090) | $2,000-3,000 | Separate desktop for offline training |
| Complete system total | $20,500-22,700 | Excluding integration labor |
これは完全に機能する静止のALOHAの最低コストを表します.プロの組み立てのために2,0005,000ドルを追加します.ビルドをアウトソーシングしている場合は,モバイルバリエーションのために,AgileXベース,マウントングフレーム,追加のバッテリー,統合のために10,00015,000ドルを追加します.完全なモバイル BOMについては,私たちの [詳細なモバイルALOHAコスト分解]
ソフトウェアスタック
ALOHAソフトウェアスタックには4つの層があり,それぞれオープンソースで文書化されています.
1. ROS2 謙虚 (リアルタイム制御)
Ubuntu 22.04 の ROS2 Humble は通信層を提供します.
- Interbotix ROS2 パッケージ: ViperXと WidowX の ドライバ. 50 Hz で 共同 状態 出版 及び 位置 コマンド サブスクリプション を 提供する.
- **RealSense ROS2 包装:**カメラドライバーノードでRGBと深度画像を30fpsで公開する.
- テレ操作ノード: リーダー腕の関節位置を読み, 50 Hz でフォローアームに一致するコマンドを送信します.
# Install ROS2 Humble and ALOHA dependencies
sudo apt install ros-humble-desktop python3-colcon-common-extensions
# Install Interbotix arm drivers
curl 'https://raw.githubusercontent.com/Interbotix/interbotix_ros_manipulators/main/interbotix_ros_xsarms/install/amd64/xsarm_amd64_install.sh' > xsarm_install.sh
chmod +x xsarm_install.sh && ./xsarm_install.sh -d humble
# Install RealSense drivers
sudo apt install ros-humble-librealsense2* ros-humble-realsense2-camera
2. ALOHA レポジトリ (テレオペレーションと記録)
公式のALOHA GitHubリポジトリは,リーダーフォロワーテレオペレーションと同期データ記録のためのスクリプトを提供しています.これは,カメラフレーム (30 fps) とコモンストレーション状態データを (50 Hz) をタイムスタンプされた HDF5 エピソードに並べることという重要な作業を処理します.各エピソードには:
T2 :形 (T, 14) --指揮関節位置 (7腕あたり) T3 :形 (T, 14) --測定された関節位置 T4 :形 (T, 480, 640, 3) -- 空端カメラ T5 :形 (T, 480, 640, 3) T6 :形 (T, 480, 640, 3)
3.ACT訓練コード (オフライン政策学習)
ACT(Action Chunking with Transformers) は,ALOHAデータのためのデフォルトトレーニングアルゴリズムです.
- エンコード: ResNet-18 イメージエンコードと共同状態 MLP を通して,現在の観測 (共同位置 +カメラ画像) を処理する.
- デコッダ: 条件変数自動コード (CVAE) を搭載したトランスフォーマーデコッダで,同時に100の将来のアクションを予測する.
- 時間集合: 展開中に,重複するアクションブロックは指数値重量化で平均され,連続的な予測間の移行を平滑にする.
# Train ACT policy on ALOHA data using LeRobot
python lerobot/scripts/train.py \
policy=act \
dataset_repo_id=your-username/aloha-task \
env=aloha \
training.num_epochs=2000 \
training.batch_size=8 \
policy.chunk_size=100 \
policy.kl_weight=10
4. レロボット (近代統合層)
[LeRobot] (
設定ガイド概要
ALOHA システムを構築し設定するには,5 つの段階が必要です 詳細なステップ・バイ・ステップ説明は,移動式および移動式の設定の両方をカバーする [モバイル ALOHA 設定ガイド] (
第1段階:ハードウェアの組み立て (3-5日)
フォロワー腕をテーブルまたはフレームに設置し,操作者の高度にリーダー腕を設置し,グリッパー,カメラを組み立て,すべての電子機器を接続する.重要な詳細:腕ベースプレートは1mm以内にコプラナーでなければならない.カメラのマウントは硬い (任意のフレックスが不一致なデータを生成する).すべてのボルトをスペcifications に torque 適用し,振動に弱い関節に threadlocker を適用する.
ステージ2: ROS2 設定と校正 (3-7 日)
Ubuntu 22.04,ROS2 Humble,Interbotixドライバー,RealSenseドライバーをインストールする.ダイナミクセルセルサーバパラメータを設定する:ボード速度は1Mに設定し,各関節のゼロポジションを校正し,PIDの加速度を設定し,リーダー腕の重力補償を設定する.USBデバイスの数え順を確認する (これはデバイスがリ起動後に割り当てられたときにバグの一般的な源です).
第 3 段階: 最初のテレオペレーションテスト (1~2 日)
遠隔操作ノードを実行して,両腕のペアが正しく追跡していることを確認します.チェック:リーダーからフォロワーへの遅延 (必須10 ms未満),追跡精度 (フォロワーがリーダー位置と2度以内に一致する必要があります),グリッパー同期 (オープン/ロック状態が一致する),カメラフィード (すべての3台のカメラが30 fpsでクリーンフレームを生産します).データ収集に進む前に,すべての問題を修正します.
第4段階:デモの録音 (進行中)
作業を定義し,録音スクリプトを設定し,デモを収集し始める.複雑な作業に時間を投入する前に,完全なパイプラインを検証するために簡単な検証作業 (選択と場所) を開始します.検証作業のための50回のデモを収集し,ポリシーを訓練し,評価します.目標: 60%+の成功率.40%未満の場合,より多くのデータを収集する前にハードウェア/校正をデバッグします.
第5段階:トレーニング ACTポリシー (トレーニングランごとに4~8時間)
データをHuggingFace Hub (または現地で電車) に押し付け,ACTハイパーパラメータを設定して電車.キーハイパーパラメータ: chunk_size=100,kl_weight=10,batch_size=8,num_epochs=2000.検証損失を観察する - 訓練は200+時代間の損失の平原で行われます.訓練されたポリシーを評価のためにロボットに戻します.
性能基準
この成功率は,ACTのオリジナルの論文 (Zhao et al., 2023) と後のALOHA出版物から得られます.ハードウェアの校正品質,示例数,操作者のスキルに基づいて結果は異なります.
| Task | Success Rate | Demos Used | Notes |
|---|---|---|---|
| Slot insertion (bimanual) | 91% | 50 | One arm holds socket, other inserts battery |
| Fork retrieval from pot | 82% | 50 | Requires precise grasp in confined space |
| Coffee making (multi-step) | 62% | 50 | Long-horizon, 5+ sequential sub-tasks |
| Table bussing (mobile) | 85% | 50 mobile + 370 static | Mobile ALOHA with co-training |
| Door opening (mobile) | 76% | 50 mobile + 370 static | Whole-body coordination required |
| Object handover to human (mobile) | 68% | 50 mobile + 370 static | Requires detecting human presence and timing |
基準値からの重要な洞察: 共同訓練はモバイルタスクにとって非常に重要だ.上記のモバイルタスクは50回のモバイルデモのみを使用したが,370回の静的双手作業で共同訓練を受けた.共同訓練なしでは,同じ50回のモバイルデモは20~40%の成功率を下げた. 携帯電話のポリシーを得るために 携帯電話のデータを少し追加できます.
ALOHA 代替品の比較
いくつかのシステムは,異なる価格点と異なるトレードオフで,ALOHAのような双手間遠隔操作能力を提供します.
| System | Cost | Key Advantage | Key Limitation |
|---|---|---|---|
| Stationary ALOHA (DIY) | $20,500-22,700 | Original platform, large community | Requires DIY assembly and ROS2 expertise |
| Mobile ALOHA (DIY) | $28,000-35,000 | Mobility + bimanual, co-training data | Complex build, high total cost |
| OpenArm DK1 | $12,000 | Ships assembled, higher-torque servos, warranty | Stationary only, smaller community |
| OpenArm 1 | $4,500 | Lowest-cost entry to robot learning | Single arm only (no bimanual) |
| ALOHA 2 (Google DeepMind) | N/A | Improved hardware, better tolerances | Not commercially available |
| UMI (Universal マニピュレーション Interface) | $2,000-3,000 | No robot needed for data collection | Single-arm, camera-only (no depth/force) |
| RCSV DK1 Lease | $2,500/mo | No upfront cost, includes maintenance | Monthly recurring cost |
| RCSV Data Services | $2,500 pilot | No hardware at all, expert operators | Limited to RCSV's task environments |
ALOHAよりも OpenArm DK1 を 考慮すべきか?
[OpenArm DK1] (
- 船は組み立て,校正された. 4~8週間建造時間. 最初の日に最初のデモを集める.
- **高トルクサーボ.**OpenArmのカスタマイズされたアクチュエーターは,ViperX腕のDynamixel XM430サーボよりも30%多トルクを供給し,熱管理が改善され,過熱による停電時間を短縮します.
- ALOHA対応データ形式. ALOHAと同じ14DOFアクションスペースとHDF5エピソード形式を記録する. DK1データで訓練されたポリシーは ALOHAデータで細かく調整され,反面もできます.
- 90日保証およびサポート. 交換部品および技術サポートが含まれます. DIY ALOHAビルドには保証はありません.
- 44%安価 比較可能な静止型ALOHAでは12,000ドル対20,500-22,700ドル
RCSV が ALOHA プロジェクト に 協力 する 方法
ALOHAをゼロから構築する 代替品を探したり 双行データが必要な場合でも RCSVは結果を得るための複数の経路を提供します.
準備済みハードウェア
[OpenArm DK1] (
専門家事業者データ収集
RCSVの [データ収集サービス] (
- パイロットプロジェクト: 2,500ドル - 単一の作業で50~100回のデモを2週間で実施する
- 全キャンペーン: 8,000ドル - 200-500回の示例,複数のタスクで注釈と品質検証
ロボットレンディング
RCSVの [ロボットリースプログラム] (
実験室アクセス
RCSVはサンフランシスコ,カリフォルニア州およびマハマニア州オールストンにある機械工学ラボを運営しています.データ収集,プロトタイプ作成,または評価のために ALOHAクラスのハードウェアへの偶発的なアクセスが必要な場合は,研究室アクセスに関する取り決めについて [連絡してください]
よく 聞かれる 質問
ALOHAとACTの違いは何ですか?
ALOHAはハードウェアプラットフォーム (ロボット腕,カメラ,テレオペレーション設定).ACT (トランスフォーマーとのアクションチャンキング) は,ALOHAデータから操作ポリシーを訓練するソフトウェアアルゴリズムです.それらは同じ論文で導入されたが,独立した:あなたはACTではなくALOHAデータを収集し,拡散ポリシーで訓練することができます.またはあなたは非ALOHAハードウェアからのデータでACTを訓練することができます. 算法に関する詳細については, [ACTガイド]
**操作以外の任務のために ALOHA を使えますか? **
ALOHAは双手操作用に特別設計されています.その腕は,使用荷 (750g) と到達範囲 (300mm) が限られているため,重荷,高精度組装 (耐性度は2mmより厳しく) や,サーボの現在の感知能力を超えた力制御を必要とする作業には適していません. 単一の指制御を必要とする巧妙な操作については, Orca Hand または [Paxini Gen3触覚手袋](
どれだけデモが必要か?
制限された変性のある単純な双手作業 (固定オブジェクトポジション,単一のアプローチ戦略): 50 回の示例では,ACT で60~80%の成功率を達成できます. 変性が高い作業 (ランダムオブジェクトポジション,複数の有効アプローチ): 強力なパフォーマンスのために200-500 回の示例が必要になります. 多段階の作業 (5+ 連続的なサブタスク): 300-1,000 回の示例. [示例分析費用]
ALOHAは2026年にまだ関連しているのでしょうか
古いプラットフォームにもかかわらず,ALOHAは最も広く複製され,最もよく文書化された双手操作システムであり続けています.大きなコミュニティは,他の選択肢よりも多くの共有データセット,先程訓練されたモデル,トラブルシューティングリソースを意味します. ALOHA データ形式 (14-DOF 共同位置 + 多ビュー画像) は,二手学習の事実上の標準となり,ほとんどの新しいアルゴリズムは ALOHA 作業に基準付けされています.
"ALOHAに手持ちの手を加えるか"
標準的なALOHAグリッパーは1DOFの平行マ jawsです.それを複数指の手 (例えば,Orca Hand)
ALOHAのデータセットをどこで調べて 算数をテストできるのか
HuggingFace Hubではいくつかの公共のALOHAデータセットが利用可能である.ACT紙のオリジナルデータセット (スロット挿入,フォーク回収,コーヒー制作),モバイルALOHAデータセット (テーブルバスリング,ドア開き) および様々なタスクのためのコミュニティによるデータセットが利用可能である.RCSVはまた,私たちの [データセットページ](
関連 読書
モバイルALOHAコストの割れ · モバイルALOHA設定ガイド · アクション・チャッキング・トランスフォーマー (ACT) · ACT対拡散政策 · レロボット開始 · 模倣学習ガイド · データサービス · ロボットリース
建物なしでALOHAと互換性のある二手動データを取得する
RCSVは 12,000ドルから元にビルドされた双手ハードウェア, 2,500ドルからプロデータ収集, 2,500ドルからシステムリースを提供しています. DIYビルドをスキップしてすぐにデータを収集を開始します.







