Zurück zu Blog

ALOHA-Roboter: Was ist er, wie funktioniert er und wie man damit anfängt

ALOHA-Roboterführer: Stanford's zweimanuelle Teleoperationsplattform mit zwei ViperX-Armen. Vollständige BOM, ACT-Training-Setup und kostengünstige Alternativen von RCSV ab 4.500 Dollar.

ALOHA ist die zweibäufige Teleoperationsplattform der Stanford University, die zum ersten Mal demonstrierte, dass ein Roboter begabte Hand-Manipulationsaufgaben wie das Öffnen einer Tasche Chips, das Binden eines Kabels oder das Kochen lernen kann. Dieser Leitfaden erklärt, was ALOHA ist, wie es funktioniert und wie man mit der Anwendung beginnt.

Die Geschichte der Stanford-Origin

ALOHA Ein Low-Cost Open-Source Hardware System für Bimanual Teleoperation wurde im Stanford Mobile Manipulation Lab entwickelt und im Jahr 2023 in der Arbeit "Learning Fine-Grained Bimanuelles Manipulieren with Low-Cost Hardware" von Tony Z. Zhao et al. veröffentlicht. ALOHA nutzte vier ViperX 300 und WidowX 250 Roboter-Arme (zwei pro Seite, eine als Führungskräfte für Teleoperation und eine als Anhänger) mit einer Gesamtkosten von weniger als 20.000 USD, kombiniert mit dem ACT-Algorithmus, um Aufgaben auszuführen, die zuvor benutzerdefinierte Systeme erforderten, die viele Male mehr kosten.

Das Papier zeigte 10 zweimanschließende Aufgaben, darunter das Entwickeln eines Stückes Süßigkeiten, das Einfügen einer Batterie in einen Schlitz und das Drücken eines Seils durch ein Loch alle mit Erfolgsraten über 80% mit 50 Demonstrationen. Diese Ergebnisse schockierten die Robotik-Community nicht, weil die Aufgaben neu waren, sondern wegen der Kosten und Dateneffizienz. ALOHA und ACT haben gemeinsam einen neuen Maßstab für zugängliche, geschickte Manipulationsforschung geschaffen und eine Welle von Nacharbeit ausgelöst, die bis heute fortgesetzt ist.

Das ALOHA-Hardware-Design und alle Software sind vollständig Open-Source. Die Rechnung der Materialien, die Montageanweisungen und der ACT-Schulcode sind öffentlich auf GitHub verfügbar. Diese Offenheit hat ALOHA zur de facto-standard-bi-manuellen Forschungsplattform gemacht, mit Dutzenden von Forschungsgruppen weltweit, die Varianten des ursprünglichen Designs betreiben. RCSV unterstützt Plattformen der ALOHA-Klasse durch unsere Datendienste und Hardware Leasing-Programm.

Vollständige Hardware-Spezifikation

Das Verständnis der genauen Hardware-Konfiguration ist wichtig, da kleine Abweichungen ein anderes Armmodell, eine falsch ausgerichtete Kamera, ein Servo mit niedrigerem Drehmoment Datensätze erzeugen können, die mit der Bezugsergebnis ACT-Implementierung unvereinbar sind.

Waffen: ViperX 300 6DOF (Follower) und WidowX 250 6DOF (Leader)

Spec ViperX 300 (Follower) WidowX 250 (Leader)
DOF 6 + gripper 6 + gripper
Reichweite 750mm 625mm
Nutzlast 750g (at full extension) 250g (at full extension)
Wiederholgenauigkeit ~1mm ~2mm
Servos DYNAMIXEL XM540 + XM430 DYNAMIXEL XM430 + XL430
Communication USB via U2D2 adapter, 1Mbps USB via U2D2 adapter, 1Mbps
Control rate 50Hz (20ms loop) 50Hz (reads only)
Weight 3.6kg 2.1kg
Price (per arm) ~$5,500 ~$3,200

Kamera-System

Das ursprüngliche Papier verwendet 3 Logitech C922 Webcams (2 Handgelenk-montiert + 1 Oberkopf) Aufnahme bei 480x640 Auflösung, 50fps. ALOHA 2 auf Intel RealSense D405 Kameras für eine verbesserte Bildqualität und optionale Tiefe aktualisiert. RCSV ALOHA-Sendungen verwenden RealSense D435i Kameras mit Hardware-Synchronisierung für eine konsistente Multi-Kamera-Zeit.

Verteilung der Gesamtmontage-Kosten

Component Qty Unit Cost Subtotal
ViperX 300 6DOF arms (follower) 2 $5,500 $11,000
WidowX 250 6DOF arms (leader) 2 $3,200 $6,400
Cameras (RealSense D435i or D405) 3-4 $300 $900-1,200
U2D2 USB adapters 4 $30 $120
Power supplies (12V) 4 $35 $140
Aluminum extrusion frame + brackets 1 set $500 $500
Camera mounts, cable management, misc 1 set $200 $200
Workstation PC (RTX 4090, 32GB RAM) 1 $2,500 $2,500
Total (DIY build) ~$21,800-22,100
Total (with Mobile ALOHA base) + AgileX Tracer ($10,000) ~$32,000

Die Montagezeit für einen erfahrenen Bauherren beträgt ca. 20-30 Stunden. Für einen ersten Bauherren können 40-60 Stunden vorgesehen werden, einschließlich der Debugging von Dynamixel-Kommunikationsproblemen, der Kalibrierung der Kamera und der Software-Einstellung. Die häufigsten Fehlerpunkte der Montage sind: Dynamixel-Deize-Kette-Kabel (unrichtige Bus-ID-Zuteilung verursacht, dass Armsegmente aus der Ordnung reagieren), Kamera-Kabel-Routing durch das Handgelenk (Kabel, die zu eng sind, beschränken die Handgelenkrotation) und Rahmenstarrheit (untergeheizte Extrusionsbolte erzeugen Schwingungen, die die Bildqualität der Kamera beeinflussen).

Software-Einstellung: Von der Klone bis zur ersten Demo

Der ALOHA-Software-Stack besteht aus zwei Komponenten: der Telebetriebssteuerungsschleifen (Leseführer, Befehlsverfolgter, Aufzeichnung von Daten) und der ACT-Training Pipeline.

# Klonen und installieren Sie das ACT-Repository git clone T27 cd act conda erstellen -n aloha python=3.8.16 -y conda aktivieren aloha pip installieren -r requirements.txt # Installieren Sie Interbotix SDK für die Armsteuerung # Folgen: T28 sudo apt install ros-humble-interbotix-xsarm-control # Konfiguration von Arm USB-Geräten # Jeder Arm benötigt ein einzigartiges USB-Port-Mapping in /etc/udev/rules.d/ # Führer: /dev/ttyDXL_transleader_leader # Links Führer: /dev/ttyDXL_leader\right # Follower links: /ttyDD_testy_left # Follower links: /ttyD_testy_left / Follower: /DyD\L\follower \leap_text \leader \py_textes \py_textes \leader \leader_textes \left_textes \left_textes \left_textes \left_textes \left_textes \left_textes \left_textes \textes \textes \textes \textes \textes \textes \textes \textes \textes \textes \textes \textes \textes \textes \textes \textes \textes \textes \textes \textes \textes \textes \textes \textes \textes \textes \text

Das Aufnahmeschreiben produziert HDF5-Dateien mit der folgenden Struktur pro Episode: T0 (Overhead), T1, T2, T3 (14-dimensionale gemeinsame Positionen: 7 pro Arm), T4 (14-dimensionale gemeinsame Positionsziele) und T5. Jede Episode ist eine eigenständige HDF5-Datei, typischerweise 20-50 MB abhängig von der Kameraauflösung und Episodelänge.

ROS2-Integration

Während der ursprüngliche ALOHA-Code den Interbotix Python SDK direkt (nicht ROS) verwendet, integrieren sich viele Teams mit ROS2 für Kompatibilität mit MoveIt2, Kamera-Treibern und Visualisierung. Das T6-Paket bietet ROS2-Knoten für ViperX und WidowX-Arme.

  • Setzen Sie die Dynamixel-Bow-Rate auf 1 Mbps für Führer- und Anhängerarme, um die 50Hz-Steuerrate zu erhalten
  • Verwenden Sie einen speziellen USB-Hub (nicht einen mit einer Kette von Daisy verbundenen Hub), um einen Busstreit zwischen 4 gleichzeitigen USB-Serieanschlüssen zu vermeiden
  • Konfiguration von Kamera-Treiber, um komprimierte Bilder zu veröffentlichen, um Bandbreite zu reduzieren Roh 640x480 RGB bei 30 fps pro Kamera ist 27,6 MB/s pro Kamera, 110 MB/s für 4 Kameras
  • Verwenden Sie ROS2-Botschaftsfilter zur Zeitsynchronisierung zwischen Kamera-Themen

Hardware-Architektur: Bimanuelle Einrichtung von Führungskräften und Anhängern

Das ALOHA-System besteht aus zwei kinematischen Paaren, eines für jeden Arm. Jedes Paar hat einen "Führer" Arm einen leichten, rückwärts treibbaren Arm, den der Betreiber mit seinen Händen hält und bewegt und einen "Follower" Arm, der die gemeinsamen Positionen des Führers in Echtzeit spiegelt. Der Follower-Arm trägt den tatsächlichen Manipulator (Greifer, Werkzeug oder End-Effektor) und interagiert mit der physischen Welt. Der Führerarm hat keine Nutzlastanforderungen für die Endwirkung, da er nur zurückführbar sein und dem Betreiber das Drehmoment zurückgeben muss.

Die binuale Konfiguration zwei komplette Führer-Follower-Paare ist das, was ALOHA für geschickte Aufgaben einzigartig fähig macht. Einarmbrootroboter können diese Aufgaben nur mit komplexen Anlagen oder Sequenzierungen annähernd erfüllen; zweihandliche Roboter können sie direkt handhaben. Der ALOHA-Formfaktor, mit beiden Armen auf einem gemeinsamen Tisch-Anbau montiert, ist für Tischmanipulationsaufgaben optimiert, bei denen der Betreiber vor dem System sitzt.

Die Kamera-Einstellung im ursprünglichen ALOHA-Papier verwendet drei Kameras: eine Oberkopf (Vogel-Augen-Blick auf den gesamten Arbeitsplatz), eine auf dem linken Handgelenk und eine auf dem rechten Handgelenk. Diese Multi-View-Anordnung ist entscheidend: Die Handgelenkkameras bieten einen Nahenblick auf die Festnahme und den Kontakt, während die Oberkamera einen globalen Kontext für die Koordinierung mit zwei Händen bietet.

Alternative Bimanuale Einrichtung: RCSV DK1 Kit

ALOHA ist nicht die einzige Option für die zweimanuelle Teleoperationsforschung. Das DK1-Bimanual-Kit von RCSV bietet Teams, die den Datenverwert über die genaue ALOHA-Kompatibilität priorisieren, mehr Vorteile:

Feature ALOHA (DIY Build) RCSV DK1 Kit
Arms ViperX 300 + WidowX 250 OpenArm 1 leader-follower pairs
Total cost ~$22,000 + assembly $9,000 pre-assembled
Assembly time 20-60 hours 2 hours (unbox + calibrate)
Nutzlast (per arm) 750g 500g
Data format HDF5 (custom schema) HDF5 + LeRobot export
ACT compatibility Native Via format conversion
Community size Largest (100+ labs) Growing (RCSV ecosystem)

Die DK1 ist die bessere Wahl für Teams, die sofort mit der Datenerhebung beginnen müssen und mit Diffusion Policy oder VLAs trainieren möchten (die in Bezug auf den spezifischen Roboter architektonisch agnostik sind). ALOHA ist die bessere Wahl für Teams, die eine genaue Kompatibilität mit den veröffentlichten ACT-Ergebnissen benötigen oder zum ALOHA-Ökosystem mit offenem Quelltext beitragen möchten. Siehe unseren [Hardware-Katalog]T10) für Details zu DK1.

ALOHA-Verwendungsfälle: Was funktioniert und was nicht

Aufgaben, bei denen ALOHA ausgezeichnet ist

  • Tischbüchse-Manipulation: Öffnung von Behältern, Falten, Übertragung zwischen den Händen, Zwei-Hand-Versammlung.
  • Food-Preparationsforschung: Gemühen, abgerissen, gegossen, weiche Materialien geschnitten.
  • Kabel- und verformbare Gegenstandsmanipulation: Fasern, Wickeln, Binden. Die Handgelenkkameras sorgen für die Nähebildverarbeitung für verformbare Kontaktarbeiten.
  • Datenverwertung im Maßstab: Das Open-Source-Design ermöglicht die Erstellung mehrerer identischer Stationen.

Aufgaben, für die ALOHA kämpft

  • Schweres Objektsmanipulation: Die 750g Nutzlastgrenze (in voller Ausdehnung) schließt viele Industrieobjekte aus.
  • ** Präzisionsinsertion unter 1 mm:** Die ~1 mm Wiederholbarkeit der ViperX-Servos begrenzt die Präzision. Für Sub-Millimeter-Tätigkeiten benötigen Sie entweder Kraftfeedback (nicht in der Basis ALOHA enthalten) oder eine höhere Präzisionsarmplattform.
  • Werkspaß-Aufgaben: Die Reichweite von 750 mm beschränkt den Arbeitsplatz auf eine Fläche von etwa 1 m x 0,5 m. Aufgaben, die die Bewegung über einen Küchenschalter oder zwischen den Regalen erfordern, benötigen Mobile ALOHA oder eine andere Plattform.
  • Hochgeschwindigkeitsmanipulation: Die 50Hz-Steuerungsschleifen begrenzen die Reaktionsgeschwindigkeit. Aufgaben, die eine schnelle reflektive Reaktion auf unerwartete Störungen erfordern (Fang eines geworfenen Objekts, dynamische Übergabe), liegen außerhalb der aktuellen ALOHA-Fähigkeit.

Der Algorithmus hinter ALOHA

ACT (Action Chunking with Transformers) wurde zusammen mit ALOHA entwickelt und ist der primäre Lernalgorithmus für die Plattform. ACT ist eine transformatorbasierte Imitationslernpolitik, die einen Teil zukünftiger gemeinsamen Positionen typischerweise 100 Zeitschritte bei 50Hz vorhersagt, die 2 Sekunden Bewegung abdecken, anstatt eine einzige nächste Aktion. Diese Aktions-Chunking-Architektur reduziert das Komponidierungsfehlerproblem der naiven Verhaltensklonung erheblich, wo sich kleine Vorhersagefehler bei jedem Zeitschritt in große Trägerungsabweichungen im Laufe einer Aufgabe ansammeln.

Die ACT-Politikarchitektur verwendet einen CVAE-Code (Conditional Variational Autoencoder) während des Trainings, um den latenten Stil jeder Demonstration zu erfassen. Zur Zeit der Ableitung läuft nur der CVAE-Decoder, der auf der aktuellen Beobachtung und einem entnommenen latenten Vektor bedingt ist, um das Aktionsstück zu erzeugen.

Das Training ACT auf einem ALOHA-Datenpaket mit 50 Demonstrationen pro Aufgabe dauert 24 Stunden auf einer einzelnen RTX 3090 GPU. Der mit dem Originalpapier veröffentlichte Trainingscode ist einfach mit dokumentierten Hyperparametern für standardmäßige ALOHA-Tätigkeiten auszuführen. Für benutzerdefinierte Aufgaben ist der beeinflussteste Hyperparameter, den man tunnen kann, die Stückgröße (kl_gewicht im Konfigurationsprogramm) größere Stückstücke verbessern die zeitliche Konsistenz auf Kosten der Reaktivität gegenüber unerwarteten Störungen.

Mobile ALOHA: ALOHA vom Tisch zu nehmen

Mobile ALOHA, veröffentlicht von der gleichen Stanford-Gruppe im Jahr 2024, erweitert ALOHA-Konzept auf eine mobile Basis. Die zweibrächtige Arm-Setup wurde auf einer AgileX Tracer mobile Basis montiert, so dass das System zu verschiedenen Standorten innerhalb eines Raumes navigieren Nähe zu einer Küchenregale, bewegen sich zu einem Esstisch, navigieren einen Flur während die ALOHA-Arme für Manipulation zu behalten. Mobile ALOHA demonstrierte Aufgaben wie das Kochen von Garnelen auf einem Ofen, das Laden einer Geschirrspülmaschine und die Lieferung eines Pakets Aufgaben, die sowohl Bewegungs- als auch geschickte Manipulation erfordern.

Mobile ALOHA führte das Konzept der Ganzkörperteleoperation ein: Der Betreiber steuert sowohl die mobile Basis als auch die beiden Arme gleichzeitig, entweder durch separate Steuerungsschnittstellen oder durch eine einheitliche Schnittstelle, die die Körperbewegungen des Betreibers auf die Ganzkörperkonfiguration des Roboters abbildet. Die Datenerhebung für Mobile ALOHA ist wesentlich komplexer als die Tabelle ALOHA, da die Politik die Koordinierung von Navigation und Manipulationen lernen muss, wobei Demonstrationen erforderlich sind, die sowohl die räumliche Variation in der Umwelt als auch die Objektvariation abdecken.

Mobile ALOHA hat auch Ko-Training eingeführt: die Ko-Training der Mobile ALOHA-Politik über mobile Manipulationsdemonstrationen und statische ALOHA-Manipulationsdemonstrationen. RCSV bietet Mobile ALOHA-kompatible Datensätze an und kann in unserer Anlage in San Francisco mobile Manipulation Demonstrationen sammeln. [Kontaktieren Sie uns] T12) um Ihre Mobile ALOHA-Datenanforderungen zu besprechen.

Unterschiede zwischen ALOHA, ALOHA 2 und kommerziellen Derivaten

ALOHA 2, veröffentlicht Ende 2024, wurde im Vergleich zum Original in mehreren Dimensionen verbessert: hochwertige Arme mit besserer Wiederholbarkeit, ein verbessertes Kamera-Montage-System und ein überarbeitetes Handgelenkdesign, das die Komplexität des Kabelroutings reduziert. Das elektrische System wurde auch aktualisiert, um eine dedizierte Stromverteilungskarte anstelle von mit Dasi-Kette verbundenen Stromkabeln zu verwenden, wodurch die Zuverlässigkeit während langer Datenerhebungssitzungen verbessert wurde. ALOHA 2 behält die volle Software-Kompatibilität mit den ursprünglichen Datensätzen auf der einen Seite erhoben, die auf der anderen Seite ausgewertete Train-Politiken unterliegen, wobei die üblichen Vorsichtsmaßnahmen zur Hardwarevariation gelten.

Mehrere kommerzielle Anbieter verkaufen nun ALOHA-kompatible Plattformen vormontierte, getestete Systeme, die den ALOHA-Mechanik- und Software-Spezifikationen entsprechen, ohne dass der Bauherren Komponenten selbst besorgen und die Arme selbst montieren muss. Der Hardware-Katalog von RCSV enthält ALOHA-kompatible Konfigurationen; siehe Store für aktuelle Optionen und Preise.

Mit ALOHA durch RCSV zu beginnen

RCSV unterstützt ALOHA-basierte Forschung in jeder Phase. Für erst anfängende Teams bieten wir ALOHA-Plattformleasing durch unser [Roboterleasingprogramm]T14 Zugang zu einem kompletten zweimanüsigen Setup für eine feste monatliche Gebühr ohne Kapitalverpflichtung des Kaufs von Hardware. Leased-Systeme kommen vorkalibriert an und bereit, Demonstrationen am ersten Tag zu sammeln.

Für die Datenerhebung bietet unser Managed Service ausgebildete ALOHA-Betreiber, die Demonstrationen in unserer Anlage in San Francisco sammeln können, mit Datensätzen, die im RLDS/LeRobot-Format geliefert werden, die mit ACT, Diffusion Policy und OpenVLA-Schulungsleitungen kompatibel sind. Unsere Betreiber sind mit zweimanschließenden Koordinierungsarbeiten erfahren und folgen strukturierten Qualitätsprotokollen, die saubere Datensätze erzeugen als die ersten Forschenden normalerweise erreichen. Pilotprogramme beginnen bei 2.500 USD für 200 Demonstrationen. Wir können auch Ihre Website für Standortdaten-Sammelkampagnen besuchen, wenn Ihre Aufgabe dies erfordert.

Für die Politikbildung und -bewertung bietet die [RCSV-Plattform]T16) vorkonfigurierte ACT-Schulungen, Experimentverfolgung und Bewertungstools für ALOHA-Politiken. Ob Sie ein zweimanschlagliches Forschungsprogramm zur Manipulation von Grund auf erstellen oder versuchen, die Leistung eines bestehenden Systems zu steigern, kann Ihnen das Team von RCSV helfen, den richtigen Ansatz zu planen.

Verwandte Lesungen