ALOHA vs UMI: Welches Datenerfassungssystem ist für Sie geeignet?
Ein eingehender Vergleich der Datenerfassungssysteme ALOHA und UMI für das Roboternimitieren. Es geht um Kosten, Einrichtung, Datenqualität, Portabilität, Aufgabenarten und wann jedes System verwendet werden soll.
Die Sammlung hochwertiger Demonstrationsdaten ist der Engpäck für das Imitationslernen. Zwei Systeme sind als dominierende Ansätze entstanden: ALOHA (zweiseitige Führungskräfte-Folger-Teleoperation) und UMI (Universal Manipulation Interface, ein handhafter Datenerhebungsgerät). Sie lösen das gleiche Problem - die Erfassung von Demonstrationen menschlicher Manipulationen - durch grundlegend unterschiedliche Mechanismen, und die richtige Wahl hängt von Ihrer Aufgabe, der Größe des Teams, dem Ziel des Einsatzes und dem Budget ab. Dieser Leitfaden bietet einen detaillierten technischen Vergleich, um Ihnen zu helfen, zu entscheiden.
Wie ALOHA funktioniert

[ALOHA] (
Schlüsselmechanismus: Die Führer- und Anhängerarme sind kinematisch identisch (beide sind ViperX 300 6-DOF-Arme mit Dynamixel-Servos). Diese 1:1-Mapping bedeutet, dass der Betreiber die Interaktionen des Nachfolgerarms direkt mit Objekten durch das Servo-Feedback des Führerarms fühlt - nicht ein echtes Kraftfeedback, sondern genug positionales Kopplung, damit erfahrene Betreiber ein intuitives Gefühl für Kontakt entwickeln.
Datenformat: ALOHA erfasst gemeinsame Positionen (14 Werte: 6 Gelenke + 1 Greifer pro Arm), Gelenkgeschwindigkeiten, Kamerabilder (typischerweise 2-4 Kameras bei 480p/30fps) und Zeitstempel. Die Daten sind robot-native: Gelenkbahnen können direkt auf den Anhängerarme wiedergegeben werden oder verwendet werden, um Richtlinien ohne Rückzielung zu trainieren.
Bimanuelle Vorteile: Das definierende Merkmal von ALOHA ist die bilaterale Teleoperation - beide Arme werden gleichzeitig gesteuert. Dies ermöglicht die Datenerfassung für bimanuelle Aufgaben (Ein Glas zu öffnen, während man ihn hält, Stoff zu falten, aus einer Flasche in eine Tasse zu gießen), die mit einarmigen Systemen nicht nachzuweisen sind. Die ACT-Politikarchitektur wurde speziell für den zweimanualen Aktionsraum von ALOHA konzipiert.
Wie die UMI funktioniert

Die [UMI (Universal Manipulation Interface)
** Schlüsselmechanismus:** UMI entkoppelt die Datenerhebung von Roboterhardware. Der Betreiber arbeitet mit menschlicher Geschwindigkeit und Geschicklichkeit, ohne durch Roboterkinematik, Arbeitsraumgrenzen oder Servo-Bandbreite zu beschränken. Die aufgezeichnete Flugbahn (End-Effektor-Pose im Laufe der Zeit) wird später mit Inverser-Kinematik auf den Einsatzroboter zurückgegriffen. Dieser Schritt umsetzt Cartesianische Posenbahnen in gewöhnliche Winkelbahnen für den verwendeten Roboterarm.
Datenformat: UMI erfasst die End-Effektor 6-DOF-Position (Position + Orientierung), Grifföffnung, Handgelenkkamerabilder und Zeitstempel. Vor dem Training müssen die Bahnen auf den Zielroboter zurückgeleitet werden - ein rechnerisch leichtes Schritt, aber ein Schritt, der aufgrund von IK-Anschließung und kinematischen Unterschieden 2-5 mm Positionfehler des Endefektors einführt.
** Portabilitätsvorteil:** UMI kann überall verwendet werden - in einer Küche, einem Fabrikboden, einem Büro, im Freien. Der Betreiber benötigt keinen Roboter, einen Arbeitsplatz oder eine Infrastruktur außerhalb des UMI-Geräts und eines Laptops. Dies ermöglicht die Datenerhebung in der tatsächlichen Einsatzumgebung, mit echter Beleuchtung, Unordnung und Objektausweitung, die mehr vielfältige Trainingsdaten als nur die Lab-Erhebung erzeugt.
Dex-UMI: Dexterose Erweiterung

[Dex-UMI]
**Wenn Ihr Einsatzroboter eine geschickte Hand (LEAP Hand, Allegro Hand oder ähnlicher mehrfinger-End-Effektor) hat und Ihre Aufgaben Finger-Level-Kontrolle erfordern, ist Dex-UMI die einzige tragbare Datenerfassungoption. Standard UMI erfasst nur den Griff offen/schließend, und ALOHA-Führer-Arme haben nur einzelne DOF-Greifer. Dex-UMI füllt die Lücke zwischen einfachen Griffdemonstrationen und vollständigen, geschickten Manipulationsdaten.
Schnelle Entscheidung
Benötigen Sie eine zweibrochige? → ALOHA. Benötigen Sie eine Portablenheit? → UMI. Benötigen Sie eine geschickte? → Dex-UMI.
Vergleich zwischen den einzelnen
| Criterion | ALOHA | UMI | Dex-UMI |
|---|---|---|---|
| Cost | $3,000-$4,000 (full system) | $800 per unit | $1,200 per unit |
| Setup time | 2-4 hours (assembly + calibration) | 15-30 minutes | 30-45 minutes |
| Operator training | 2-4 hours (bimanual coordination) | 10-15 minutes | 30-60 minutes |
| Demos per hour | 20-60 (single system) | 60-100 per operator | 40-70 per operator |
| Parallelizable | No (1 operator per system) | Yes (N operators = N units) | Yes (N operators = N units) |
| Data quality | High (robot-native joints) | Medium (retargeting error) | Medium (finger retargeting) |
| Retargeting needed | No | Yes (IK solve) | Yes (finger mapping + IK) |
| Bimanual support | Native (2 arms) | Limited (2 UMIs, no sync) | No |
| Portability | Low (robot + table + power) | High (handheld + laptop) | High (glove + laptop) |
| Dexterous tasks | No (1-DOF gripper) | No (1-DOF gripper) | Yes (20+ DOF fingers) |
| Environment diversity | Low (fixed lab setup) | High (any location) | High (any location) |
| Policy frameworks | ACT, Diffusion Policy, LeRobot | Diffusion Policy, ACT (retargeted), VLA | Diffusion Policy, custom |
Datenqualität: Der entscheidende Unterschied
ALOHA erzeugt robot-native Gelenkbahnen. Wenn der Betreiber den Führerarm auf Position X bewegt, erfasst der Encoder des Nachfolgers die genauen Gelenkwinkel, die erforderlich sind, um Position X zu erreichen. Diese Daten können auf dem Nachfolgerschlag wiedergegeben oder direkt für politische Ausbildung ohne Transformation verwendet werden. Die einzige Geräuschquelle ist die Servoquantifizierung und die Rückwirkung, die klein ist (0,1-0,3 Grad pro Gelenk für Dynamixel XM-Serie).
Die UMI erzeugt Cartesian-End-Effektor-Trajektorien, die auf den Einsatzroboter zurückgeführt werden müssen. Der Schritt zur Neugestaltung führt zu einem Fehler aus drei Quellen: (1) IK-Lösungsmessung (der Lösungsmessung kann nicht die gleiche Konfiguration finden, die der Roboter natürlich verwenden würde), (2) kinematische Ungleichheit zwischen dem menschlichen Betreiberarm und dem Roboterarm (verschiedene Verbindungslängen, Gelenkgrenzen, Arbeitsraumform) und (3) Nachverfolgungsgeräusche aus der externen Posenanschätzung (ArUco-Marker haben je nach Entfernung und Beleuchtung 1-3 mm Positionsgeräusche).
In der Praxis: Bei Aufgaben mit einer Positionierungsverträglichkeit von 5 mm (meist Pick-and-Place, Gießen, Rühren) ist der Fehler bei der Retargeting von UMI vernachlässigbar und beide Systeme ergeben gleichwertige Politikleistung. Wenn die Präzision kritisch ist, verwenden Sie ALOHA oder ergänzen Sie die UMI-Daten mit einem kleineren Satz von On-Robot-Demonstrationen zur Fein-Tuning.
Skalierungssammlung: Wo die UMI gewinnt
Der grundlegende Skalierungseffekt von UMI ist die Parallelität. Ein ALOHA-System kann Daten von einem Betreiber gleichzeitig sammeln. Zehn UMI-Geräte können Daten von zehn Betreibern gleichzeitig in zehn verschiedenen Umgebungen sammeln und so die Datenvielfalt pro Zeitseinheit zehnmal erhöhen.
Vergleich der Kosten pro Demonstration:
- ALOHA: $4.000 System, 40 Demo-Demos/Stunde, $100/Stunde Betriebskosten = $2.50 pro demonstrierte Abschreibung (ohne Hardware Abschreibung).
- UMI (Single): 800 $ Gerät, 80 Demo/Stunde, 30 $/Stunde Betriebskosten (nicht-Experte) = 0,38 $ pro Demonstration.
- UMI (10 Geräte, 10 Betreiber): $8.000 Gesamthardware, 800 Demo-Demo/Stunde, $300/Stunde Gesamtbetreiberkosten = $0.39 pro Demonstration, aber 20x der Durchsatz.
Für Projekte, die Tausende von Demonstrationen erfordern (VLA-Schulung, Multitask-Daten-Sets, Kreuzumgebungsgeneralisierung), sind die Kosten- und Durchsatzvorteile von UMI entscheidend.
Rahmen für die Aufgabenartentscheidung
Verwenden Sie diesen Entscheidungsträger, um für Ihre spezifische Aufgabe zwischen ALOHA und UMI zu wählen:
- Behält sich Ihre Aufgabe gleichzeitig zwei Arme aus? Wenn ja: ALOHA. UMI kann keine synchronisierten zweibrochigen Daten erfassen.
- Behält sich Ihre Aufgabe für eine geschickte Fingermanipulation? Wenn ja: Dex-UMI. Weder ALOHA noch Standard-UMI erfassen mehrfingerige Daten. Beispiele: Werkzeugnutzung, in-hand-Reorientierung, Stiftmanipulation.
- Behörst du Daten aus verschiedenen Realitätsumgebungen? Wenn ja: UMI. Die Datenerhebung in 20 verschiedenen Küchen erzeugt robuster Richtlinien als die Sammlung von 20x mehr Daten in einem Labor. Beispiele: Heimroboter Aufgaben, Objektentsammlung in unterschiedlichem Unordnung.
- Behörig mehr als 1.000 Demonstrationen? Wenn ja: UMI. Das parallel skalierte System macht große Datensätze wirtschaftlich machbar.
- Behält sich die Aufgabe unter 2 mm aus? Wenn ja: ALOHA (oder On-Robot-Teleoperation). Der Retargeting-Fehler in UMI-Daten verschlechtert die Präzisionsarbeiten.
- Wird man auf ALOHA-Hardware einsetzen? Wenn ja: ALOHA. Null-Retargeting-Fehler bedeutet die bestmögliche Politikleistung auf dieser spezifischen Hardware.
- ** Für alle anderen:** Beginnen Sie mit UMI für seine Geschwindigkeit und Flexibilität, dann ergänzen Sie sie mit Demonstrationen im Roboter-Bereich, wenn die Leistungsfähigkeit der Politik Plateaus ist.
Kombination von ALOHA und UMI
Die effektivsten Datenerfassungssysteme nutzen beide Systeme.
- Phase 1 - UMI für Breite (Wochen 1-2): Bereitstellen Sie UMI-Geräte, um 500-2.000 Demonstrationen in verschiedenen Umgebungen, Objekten und Operatoren zu sammeln. Dies baut den Basisdatensatz mit hoher Variation auf. Nutzen Sie nicht-experte Operatoren (minimale Ausbildung) zur Erfassung der natürlichen Aufgabenführung.
- Phase 2 -- ALOHA für Tiefe (Wochen 3 bis 4): ALOHA verwendet, um 100 bis 300 hochwertige Demonstrationen der in Phase 1 identifizierten härtesten Teilarbeiten zu sammeln. Fokussieren Sie sich auf präzise Manipulationsschritte, zweimanuale Koordinierung und Randfälle, in denen die UMI-Daten unzureichend waren.
- Phase 3 -- Ko-Training: Schulen Sie die Politik des kombinierten Datensatzes und gewichten Sie die ALOHA-Demonstrationen höher für präzise kritische Aufgabensegmente.
Dieser kombinierte Ansatz führt in der Regel zu 15-30% besseren politischen Leistungen als jedes einzelne System, da er die Umweltvielfalt von UMI mit der robot-native Präzision von ALOHA kombiniert.
Hardware-Kompatibilität
Sowohl ALOHA als auch UMI-Daten können Richtlinien für den Einsatz auf einer Vielzahl von Roboterarmen ausbilden.
| Deployment Robot | ALOHA Data | UMI Data | Notes |
|---|---|---|---|
| Mobile ALOHA | Native (zero retargeting) | Retarget via IK | Best results with ALOHA data |
| OpenArm | Retarget (different kinematics) | Retarget via IK | Both require retargeting; UMI more natural |
| Franka FR3 | Retarget (different kinematics) | Retarget via IK | 7-DOF IK has more solutions; quality depends on solver |
| UR5e | Retarget (different kinematics) | Retarget via IK | UR analytical IK gives deterministic retargeting |
| AgileX Piper | Retarget (different kinematics) | Retarget via IK | Shorter reach may clip some UMI trajectories |
Kamera-Einstellungen Vergleich
Die Kamerakonfiguration unterscheidet sich zwischen den beiden Systemen erheblich, was sich auf die für die Politikbildung verfügbaren visuellen Beobachtungen auswirkt.
ALOHA-Kameras: Normalerweise 3-4 Kameras: eine Handgelenkkamera pro Arm (2 insgesamt) und 1-2 Oberhäufigkeit/Dritte-Person-Kameras. Die Handgelenkkameras bewegen sich mit dem Arm, so dass eine konsistente Griff-Augen-Ansicht. Die Oberhäufigkeit-Kameras sind fest. Alle Kameras sind relativ zum Roboter-Basisrahmen kalibriert, so dass konsistente räumliche Beziehungen zwischen visuellen Beobachtungen und gemeinsamen Positionen bestehen.
UMI-Kameras: Eine Brennhandkamera pro UMI-Gerät sowie optional auswärtige Kameras. Die Handkamera ist fest auf den Griff montiert und bietet die gleiche Griff-Augenansicht wie die ALOHA-Handkameras. Der Hauptunterschied: Die externen Kameras von UMI sehen die Hand und den Arm des Betreibers, nicht einen Roboter, daher müssen die Richtlinien, die auf die Ansicht der dritten Person von UMI ausgebildet sind, sich von der menschlichen Hand-Aussicht bis zum Aussehen des Roboter-Arms zur Bereitstellung der Einsatzzeit verallgemeinern.
Praktische Empfehlung: Für nur Handgelenkkamera-Politiken (ACT mit Handgelenksicht, Auge-in-Hand-Difusion-Politik) erstellen ALOHA und UMI gleichwertige visuelle Daten. Für Politiken, die Dritte-Personen-Ansichten verwenden, sind ALOHA-Daten bevorzugt, da das visuelle Aussehen der Bereitstellung entspricht. Wenn Sie UMI mit Kameraen von Dritten verwenden, trainieren Sie nur auf Handgelenkkameraansicht oder verwenden Sie Domänenrandomisierung, um die Aussehenshintergrundlücke zu überbrücken.
Der RC G1 Tactile Glove als Datenaufstockungsschicht
Der [RC G1 Tactile Glove] (
Häufig gestellte Fragen
Was ist der Unterschied zwischen ALOHA und UMI?
ALOHA ist ein bilateraler Leader-Follower-Teleoperationssystem, bei dem der Betreiber abgestimmte Roboterarme steuert, um Aufgaben auszuführen, während die Followerarme gemeinsame Flugbahnen aufzeichnen. ALOHA erfasst die gemeinsamen Daten von Roboter-Nativen; UMI erfasst die Aufgabenraumbahnen, die dem Einsatzroboter neu gezielt werden müssen.
Ist ALOHA oder UMI besser für die Datenerhebung?
Es hängt von Ihrem Anwendungsfall ab. ALOHA ist besser, wenn Sie zweimannige Daten, robot-native gemeinsame Strecken oder auf ALOHA-Hardware einsetzen. UMI ist besser, wenn Sie Portabilität benötigen (daten überall ohne Roboter sammeln), Datenversammlung über viele nicht-experte Betreiber parallelisieren möchten oder auf mehreren Roboterplattformen einsetzen möchten. Die Daten der UMI erfordern einen Schritt zur Neugestaltung; ALOHA-Daten sind sofort bereit zu trainieren.
Wie viel kostet ALOHA vs. UMI?
Mobile ALOHA kostet etwa 4.000 US-Dollar für das komplette System (2 Führerarme + 2 Anhängerarme + mobile Basis). Stationäre ALOHA (4 ViperX-Arme ohne Basis) kostet etwa 3.000 US-Dollar.
Kann ich die UMI-Daten für die Ausbildungspolitik für ALOHA verwenden?
Ja, aber es erfordert Trajektor-Retargeting. UMI fängt End-Effektor-Posen in dem kartesischen Raum ein, die mit Hilfe von umgekehrter Kinematik in gemeinsame Winkel für die ALOHA-Arme umgewandelt werden müssen. Dieses Retargeting führt zu einem gewissen Fehler (typischerweise 2-5mm Positionfehler des End-Effektors), ist aber für die meisten Manipulationsarbeiten ausreichend. LeRobot und die [Fearless Data Platform]
Was ist Dex-UMI?
[Dex-UMI] (
Wie viele Demonstrationen kann ich pro Stunde mit ALOHA vs. UMI sammeln?
ALOHA: 20-40 zweibrundliche Demonstrationen pro Stunde oder 40-60 Einarmband Demonstrationen pro Stunde. Ein Team von 5 Betreibern mit UMI-Geräten kann 300 bis 500 Demonstrationen pro Stunde sammeln, was mit einem einzigen ALOHA-System nicht zu vergleichen ist.
Verwandte: Beste Roboter für das Imitationslernen 2026 · ALOHA Robot Guide · Mobile ALOHA Setup · ACT Policy Explained · RCSV Store







