Mobilfunkmanipulation im Jahr 2025: Stand der Technik und praktische Einsätze
Umfrage über mobile Manipulationsroboter <unk> Plattformen, Fähigkeiten, Algorithmen und Real-Welt-Deployments, die die Bewegung und die Armmanipulation kombinieren.
Teil von: [Roboter-Waren-Leitfaden]
[← Blog]
Das schwierigste offene Problem in der Robotik ist auch die Anziehung einiger der aktivsten Investitionen und Forschung im Jahr 2025.
Was ist Mobilfunkmanipulation?
Mobile Manipulation bezieht sich auf Roboter, die Bewegung (die Fähigkeit, sich durch eine Umgebung zu bewegen) mit Manipulation (die Fähigkeit, Objekte zu erfassen, zu bewegen und mit ihnen zu interagieren) kombinieren.
Die Kombination macht es auch schwierig. Ein festgestützter Arm arbeitet in einem bekannten, kalibrierten Arbeitsraum. Ein mobiler Manipulator muss aus einer unpräzisen bekannten Basisposition, auf einer potenziell beweglichen Plattform, in einer Umgebung greifen, die sich von jeder Trainingskonfiguration unterscheiden kann.
Architektur Taxonomie: Entkoppelt vs. End-to-End
Die grundlegende architektonische Wahl bei mobiler Manipulation ist, ob Navigation und Manipulation als separate Teilsysteme oder als einheitliche End-to-End-Politik behandelt werden.
Ausgekoppelt (navigate-then-manipulate): Der klassische Ansatz. Ein Navigationsplaner bewegt den Boden in eine vorbereitete Posen innerhalb des Arbeitsraums des Arms, dann übernimmt eine Manipulationspolitik. Das Navigationsmodul und das Manipulationsmodul sind separate Systeme mit separaten Modellen, separaten Trainingsdaten und einem Übergabe-Protokoll zwischen ihnen. Dies ist der dominierende Ansatz in industriellen Einsatzmöglichkeiten, da es modular ist, debuggable und jede Komponente unabhängig validiert werden kann. Die Begrenzung: Die Basisposition wird ohne Berücksichtigung der Manipulations Aufgabe berechnet, was zu suboptimale Ansatzkonfigurationen führen kann.
** End-to-end (unified policy):** Ein einziges neuronales Netzwerk nimmt Sensor-Eingänge (Kameras, Lidar, proprioception) und gibt sowohl Basisgeschwindigkeiten als auch Arm-Gelenkkommandoen aus. Mobile ALOHA (Zipeng Fu et al., Stanford, 2024) hat gezeigt, dass eine ACT-Politik die mobile Manipulation des ganzen Körpers aus 50 Teleoperationsdemonstrationen erlernen kann. End-to-end-Ansätze erzeugen reibungslosere, koordiniertere Bewegungen, sind aber schwieriger zu debuggen, erfordern mehr Demonstrationen und bieten weniger Sicherheitsgarantien.
** Hierarchische (Task-Level-Planung + gelernte Fähigkeiten):** Ein hochrangiger Planer (potenziell ein Fundamentmodell oder TAMP-System) zerlegt die Aufgabe in eine Sequenz von Fähigkeiten ("Navigieren in die Küche", "offener Kühlschrank", "Tappenmilch") und jede Fähigkeit wird durch eine spezialisierte Politik ausgeführt. SayCan (Google, 2022) und TidyBot (Wu et al., Princeton, 2023) verwenden diese Architektur. Sie verbindet die Flexibilität der erlernten Politiken mit der Interpretation der expliziten Planung.
Schlüsselplattformen für 2025
| Platform | Price | Type | Nutzlast | Arms | Key Strength |
|---|---|---|---|---|---|
| Hello Robot Stretch 3 | $28,000 | Wheeled + telescoping arm | 1.5 kg | 1 (4-DOF) | ROS2, elder care, affordable |
| Mobile ALOHA (Stanford) | $32K + base | Wheeled + bimanual | 3 kg each | 2 (6-DOF ViperX) | Bimanual, open-source, ACT-ready |
| Spot + Arm (Boston Dynamics) | $100,000+ | Legged + arm | 4 kg | 1 (6-DOF) | Rough terrain, enterprise support |
| Unitree G1 | $16,000 | Humanoid (bipedal) | 3 kg each | 2 (7-DOF) | Lowest cost humanoid, growing ecosystem |
| Unitree H1 | $90,000 | Humanoid (bipedal) | 5 kg each | 2 (7-DOF) | Strongest humanoid arms, whole-body control |
| Fetch Robotics (OTTO) | $150,000+ | Wheeled + arm | 6 kg | 1 (7-DOF) | Warehouse logistics, enterprise AMR |
| TIAGo Pro (PAL Robotics) | $80,000+ | Wheeled + arm | 3 kg | 1-2 (7-DOF) | ROS2 native, RoboCup standard |
Schlüsselpapiere und Systeme
Die Kommission hat die Kommission mit der Kommission übermittelt.
Mobile ALOHA hat gezeigt, dass end-to-end-Imitation-Lernen überraschend leistungsfähige mobile Manipulation des ganzen Körpers erzeugen kann. Das System verwendet zwei ViperX 300 Arme auf einer Radbasis, mit einem menschlichen Teleoperator, der hinter dem Roboter geht und die Bewegung beider Arme und der Basis gleichzeitig steuert. Die ACT-Politik (Action Chunking with Transformers) trainierte auf nur 50 Teleoperationsdemos, um Garnelen zu kochen, Schränke zu öffnen, Küchenzähler zu reinigen und Stühle zu drücken.
Die gemeinsame Manipulation übertragen und die Politik lernt, sie mit Basisbewegung allein aus den mobilen Demo-Systemen zu komponieren. Dies reduziert die reale Datenerhebung erheblich.
Die Kommission hat die Kommission mit der Erhebung der Richtlinie 2009/138/EG über die Anwendung von Richtlinie 2009/138/EG in Bezug auf die Verringerung der Verletzung von Verletzungen von Waren und Dienstleistungen in der Gemeinschaft (ABl.
TidyBot hat sich mit dem langen Horizont-Reinigungsproblem befasst: Angesichts eines chaotischen Raumes, holen Sie alle fehlgelegenen Objekte und legen Sie sie an ihre richtigen Orte. Es verwendet ein LLM (GPT-4) für hochrangige Argumente ("der Becher geht auf dem Regal, "das Hemd geht in den Schrank") und eine gelernte Manipulationspolitik für das eigentliche Picking und Platzieren. Navigation verwendet einen klassischen SLAM + Planner Stack. Der Schlüsselbeitrag zeigt, dass Sprachmodelle die vernünftige Argumentation zur Aufgabenplanung in offenen Haushaltsaufgaben liefern können, während die Ausführung auf niedrigem Niveau durch zuverlässige gelernte Fähigkeiten abgewickelt wird.
SayCan (Google, 2022)
Die Lernmeisterin hat eine Natursprachenanleitung ("Ich habe mein Getränk vergossen, kannst du mir helfen?") gegeben und schlägt einen Plan als eine Sequenz primitiver Fähigkeiten vor ("Spendel finden", "Spendel holen", "Spendeln zu spülen", "Navigieren, um zu spülen", "Wäub Oberfläche"). Das Produkt der Planwahrscheinlichkeit des LLM und der Fähigkeitserfolgwahrscheinlichkeit wählt die beste Aktion aus. SayCan lief auf einem mobilen Everyday Robot mit einem einzigen 7-DOF-Arm, was zeigt, dass LLM-basierte Aufgabenplanung die offenen Anweisungen nach der mobilen Manipulation bewältigen kann.
Die Herausforderungen der Koordinierung von Navigations-Manipulation
Arm-Basis Koordination: Wann sollte sich die Basis bewegen und wann sollte sich der Arm ausdehnen? Die Ganzkörpersteuerung für humanoide Plattformen (H1, G1) behandelt Basis und Arm als eine einheitliche kinematische Kette. Radplatformen verwenden typischerweise entkoppelte Planung
** Dynamische Stabilität während der Manipulation:** Durch das Einsetzen von Kraft durch den Arm entstehen Reaktionskräfte auf der Basis. Ein Beinroboter, der während einer beschränkten Aufgabe eine horizontale Kraft von 20 N durch seinen Arm einsetzt, muss die Fußkontakte gleichzeitig anpassen, um Stabilität zu erhalten. Diese körperliche Kraftkoordination ist ein aktives Forschungsproblem. Hier haben Radplattformen einen Vorteil: Reaktionskräfte werden durch die Erdtriebswirkung der Räder absorbiert, was viel einfacher zu modellieren und zu steuern ist als die Fußkontaktdynamik.
Grasp-Pose-Schätzung aus mobiler Basis: Die Wahrnehmung aus einer beweglichen Basis führt Lokalisierungsunsicherheit in die Grip-Schätzung ein. Ein 2 cm großer Basispositionsfehler verbreitet sich zu einem Grip-Punktefehler, der die Grip-Toleranz für Präzisions Aufgaben übersteigt.
** Das Handoverproblem:** In entkoppelten Architekturen bringt das Navigationssystem den Roboter in eine "Vor-Manipulation"-Pose und überträgt ihn dann an den Manipulationscontroller. Die Übergabe muss zweiseitig sein
Langhorizont-Standschätzung: Bei einer mehrminütigen mobilen Manipulationsarbeit (z.B. das Reinigen eines Raumes) wird die SLAM-basierte Lokalisierung des Robots durch Drift akkumuliert. Schließung von Schleifern, Umlagerung gegen bekannte Wahrzeichen und visuelle Odetriersupdates während der Manipulation sind alle notwendig, aber zusätzliche Rechenüberschüsse.
Planungsansätze Vergleiche
| Approach | Task Horizon | Generalisierung | Compute | Data Needed | Maturity |
|---|---|---|---|---|---|
| Whole-body control (WBC) | Single skill | Low (task-specific) | High (1kHz QP) | Dynamics model | Production-ready for locomotion |
| Decoupled nav + manip | Single skill | Moderate | Low | SLAM map + manip demos | Most deployed approach |
| End-to-end IL (ACT) | Multi-step skill | High (within task) | Moderate (GPU) | 50-500 teleop demos | Research demos (Mobile ALOHA) |
| TAMP (Aufgaben- und Bewegungsplanung) | Multi-room | High (combinatorial) | Very high | Domain specification | Academic demos, limited production |
| LLM + skill library (SayCan) | Open-ended | Very high (language) | High (LLM inference) | Skill demos + affordance model | Emerging (TidyBot, SayCan) |
| VLA end-to-end (pi0-style) | Multi-step | Very high | Very high (7B+ model) | Large-scale diverse demos | Early commercial (Physical Intelligence) |
Datenerhebung für mobile Manipulation
Die Erhebung von Teleoperationsdemonstrationen für mobile Manipulation ist schwieriger als die Festbasis-Manipulation, da der Betreiber die Bewegung der Basis und der Arm gleichzeitig steuern muss.
- Walk-behind-teleoperation (Mobile ALOHA-Stil): Der Betreiber geht hinter den Roboter und steuert die Armbewegungen über die Führerarme, während die Basis die Bewegung des Betreibers folgt. Am besten für Aufgaben, bei denen die Basisbahn wichtig ist (z. B. beim Umgehen um Möbel während der Beförderung eines Objekts).
- VR-Telebetrieb: Der Betreiber verwendet ein VR-Headset, um aus der Perspektive des Roboters zu sehen und steuert die Basis + Arme durch Handcontroller und Joystick. Er ermöglicht den Fernbetrieb, fügt aber eine Latenz (20-50ms Netzwerk + 10ms Rendering) hinzu, die die Demonstrationsqualität für Kontakt Aufgaben verschlechtert. Am besten für Navigationsschwere Aufgaben, bei denen die Manipulationspräzision moderat ist.
- Wegpunkt-basierte Sammlung: Trennen Sie die Basisbahn von der Manipulationsdemonstration. Zuerst fahren Sie den Roboter manuell zu einer Vor-Manipulation-Pose (oder verwenden Sie einen autonomen Navigationsstack). Sammeln Sie dann die Manipulationsdemonstration aus der festen Basisposition. Am besten für Aufgaben, bei denen Navigation und Manipulation sich nicht zeitlich überlappen.
Die Datenverarbeitungsinfrastruktur von RCSV unterstützt alle drei Ansätze. Unsere San Francisco-Anlage verfügt über mehr als 800 Quadratmeter konfigurierbarer Bodenfläche für die Mobilfunkmanipulation-Datenverarbeitung, mit einer Bewegungs-Fang-Grad-Lokalisierung für die Erdwahrheitsbasisverfolgung. Die Allston-Anlage unterstützt Korridor- und Mehrzimmer-Szenarien.
Wirkliche Beispiele für die Einsetzung
- Diligent Robotics Moxi: Mobilfunkmanipulator mit Rädern, der in Krankenhausstationen für die Lieferung von Lieferungen und den Transport von Bettwäsche eingesetzt wird.
- 6 River Systems (Shopify): AMR-basiertes Lager-Pick-System, das menschlichen Arbeitern hilft. Es bearbeitet strukturiertes Müllpick-System, nicht vollständige mobile Manipulation.
- Hello Robot Stretch klinische Studien: Die Universität von Washington und Georgia Tech haben Stretch für die Betreuung von älteren Menschen zu Hause (Objekte zu holen, Türen zu öffnen) durchgeführt.
- Google DeepMind RT-2 auf Everyday Robots: Das RT-2 VLA-Modell wurde auf einer Flotte mobiler Manipulatoren in Google-Bürogebäuden eingesetzt, die Küchenreinigung und Schreibtischreinigung durchführen. Das VLA-Rückgrat ermöglichte die Anweisung ("Pick up the apple near the monitor and put it in the compost bin") mit Null-Shot-Verallgemeinerung auf neue Objekte, obwohl die Manipulationspräzision auf Aufgaben mit 5mm+ Toleranz beschränkt war.
Die Datenlücke für mobile Manipulation
Die größte Engpässe für die mobile Manipulation Forschung ist die Datenknappheit. Festbasis-Manipulation Datensätze (Open X-Embodiment, DROID, BridgeData V2) enthalten Millionen Episoden, aber mobile Manipulation Datensätze sind 10-100 mal kleiner, weil die Sammlung schwieriger und langsamer ist. Diese Datenlücke bedeutet, dass die Politik für mobile Manipulation im Vergleich zu festgestützten Politiken, insbesondere für langfristige Aufgaben, untergeschult ist.
Die Schließung dieser Lücke erfordert eine speziell errichtete Datenverwertungsinfrastruktur
Verwandte Lesungen
- [ALOHA Roboternleitung]
- Die Kommission ist der Auffassung, dass die Kommission die Möglichkeit hat, die Kommission zu einer solchen Entscheidung zu treffen.
- [Open-Source Humanid Roboter 2025]
- [VLA-Modelle erklärt]
- Die Kommission hat die Kommission mit der Kommission übermittelt.
- [Warum Teleop Data Sim schlägt]
- [Datendienste]
- [Roboterleasing]
- [Glossar]
Lösungen für mobile Manipulation
RCSV bietet Hardwareberatung, Datenerhebung und Systemintegration für mobile Manipulationen.
[Erforschung von Lösungen]







