Zurück zu Blog

Verkörperte KI erklärt: Was es ist, warum es wichtig ist und wohin es geht

Eine klare Erklärung für verkörperte KI <unk> warum physische Interaktion mit der Welt die nächste Grenze für KI ist und was sie für Roboterteams heute bedeutet.

[← Blog]

Sprachenmodelle verwandeln Informationen. Einheitliche KI wird physische Arbeit verändern aber die Infrastruktur-Herausforderung ist grundlegend anders.

Was ist eine verkörperte KI?

Inkarnierte KI bezieht sich auf künstliche Intelligenzsysteme, die in der physischen Welt durch einen physischen Körper wahrnehmen und handeln nicht nur Text oder Bilder isoliert verarbeiten. Roboter, autonome Fahrzeuge, prothetische Glieder und Augmented-Reality-Systeme, die mit physischem Raum interagieren, fallen alle unter diese Definition.

Die "verkörperte" Unterscheidung ist wichtig, weil sie die grundlegenden Beschränkungen des Problems verändert. Ein verkörpertes KI-System arbeitet in kontinuierlichen physikalischen Zuständen, in denen Aktionen irreversibel sind (ein abgestürztes Objekt kann nicht "unropped" werden), partielle Beobachtbarkeit ist unvermeidlich (Kameras können nicht hinter Objekten sehen) und Latenzanforderungen in Echtzeit (eine 2-Sekunden-Ergebnisverzögerung verursacht einen Roboter in eine Wand zu fahren).

Um dies konkret auszudrücken: GPT-4 kann einen Anruf in 500 ms verarbeiten und der Benutzer merkt es kaum. Ein Roboterarm, der eine Pick-and-Place-Aufgabe bei 10 Hz-Steuerfrequenz durchführt, hat 100 ms pro Entscheidungszyklus. Wenn die Neuralnetz-Inferenz 80 ms dauert und die verbleibenden 20 ms durch Sensorlesen und Motorkommandoübertragung verbraucht werden, gibt es Nullmarge für Netzwerk-Latenz, Müll-Sammelpausen oder unerwartete Rechenspitzen. Diese Echtzeit-Zänge prägen jede architektonische Entscheidung in verkörperter KI, von der Modellgröße bis zur Bereitstellung von Hardware.

Die Hypothese der Verkörperung

Rodney Brooks argumentierte in den 1980er Jahren, dass Intelligenz nicht von der physischen Interaktion mit der Welt getrennt werden kann dass die reichsten kognitiven Fähigkeiten aus sensorimotorischen Erfahrungen entstehen, nicht aus abstrakter Symbolmanipulation. Dies war eine umstrittene Behauptung, als es gemacht wurde, aber die KI-Entwicklungen der letzten drei Jahre haben indirekte Beweise für eine Version davon bereitgestellt.

Große Sprachenmodelle, die ausschließlich auf Text ausgebildet sind, zeigen konsequente Defizite in der physischen Argumentation sie können nicht zuverlässig vorhersagen, ob ein Stapel von Blöcken fallen wird, die bei der Verschärfung einer Schraube beteiligten Kräfte beschreiben oder eine Sequenz physischer Aktionen mit korrekten räumlichen Beziehungen planen. GPT-4 versagt den Stabilitätstest "Stacking Blocks" mit einer Geschwindigkeit, die für einen 18-monatigen Menschen überraschend wäre.

Die jüngste Arbeit von Google DeepMind (RT-2, 2023) liefert den direkten Beweis: Wenn ein Vision-Language-Modell sowohl auf Internet-Skala-Text-/Bilddaten als auch auf Roboterinteraktionsdaten zusammen trainiert wird, entwickelt es physische Argumentationsfähigkeiten, die keine Datenquelle allein produziert. Die Roboterspezifischen Daten selbst in vergleichsweise kleinen Skala begründen das Verständnis des Modells von Physik, Objektspermanenz und räumlichen Beziehungen auf eine Weise, die passive Beobachtung nicht kann.

Der Eingeborene KI-Hardware-Stack

Jedes verkörperte KI-System basiert auf einem dreischichtigen Hardware-Stack: Sensoren, die die Welt wahrnehmen, berechnen, die Wahrnehmung verarbeiten und Aktionen erzeugen, und Aktoren, die diese Aktionen physisch ausführen.

Sensoren: Wie Roboter sehen und fühlen

** Vision (RGB-Kameras):** Die primäre Sensorik für die meisten Manipulationsarbeiten. Standardkonfigurationen verwenden 2-3 Kameras: eine Handgelenk-montierte Kamera für die Manipulationsansicht (Intel RealSense D405, $300), eine Oberkamera für den Arbeitsplatzkontext (Basler acA1920, $800) und optional eine Seitenansichtkamera für Tiefeverwechselung. Auflösung von 640x480 bei 30 fps ist der aktuelle Schönpunkt für die Politikbildung höhere Auflösung erhöht das Datenvolumen ohne verhältnismäßigen Nutzen für die meisten Aufgaben.

Tiefensensensing: Stereo-Tiefensenskameras (RealSense D435i) oder strukturierte Lichtsensoren bieten 3D-Punktwolken, die geometrische Argumente über die Form und Pose von Objekten ermöglichen. Der RealSense D435i bietet eine Tiefe in einer Auflösung von 1280x720 mit einer Tiefengenauigkeit von 0,2% in einer Reichweite von 2 m, die für die Manipulation von Tabellen ausreicht.

Propriozeption (Gelenk-Encoder): Jeder Roboter-Gelenk hat einen Encoder, der Position (und oft Geschwindigkeit und Drehmoment) berichtet. Dieser propriozeptiven Strom ist die Grundlage des Roboter-Selbstmodells Wissen, wo sich sein eigener Körper im Weltraum befindet.

**Sensoren mit 6-Achsen-Spannungsmoment (ATI Mini45, $3.500) werden beim Handgelenk montiert, um die Kontaktkräfte während der Manipulation zu messen. Ohne das F/T-Sensor hat der Roboter keine Möglichkeit, zwischen "das Objekt sanft berühren" und "das Objekt zerquetschen" zu unterscheiden, außer durch das Blickbild, das für die Kraftschätzung unzuverlässig ist.

Taktile Wahrnehmung: Die aufstrebende Grenze. Taktile Sensoren wie GelSight (200-500 USD pro Fingerspitze) und Paxini-Tactile Handschuhe bieten Kontaktgeometrie und Druckverteilung am Griffpunkt. Forschung von MIT (Agrawal Lab) und Meta zeigt, dass die Hinzufügung von Taktilsensing zu Manipulationspolitik die Erfolgsraten für deformierbare und zerbrechliche Objekte um 15-25% verbessert. RCSV lagern Paxini-Takt-Sensing-Hardware über unseren [Store]

Berechnung: Verarbeitung am Rand

Die integrierte KI-Rechnerin liegt an der Kreuzung zweier konkurrierender Anforderungen: Modelle müssen groß genug sein, um sich über Aufgaben hinweg zu verallgemeinern, aber die Ableitung muss schnell genug für die Echtzeitkontrolle sein.

Compute Platform Inference Latenz (10M param policy) Power Price Use Case
NVIDIA Jetson AGX Orin 5-15ms 15-60W $1,999 On-robot deployment
RTX 4090 workstation 2-8ms 450W $8,000-12,000 Lab research, training + inference
Intel NUC (CPU only) 50-200ms 28W $800-1,200 Simple policies, classical control
A100 80GB (cloud/cluster) 1-5ms 300W $15,000+ Training, large model inference

Der Trend ist klar: Edge-Integration auf Jetson-Klasse-Hardware für die Produktion, mit GPU-Arbeitsstationen für Entwicklung und Ausbildung. Cloud-Abschluss fügt 20-100ms Netzwerk-Latenz hinzu, was für Echtzeit-Manipulation-Steuerung nicht akzeptabel ist, aber für die Aufgabenplanung auf hoher Ebene akzeptabel ist. Hybrid-Architekturen Cloud für die Planung, Edge für die Steuerung werden zum Standard.

Aktivierende: Dinge bewegen

Die Wahl der Aktorentechnologie bestimmt die Geschwindigkeit, Präzision, Kraftleistung und Konformität des Roboters (Fähigkeit, unerwartete Kontaktkräfte sicher zu absorbieren).

Servo-Motoren (Dynamixel, Feetech): Die Standardlösung für Forschungsarme im Bereich von 2.000 bis 10.000 USD. Die Dynamixel XM430-Servos bieten 4,1 Nm Drehmoment, eine 12-Bit-Positionslösung und integrierte PID-Controller, die über einen Serienbus zugänglich sind. Die gesamte OpenArm-Plattform läuft auf Dynamixel-Servos.

Brushless DC-Motoren + harmonische Antriebe: In kommerziellen Cobots (UR, Franka, Kinova) verwendet. Sie bieten eine höhere Drehmomentdichte, geringere Rückwirkung und eine bessere Drehmomentempfindung als Hobby-Servos. Die Drehmomentempfindungssensoren des Franka Research 3 an jedem Gelenk (0,05 Nm Auflösung) ermöglichen die Impedanzkontrolle, die es bei kontaktreichen Aufgaben hervorragend macht.

Quasi-direct-drive (QDD): Eine neue Aktorenarchitektur, die im Unitree G1 humanoid und mehreren neuen Forschungsplattformen verwendet wird. QDD verwendet geringe Getriebe (6:1 bis 9:1 vs. 100:1 für harmonische Antriebe), die von Natur aus zurückgetrieben werden können, was bedeutet, dass die Gelenke des Roboters durch externe Kräfte geschoben werden können, ohne den Getriebe zu beschädigen. Diese Eigenschaft ist für eine sichere Mensch-Roboter-Interaktion und für das Lernen konformer Manipulationsverhaltensweisen unerlässlich.

Schulungsdatenanforderungen: Verkörperte KI vs. LLM

Die Datenökonomie der verkörperten KI unterscheidet sich grundsätzlich von den Sprachmodellen, und das Verständnis dieses Unterschieds ist für jeden, der ein verkörpertes KI-Projekt plant, wesentlich.

Dimension LLM Training Data Verkörperte KI Training Data
Source Web crawl (passive) Physical teleoperation (active)
Cost per unit ~$0.001/token $3-80/demonstration
Collection speed Millions of tokens/second 30-60 demos/hour/operator
Largest dataset (2026) 15+ trillion tokens ~1M episodes (Open X-Embodiment)
Data reusability Universal (text is text) Embodiment-specific (data from one robot has limited transfer to another)
Quality bottleneck Filtering web noise Operator skill + consistency

Diese 3.000-80.000x Kostendifferenz pro Daten-Einheit bedeutet, dass das Daten-Flugrad, das die Sprachmodellrevolution angetrieben hat, bewusst für die physische Welt konstruiert werden muss. Dies ist das strukturelle Problem, das RCSV zu lösen gibt: den Aufbau der [Daten-Sammlungsinfrastruktur] T3), des Operatornetzes und der Qualitätspipeline, die die physikalischen KI-Trainingsdaten in der physischen Welt wirtschaftlich umfangreich macht.

Schlüsselforschungsgruppen, die das Feld betreiben

Die Forschung in der umfassenden KI konzentriert sich auf eine Handvoll Institutionen, die starke ML-Fähigkeiten mit aktiven Robotik-Hardware-Labors kombinieren.

Stanford (IRIS Lab, SVL): Das IRIS Lab von Chelsea Finn produzierte ALOHA (Bimanual Teleoperation, 2023), Mobile ALOHA (2024), und grundlegende Arbeiten zum Meta-Lernen für die Anpassung an Roboter. Fei-Fei Li's SVL entwickelte die BEHAVIOR-Benchmark-Suite für Haushaltsarbeiten. Dorsa Sadighs Gruppe arbeitet an der Mensch-Roboter-Interaktion und Lernen aus Präferenzfeedback. Die kollektive Leistung von Stanford hat wahrscheinlich mehr vom aktuellen IL-Arbeitsfluss definiert als jede andere einzelne Institution.

** UC Berkeley (BAIR):** Pieter Abbeels Gruppe (mit Cofounder.ai/Physical Intelligence) produzierte frühe Lernarbeiten. Das Octo-Grundlagemodell entstand aus der Zusammenarbeit zwischen Berkeley-Stanford-CMU.

CMU (Robotics Institute): Deepak Pathaks Gruppe arbeitet an neugiergestützter Erkundung und Kreuzkörperübertragung. David Helds Gruppe konzentriert sich auf deformierbare Objektmanipulation. CMU ist stark darin, aus begrenzten Daten zu lernen und zwischen Simulation und Realität zu übertragen.

MIT (CSAIL): Das Improbable AI Lab von Pulkit Agrawal arbeitet an taktilen Manipulationen und kontaktreichen Aufgaben. Russ Tedrake entwickelt Drake (das Simulations- und Optimierungsrahmen) und arbeitet an der Ganzkörperplanung für Manipulation. Daniela Rus' verteilte Robotikgruppe erforscht die Multi-Agent-Koordination. Die besondere Stärke des MIT liegt in dem physikalisch informierten Ansatz zur Manipulation, wobei physisches Verständnis zum Daten-basierten Lernen ergänzt wird.

Google DeepMind Robotics: Die RT-1, RT-2 und RT-X-Reihe von Papieren definierten das Vision-Language-Action-Modell (VLA). Der Vorteil von DeepMind ist die Skala: Sie bedienen Hunderte von Roboterarmen auf mehreren Standorten und erzeugen Datenmengen, die akademische Labors nicht mitmachen können.

Physical Intelligence (Pi): gegründet von Stanford/Berkeley Robotics Faculty (Chelsea Finn, Sergey Levine, Karol Hausman, Brian Ichter). Pi entwickelte pi-0, eine generalistische Roboterpolitik, die auf unterschiedliche Manipulationsdaten ausgebildet wurde.

Aktuelle Fähigkeiten: Was tatsächlich 2026 funktioniert

Um echte Fähigkeiten von demos zu trennen, müssen wir reproduzierbare Ergebnisse in mehreren Labors betrachten, nicht auf einer einzigen Stelle.

Manipulation (Arme + Greifer)

  • ** Strukturer Pick-and-Place:** 90-98% Erfolgsraten bei bekannten Objekten in bekannten Posen. Dies wird kommerziell bei Amazon, Berkshire Grey und anderen eingesetzt.
  • Open-Vokabulaire-Gefangen: 60-75% Erfolg bei neuen Objekten mit sprachspezifischen Zielen ("Pick up the red cup"). OpenVLA, Octo und RT-2 zeigen alle diese Fähigkeit.
  • ** Kontaktreiche Zusammenstellung:** 70-90% Erfolg mit Aufgaben-spezifischen Strategien, die auf 200-1.000 Demonstrationen pro Aufgabe ausgebildet wurden. ACT und Diffusion Policy sind die dominierenden Ansätze.
  • ** Verformbare Objekte:** 40-70% Erfolg bei Aufgaben wie Falten von Handtüchern, Handgepäck und Kabel-Routing. Dies bleibt die härteste Grenze bei der Manipulation, da verformbare Objekte unendlich dimensionale Zustandsräume haben, die schwer wahrzunehmen und vorherzusagen sind.

Beförderung

  • ** Vierfach-Lokomotion:** Für flaches und mäßig raues Gelände gelöst. Unitree Go2, Boston Dynamics Spot und ANYmal alle übertravers Treppen, Kies und Pisten zuverlässig. RL-trainierte Lokomotionsrichtlinien (trainiert in Isaac Lab/Gym) werden mit > 95% Zuverlässigkeit auf echte Hardware übertragen.
  • Bipedal-Gehen: Zuverlässig in kontrollierter Umgebung. Unitree G1 und Abbildung 02 gehen mit 1,5-2,0 m/s auf flachem Boden. Groben Gelände und dynamische Hindernisvermeidung bleiben aktiv.
  • Humanitäre Körperkontrolle: An ausgewählten Stellen für bestimmte Aufgaben (Aufstehen aus einem Stuhl, Beförderung von Gegenständen beim Gehen) gezeigt.

Autonomer Fahrzeuge

  • Waymo: betreibt mehr als 700 autonome Fahrzeuge in Phoenix, San Francisco und LA mit einer Sicherheitsbilanz, die auf gemessenen Messwerte menschliche Fahrer übertrifft.
  • Tesla FSD: Aufsicht über Autonomie auf Autobahnen und strukturierten Straßen.

Geschäftsanwendungen, die sich jetzt entwickeln

Die Verkörperte KI ist nicht nur ein Forschungsfeld sie generiert heute kommerziellen Wert in bestimmten vertikalen Bereichen. Das Verständnis, welche Anwendungen jetzt kommerziell praktikabel sind, verglichen mit denen, die in der Forschungsphase bleiben, hilft Teams, die Prioritäten richtig zu bestimmen.

Warehouse Automation (NOW): Die größte kommerzielle Anwendung von verkörperter KI heute. Amazon betreibt 750.000+ Roboter in seinem Fulfillment-Netzwerk. Der adressierbare Markt für Lagerroboter wird bis 2028 auf 15 Milliarden Dollar geschätzt. Siehe unsere [Warehouse ROI-Analyse]

** Landwirtschaftliche Ernte (Jetzt):** Unternehmen wie Agrobot und AppHarvest setzen Manipulationsroboter für die Erdbeeren- und Tomatenernte ein. Die Herausforderung besteht in der Wahrnehmung (die Identifizierung reifer Produkte) und der sanften Manipulation (nicht die Frucht verletzen).

Healthcare Logistics (NOW): Moxi-Roboter von Diligent Robotics wird in mehr als 10 US-amerikanischen Krankenhäusern für die Lieferung von Lieferungen eingesetzt.

Konstruktion und Inspektion (EMERGING): Boston Dynamics Spot wird auf Baustellen zur Überwachung der Fortschritte und zur Gefahrenerkennung eingesetzt.

** Lebensmittelpräparation (FERBETZUNG):** Mehrere Unternehmen (Miso Robotics, Chef Robotics) setzen einzelne Lebensmittelpräparationsroboter (Flipping Burger, Spülung von Toppings) ein.

Die Rolle der RCSV in der integrierten KI-Infrastruktur

Die integrierte KI hat einen klaren Infrastruktur-Flaschenhals: physische Datenerfassung, Hardwarezugang und Integrationskompetenz.

Hardware-Zugriff: Unsere Anlagen in San Francisco und Allston bieten Zugang zu einer Flotte von mehr als 20 Robotern, darunter OpenArm 1 ($ 4.500, Open-Source 6-DOF), DK1 Bi-Manual-Systeme, Unitree G1 humanoid und Spezialplattformen. Teams können [Hardware]T6] ab 800 $/Monat mieten oder unsere Anlagen für die Datenerhebung vor Ort nutzen.

Datenerhebungssysteme: Professionelle Demonstrationserhebung mit ausgebildeten Betreibern, standardisierten Protokollen und automatisierten Qualitätsleitungen. Die Preise beginnen bei $ 2.500 für einen Pilot (50 Demonstrationen) und $ 8.000 für eine Standardkampagne (500 Demonstrationen). Daten in HDF5, RLDS oder LeRobot-Format geliefert. Siehe [Datendienstleistungen]T7) für aktuelle Preise und Aufgabenkatalog.

Plattform: Die RCSV Datenplattform bietet Datensatzmanagement, Episodevisualisierung, Qualitätsscoring und Export zu Standard-Training-Formaten.

Schulinfrastruktur: 8x A100 80GB GPU-Cluster für die Politikbildung mit Standard- und Prioritäts-Warteschlange-Optionen.

Eine praktische Zeitlinie

Timeframe Verkörperte KI Milestone Key Enablers
2025-2027 Specialized task robots deployed at scale in logistics Mature grasping policies, falling hardware costs
2026-2029 General-purpose manipulation in semi-structured environments Foundation models for manipulation, large-scale data
2028-2032 Generalist mobile manipulation in unstructured home environments Sim-to-real at scale, tactile sensing maturity
2030-2035 Humanoid robots performing non-trivial physical labor Whole-body control, dexterous manipulation breakthroughs
2035+ Broad humanoid deployment across manufacturing, services, elder care Cost reduction, regulatory frameworks, social acceptance

Die Teams, die heute verkörperte KI-Systeme bauen, arbeiten an dem frühesten und am meisten ausgewogenen Teil dieser Kurve. Die Dateninfrastruktur, die Betreiberpipelines und die derzeit gebauten Bewertungskadern werden die Bahn des gesamten Feldes definieren.

Mit der verkörperten KI beginnen

Wenn Sie ein Team sind, das ein verkörpertes KI-Projekt in Betracht zieht, gibt es hier eine praktische Start-Checkliste:

  1. ** Definieren Sie Ihre Aufgabe genau.** "Allgemeinzweckroboterassistent" ist keine Aufgabe. "Sammeln Sie Flaschen aus einem Transportgurt und legen Sie sie in eine Verpackungskasse" ist eine Aufgabe.
  2. Willst du eine Hardware wählen, die deiner Aufgabe entspricht. Kauf keine $50.000-Arm für eine Aufgabe, die eine $4.500-OpenArm bewältigen kann. Kauf keine 6-DOF-Arm für eine Aufgabe, die 7-DOF erfordert. Siehe unseren Roboterarm Kaufleiter.
  3. Datenerhebungsplan. Plan für 200-1.000 Demonstrationen für eine Aufgaben-spezifische Politik oder 20-100 Demonstrationen für die Feinasting eines Grundmodells. Budget für eine Standarddatenerhebungskampagne von 3.000-15.000 USD. Siehe unsere Kostenverteilung.
  4. Start mit dem Imitationslernen. IL ist schneller zu iterieren, sicherer zu entwickeln und kostengünstiger als RL. Verwenden Sie RL nur, wenn IL eine Obergrenze erreicht. Siehe unseren RL vs IL Entscheidungsanleitung.
  5. Richtig bewerten. Mindestens 50 politische Bewertungstests über die gesamte Palette der in der Bereitstellung erwarteten Bedingungen durchführen.

Verwandte Lesungen

  • [Fisische KI erklärt] T13) Wie physische KI von Software-AI unterscheidet sich
  • [Was macht gute Roboter-Training-Daten?] T14) das Qualitätsrahmen
  • [Roboter-Daten-Sammelkosten im Jahr 2026] T15) Vollkostenmodell
  • [LeRobot Guide]T16) Mit der Lernbibliothek von Hugging Face beginnen
  • [Null-Shot vs. Wenige-Shot-Roboter-Politiken] T17) realistische Erwartungen
  • RCSV-Datendienste Berufsdatenerhebung
  • [Hardware-Katalog] T19) Roboter und Komponenten

Auf der richtigen Infrastruktur für verkörperte KI aufbauen

RCSV bietet die Datenerhebung, Roboterhardware und Trainingsplattform für Teams, die die nächste Generation physischer KI entwickeln. Beginnen Sie mit einer Pilot- oder Miethardware von 2.500 USD pro Monat.

Erkundung von Datendiensten Lease Hardware