Zurück zu Research

Grundlagenmodelle für Feinschalt-Roboter: Ein praktischer Leitfaden

Wie man Roboter-Grundlagenmodelle (OpenVLA, Octo, π0) auf Ihre Aufgabe <unk> Datenanforderungen, Ausbildungs-Setup und erwartete Leistungssteigerung anpasst.

[← Forschung]

Die Roboter-Fundationsmodelle reduzieren die Datenanforderungen für neue Aufgaben um 310 ×. Diese Anleitung umfasst die Modellwahl, die Mindestdatenanforderungen, die Ausbildungskonfigurationen und die erwarteten Ergebnisse.

Warum man sich nicht von vornherein ausbilden sollte, sondern nur auf die Schärfe einstellen sollte

Die Ausbildung einer Manipulationspolitik von Grund auf erfordert Tausende von Aufgaben-spezifischen Demonstrationen.

Ein Roboter-Grundlagemodell, das bereits auf verschiedenen visuellen Daten im Internet-Skala und Tausenden von Roboter-Demonstrationen vorgebildet ist, versteht: visuelle Semantik ("rote Tasse" vs. "blaue Tasse"), Objektaufgaben (Taschen sind durch den Rand oder den Körper greifbar), Sprachen-Erdung ("Pick-up" vs. "Push"), und grundlegende Handlungsprior (sfeinige Strecken, Annäherungswinkel).

Die Ausarbeitung von Grundlagen wird durch die Übertragung dieser Prioritäten auf die spezifische Aufgabe durchgeführt. Das Ergebnis ist 310× Probeneffizienz: wo das Training von Grund auf 5.000 Demonstrationen erfordert, erzielt die Ausarbeitung eines Grundmodells oft eine vergleichbare Leistung mit 200500. Dieser Unterschied bedeutet Wochen der Datenerhebung gegenüber Tagen.

Stiftungsmodelloptionen

  • OpenVLA (7B Parameter, LLaMA Rückgrat, vollständig offene Gewichte) das zugänglichste Grundmodell für Feinschaltung ab 2025. Starke Community, gut dokumentierte Feinschaltrezepte, aktive HuggingFace-Seite. Sprachenkonditioniert: akzeptiert freien Textanweisungen. Beste Verallgemeinerung über visuelle Domains. Inferenz: 6 Hz auf A100, 2 Hz auf RTX 4090.
  • Octo (90M Transformer + Diffusion Action Head, vollständig offene Gewichte) schneller Ableitung (25 Hz auf einem einzigen A100) und niedrigerer Feinschaltkosten als OpenVLA. Diffusion Head generiert glatte Bahnen. Weniger visuelle Verallgemeinerung als OpenVLA, aber hervorragend für innervertriebliche Aufgaben.
  • π0 (Physical Intelligence, Flow-Matching-Architektur, eingeschränkter Zugriff) Stand der Technik auf dexterous Manipulation Benchmarks ab Anfang 2025. Flow-Matching erzeugt qualitativ hochwertige Bahnen für kontaktreiche Aufgaben. Zugriff durch Physical Intelligence Partnership-Programm; nicht vollständig offen zum Zeitpunkt dieses Schreibens. Beste Wahl, wenn dexterous Manipulation (Faltung, Montage) ist das Ziel.
  • RoboFlamingo / 3D-VLA neue Alternativen mit starkem 3D-Raumverständnis.

Datenanforderungen

Mindestmögliche Demonstrationszahlen für Fein-Tuning vs. Training von Grund auf:

  • OpenVLA-Feinabstimmung: 50500 Demonstrationen je nach Aufgabenkomplexität. Einfache Auswahl- und Plattform: 50 Demo oft genug. Komplexe Mehrstufensammlung: 300500. Sammeln mit Handgelenkkamera + Außenansicht.
  • Octo-Feinabstimmung: 2001,000 Demonstrationen. Leicht mehr Daten hungrig als OpenVLA für die gleiche Aufgabe, aber schneller zu trainieren. Besonders effizient, wenn Ihre Aufgabe ähnlich wie BridgeData (Tablettop-Manipulation) ist.
  • **Ausbildung von Grund auf (ACT, Diffusion Policy) **: 5.000 bis 50.000 Demonstrationen je nach Aufgabe. ALOHA Papier verwendet 50 Demo für einfache Aufgaben, 200 für komplexe Bi-Manual; aber dies sind starke Modelle im Vertrieb ohne Verallgemeinerung.
  • Die Qualität der Daten ist wichtiger als die Menge. 100 Experten-Demonstrationen (schlecht, konsistent, ohne Zögern) übertreffen 500 mittelmäßige Demonstrationen.

Ausbildungsvorbereitung

Praktische Rechenanforderungen für Feinstuning:

  • ** OpenVLA vollständige Fein-Tuning**: 4× A100 80GB, etwa 8 Stunden für 500 Demonstrationen, 10.000 Gradient Schritte.
  • OpenVLA mit LoRA: Rank-16 LoRA reduziert das Speicher, um auf einem einzigen A100 40 GB mit minimalem Leistungsabbau zu passen (typischerweise <5% Erfolgsrate Differenz gegenüber vollständiger Feinausrichtung).
  • Octo-Feinabstimmung: 1× A100 40GB, 24 Stunden für 200500 Demonstrationen.
  • Verwenden Sie HuggingFace <unk>T0 + <unk>T1 für OpenVLA LoRA. Die <unk>T2-Bibliothek bietet Octo-Feinabstimmung-Scripts. Validieren Sie 20% Ihrer Demonstrationen, bevor Sie eine Hardware-Evaluierung durchführen.

Erwartete Ergebnisse

Model Demos Required Expected Success Rate (Fine-Tune) Training from Scratch (Same Demos)
OpenVLA 100 55–70% 15–30%
OpenVLA 300 70–85% 35–55%
Octo 200 60–75% 20–40%
Octo 500 75–88% 45–65%
π0 (if available) 100 65–80% N/A (requires much more)

Die Zahlen sind annähernd und auf die Aufgabe abhängig. Pick-and-place-Tasks mit klarem visuellen Unterschied sind am oberen Ende. Geschickte Manipulation (Texter, verformbare Objekte) ist am unteren Ende. Validieren Sie immer auf gehaltenen Objekten.

Häufige Fehler

  • ** Katastrophaler Vergessen** Fein-Tuning überschreitet vorgeübte Funktionen, die Verallgemeinerung degradiert.
  • Moduskollaps Politik konvergiert zu einem einzigen Verhalten (z.B. immer aus demselben Winkel nähert) und ignoriert die Objektvielfalt.
  • ** Überpassungspolitik** Erinnerung an Trainingsdemonstrationen. Anzeichen: Trainingserfolgquote >>80%, aber neuartiger Objekterfolg <30%.
  • Action Distribution Mismatch Der Aktionsraum Ihres Robots (Gelenkwinkel, End-Effektor-Pose) entspricht nicht dem erwarteten Format des Fundamentmodells.

Ausrüstung

Nach der Fein-Tuning optimieren Sie die Ableitgeschwindigkeit auf Ihrer Hardware:

  • ONNX-Export Export von OpenVLA oder Octo auf ONNX für hardware-agnostic-Implementierung. Reduktion von Python-Overhead, ermöglicht Rand-Implementierung.
  • TensorRT für Jetson konvertieren Sie ONNX in TensorRT-Motor für NVIDIA Jetson AGX Orin. OpenVLA LoRA-Modell läuft bei 46 Hz auf Jetson AGX Orin mit INT8 Quantifizierung.
  • Quantifizierung INT8 Quantifizierung reduziert die Modellgröße um 4x mit <3% Erfolgsrate für die meisten Manipulationsaufgaben.

Zugriff auf die Fein-Tuning-Infrastruktur und gesammelte Datensätze über die RCSV-Plattform oder erkunden Sie unsere Daten-Sammlungsdienste für eine hochwertige Demonstrationssammlung.

Start der Fein-Tuning auf RCSV-Datensätzen

Zugriff auf kuratierte Manipulationsdatenmengen, GPU-Schulinfrastruktur und Bewertungsmöglichkeiten, um Roboter-Grundlagenmodelle für Ihre Aufgaben zu optimieren.

[Erforschung der Datendienste]