Grundlagenmodelle für Feinschalt-Roboter: Ein praktischer Leitfaden
Wie man Roboter-Grundlagenmodelle (OpenVLA, Octo, π0) auf Ihre Aufgabe <unk> Datenanforderungen, Ausbildungs-Setup und erwartete Leistungssteigerung anpasst.
[← Forschung]
Die Roboter-Fundationsmodelle reduzieren die Datenanforderungen für neue Aufgaben um 3
Warum man sich nicht von vornherein ausbilden sollte, sondern nur auf die Schärfe einstellen sollte
Die Ausbildung einer Manipulationspolitik von Grund auf erfordert Tausende von Aufgaben-spezifischen Demonstrationen.
Ein Roboter-Grundlagemodell, das bereits auf verschiedenen visuellen Daten im Internet-Skala und Tausenden von Roboter-Demonstrationen vorgebildet ist, versteht: visuelle Semantik ("rote Tasse" vs. "blaue Tasse"), Objektaufgaben (Taschen sind durch den Rand oder den Körper greifbar), Sprachen-Erdung ("Pick-up" vs. "Push"), und grundlegende Handlungsprior (sfeinige Strecken, Annäherungswinkel).
Die Ausarbeitung von Grundlagen wird durch die Übertragung dieser Prioritäten auf die spezifische Aufgabe durchgeführt. Das Ergebnis ist 3
Stiftungsmodelloptionen
- OpenVLA (7B Parameter, LLaMA Rückgrat, vollständig offene Gewichte)
das zugänglichste Grundmodell für Feinschaltung ab 2025. Starke Community, gut dokumentierte Feinschaltrezepte, aktive HuggingFace-Seite. Sprachenkonditioniert: akzeptiert freien Textanweisungen. Beste Verallgemeinerung über visuelle Domains. Inferenz: 6 Hz auf A100, 2 Hz auf RTX 4090. - Octo (90M Transformer + Diffusion Action Head, vollständig offene Gewichte)
schneller Ableitung (25 Hz auf einem einzigen A100) und niedrigerer Feinschaltkosten als OpenVLA. Diffusion Head generiert glatte Bahnen. Weniger visuelle Verallgemeinerung als OpenVLA, aber hervorragend für innervertriebliche Aufgaben. - π0 (Physical Intelligence, Flow-Matching-Architektur, eingeschränkter Zugriff)
Stand der Technik auf dexterous Manipulation Benchmarks ab Anfang 2025. Flow-Matching erzeugt qualitativ hochwertige Bahnen für kontaktreiche Aufgaben. Zugriff durch Physical Intelligence Partnership-Programm; nicht vollständig offen zum Zeitpunkt dieses Schreibens. Beste Wahl, wenn dexterous Manipulation (Faltung, Montage) ist das Ziel. - RoboFlamingo / 3D-VLA
neue Alternativen mit starkem 3D-Raumverständnis.
Datenanforderungen
Mindestmögliche Demonstrationszahlen für Fein-Tuning vs. Training von Grund auf:
- OpenVLA-Feinabstimmung: 50
500 Demonstrationen je nach Aufgabenkomplexität. Einfache Auswahl- und Plattform: 50 Demo oft genug. Komplexe Mehrstufensammlung: 300 500. Sammeln mit Handgelenkkamera + Außenansicht. - Octo-Feinabstimmung: 200
1,000 Demonstrationen. Leicht mehr Daten hungrig als OpenVLA für die gleiche Aufgabe, aber schneller zu trainieren. Besonders effizient, wenn Ihre Aufgabe ähnlich wie BridgeData (Tablettop-Manipulation) ist. - **Ausbildung von Grund auf (ACT, Diffusion Policy) **: 5.000 bis 50.000 Demonstrationen je nach Aufgabe. ALOHA Papier verwendet 50 Demo für einfache Aufgaben, 200 für komplexe Bi-Manual; aber dies sind starke Modelle im Vertrieb ohne Verallgemeinerung.
- Die Qualität der Daten ist wichtiger als die Menge. 100 Experten-Demonstrationen (schlecht, konsistent, ohne Zögern) übertreffen 500 mittelmäßige Demonstrationen.
Ausbildungsvorbereitung
Praktische Rechenanforderungen für Feinstuning:
- ** OpenVLA vollständige Fein-Tuning**: 4× A100 80GB, etwa 8 Stunden für 500 Demonstrationen, 10.000 Gradient Schritte.
- OpenVLA mit LoRA: Rank-16 LoRA reduziert das Speicher, um auf einem einzigen A100 40 GB mit minimalem Leistungsabbau zu passen (typischerweise <5% Erfolgsrate Differenz gegenüber vollständiger Feinausrichtung).
- Octo-Feinabstimmung: 1× A100 40GB, 2
4 Stunden für 200 500 Demonstrationen. - Verwenden Sie HuggingFace <unk>T0
+ <unk>T1 für OpenVLA LoRA. Die <unk>T2 -Bibliothek bietet Octo-Feinabstimmung-Scripts. Validieren Sie 20% Ihrer Demonstrationen, bevor Sie eine Hardware-Evaluierung durchführen.
Erwartete Ergebnisse
| Model | Demos Required | Expected Success Rate (Fine-Tune) | Training from Scratch (Same Demos) |
|---|---|---|---|
| OpenVLA | 100 | 55–70% | 15–30% |
| OpenVLA | 300 | 70–85% | 35–55% |
| Octo | 200 | 60–75% | 20–40% |
| Octo | 500 | 75–88% | 45–65% |
| π0 (if available) | 100 | 65–80% | N/A (requires much more) |
Die Zahlen sind annähernd und auf die Aufgabe abhängig. Pick-and-place-Tasks mit klarem visuellen Unterschied sind am oberen Ende. Geschickte Manipulation (Texter, verformbare Objekte) ist am unteren Ende. Validieren Sie immer auf gehaltenen Objekten.
Häufige Fehler
- ** Katastrophaler Vergessen**
Fein-Tuning überschreitet vorgeübte Funktionen, die Verallgemeinerung degradiert. - Moduskollaps
Politik konvergiert zu einem einzigen Verhalten (z.B. immer aus demselben Winkel nähert) und ignoriert die Objektvielfalt. - ** Überpassungspolitik**
Erinnerung an Trainingsdemonstrationen. Anzeichen: Trainingserfolgquote >>80%, aber neuartiger Objekterfolg <30%. - Action Distribution Mismatch
Der Aktionsraum Ihres Robots (Gelenkwinkel, End-Effektor-Pose) entspricht nicht dem erwarteten Format des Fundamentmodells.
Ausrüstung
Nach der Fein-Tuning optimieren Sie die Ableitgeschwindigkeit auf Ihrer Hardware:
- ONNX-Export
Export von OpenVLA oder Octo auf ONNX für hardware-agnostic-Implementierung. Reduktion von Python-Overhead, ermöglicht Rand-Implementierung. - TensorRT für Jetson
konvertieren Sie ONNX in TensorRT-Motor für NVIDIA Jetson AGX Orin. OpenVLA LoRA-Modell läuft bei 4 6 Hz auf Jetson AGX Orin mit INT8 Quantifizierung. - Quantifizierung
INT8 Quantifizierung reduziert die Modellgröße um 4x mit <3% Erfolgsrate für die meisten Manipulationsaufgaben.
Zugriff auf die Fein-Tuning-Infrastruktur und gesammelte Datensätze über die RCSV-Plattform oder erkunden Sie unsere Daten-Sammlungsdienste für eine hochwertige Demonstrationssammlung.
Start der Fein-Tuning auf RCSV-Datensätzen
Zugriff auf kuratierte Manipulationsdatenmengen, GPU-Schulinfrastruktur und Bewertungsmöglichkeiten, um Roboter-Grundlagenmodelle für Ihre Aufgaben zu optimieren.
[Erforschung der Datendienste]







