BridgeVLA
BridgeVLA: Ein- und Ausgangs-Ausrichtung für effiziente 3D-Manipulation. 88,2% RLBench, 64% COLOSSEUM. NeurIPS 2025.
[← Modelle]
Einleitungs-Ausgangs-Ausrichtung für effizientes 3D-Manipulation-Lernen mit Vision-Language-Modellen.
Überblick
BridgeVLA trainiert ein VLM-Backbone vor, um 2D-Bilder als Eingabe zu nehmen und 2D-Heatmaps als Ausgabe zu erstellen, und dann Fein-Tunes zu erstellen, während Punktwolken in Multi-View-Bilder projiziert werden.
Benchmarks
- RLBench 88,2% (von 81,4%)
- KOLOSSEUM 64,0%
- 10+ Aufgaben 95,4% mit nur 3 Strecken pro Aufgabe
Offizielle Verbindungen
- bridgevla.github.io
Projektseite - [OpenReview]
T2 ) NeurIPS 2025 Papier
Zitat
NeurIPS 2025. Siehe die Projektseite für BibTeX.
Jeder VLA hier kann auf Ihre eigenen Demonstrationen abgestimmt werden.
Sammeln Sie Demo → Hardware, die es läuft → Score eine Politik →







