Zurück zu VLA Models

BridgeVLA

BridgeVLA: Ein- und Ausgangs-Ausrichtung für effiziente 3D-Manipulation. 88,2% RLBench, 64% COLOSSEUM. NeurIPS 2025.

[← Modelle]

Einleitungs-Ausgangs-Ausrichtung für effizientes 3D-Manipulation-Lernen mit Vision-Language-Modellen.

Überblick

BridgeVLA trainiert ein VLM-Backbone vor, um 2D-Bilder als Eingabe zu nehmen und 2D-Heatmaps als Ausgabe zu erstellen, und dann Fein-Tunes zu erstellen, während Punktwolken in Multi-View-Bilder projiziert werden.

Benchmarks

  • RLBench 88,2% (von 81,4%)
  • KOLOSSEUM 64,0%
  • 10+ Aufgaben 95,4% mit nur 3 Strecken pro Aufgabe

Offizielle Verbindungen

Zitat

NeurIPS 2025. Siehe die Projektseite für BibTeX.

Jeder VLA hier kann auf Ihre eigenen Demonstrationen abgestimmt werden.

Sammeln Sie Demo → Hardware, die es läuft → Score eine Politik →