Zurück zu VLA Models

Roboflamingo

RoboFlamingo: OpenFlamingo-basiertes Vision-Language-Modell für die Manipulation von Robotern. ByteDance, Tsinghua, SJTU, NUS. MIT, Hugging Face.

[← Modelle]

Vision-Language-Fundament-Modelle als wirksame Roboternimatoren.

Überblick

RoboFlamingo baut auf OpenFlamingo auf, um eintrittsweise das Verständnis der Vision-Sprache mit einem expliziten Richtlinien-Head für die sequentielle Roboterkontrolle zu kombinieren.

Architektur & Leistung

  • OpenFlamingo-Backbone (MPT-3B, 4B, 9B Varianten)
  • Politikleiter für die aufeinanderfolgende Entscheidungsfindung
  • Starke Ergebnisse für den CALVIN-Benchmark
  • Open-loop-Steuerung, Einsatz mit geringen Ressourcen

Offizielle Verbindungen

Zitat

Siehe die Projektseite für BibTeX und Papierreferenzen.

Jeder VLA hier kann auf Ihre eigenen Demonstrationen abgestimmt werden.

Sammeln Sie Demo → Hardware, das es läuft → Score eine Politik →