Roboflamingo
RoboFlamingo: OpenFlamingo-basiertes Vision-Language-Modell für die Manipulation von Robotern. ByteDance, Tsinghua, SJTU, NUS. MIT, Hugging Face.
[← Modelle]
Vision-Language-Fundament-Modelle als wirksame Roboternimatoren.
Überblick
RoboFlamingo baut auf OpenFlamingo auf, um eintrittsweise das Verständnis der Vision-Sprache mit einem expliziten Richtlinien-Head für die sequentielle Roboterkontrolle zu kombinieren.
Architektur & Leistung
- OpenFlamingo-Backbone (MPT-3B, 4B, 9B Varianten)
- Politikleiter für die aufeinanderfolgende Entscheidungsfindung
- Starke Ergebnisse für den CALVIN-Benchmark
- Open-loop-Steuerung, Einsatz mit geringen Ressourcen
Offizielle Verbindungen
- roboflamingo.github.io
Projektseite - github.com/RoboFlamingo/RoboFlamingo
Code (MIT) - [Hugging Face: Robovlms/RoboFlamingo]
Zitat
Siehe die Projektseite für BibTeX und Papierreferenzen.
Jeder VLA hier kann auf Ihre eigenen Demonstrationen abgestimmt werden.
Sammeln Sie Demo → Hardware, das es läuft → Score eine Politik →







