VLA Modelsに戻る

ロボフラミンゴ

ロボフラミンゴ: ロボット操作のためのOpenFlamingoベースの視覚言語モデル. バイトダンス, Tsinghua, SJTU, NUS. MIT,ハグリングフェイス.

[←モデル]

視覚言語基盤モデルが 効果的なロボット模倣器として オープンフラミンゴベースの

概要

RoboFlamingoはOpenFlamingoをベースに構築され,単段階の視言語理解と連続的なロボット制御のための明示的なポリシーヘッドを組み合わせています.模倣学習を通じて精密に調整されています.単一のGPUサーバーでトレーニングできます.

建築 & 性能

  • OpenFlamingoの脊椎 (MPT-3B,4B,9B変種)
  • 連続的な意思決定の政策担当者
  • カルビン基準値が強かった
  • オープンループ制御,資源の低活用

公式リンク

引用

プロジェクトサイトで BibTeXと紙の参照を参照してください.

ビデオの各部には 自分のデモで調整できます

デモを集める → それを実行するハードウェア → ポリシーをスコア →