事前学習
特定の下流タスクで微調整する前に、大規模な一般的なデータセットでモデルを学習する初期段階。ロボット学習では、視覚エンコーダーはImageNetまたはインターネット画像(ResNet、ViT、DINOv2)で事前学習され、VLAモデルはインターネット規模の視覚言語データで事前学習される。事前学習は、ロボット固有のデータが限定的なロボット知覚タスクへの転移を可能にする堅牢な特徴表現を提供する。
特定の下流タスクで微調整する前に、大規模な一般的なデータセットでモデルを学習する初期段階。ロボット学習では、視覚エンコーダーはImageNetまたはインターネット画像(ResNet、ViT、DINOv2)で事前学習され、VLAモデルはインターネット規模の視覚言語データで事前学習される。事前学習は、ロボット固有のデータが限定的なロボット知覚タスクへの転移を可能にする堅牢な特徴表現を提供する。