基礎モデル
広範なデータ(インターネットテキスト、画像、動画)で事前学習された大規模ニューラルネットワークで、最小限のファインチューニングで下流タスクに適応できます。ロボット工学では、基礎モデルは視覚表現(DINOv2)、言語グラウンディング(CLIP、LLM)、ワールドモデル(動画予測)を提供し、ロボット動作を直接出力します(RT-2、OpenVLA、π0などのVLA)。これらは学習のデータコストをタスクと具体化全体で償却することを約束します。
広範なデータ(インターネットテキスト、画像、動画)で事前学習された大規模ニューラルネットワークで、最小限のファインチューニングで下流タスクに適応できます。ロボット工学では、基礎モデルは視覚表現(DINOv2)、言語グラウンディング(CLIP、LLM)、ワールドモデル(動画予測)を提供し、ロボット動作を直接出力します(RT-2、OpenVLA、π0などのVLA)。これらは学習のデータコストをタスクと具体化全体で償却することを約束します。