VLA
視覚観測と言語指示を入力として受け取り、ロボットアクションを直接出力する基礎モデルであるVision-Language-Actionモデル。VLAは知覚、言語理解、制御を単一のニューラルネットワークで統合します。RT-2、OpenVLA、Octo、π0などが例として挙げられます。VLAはロボット学習の現在の最前線を代表し、ロボティクスの「GPTモーメント」を目指しています。
視覚観測と言語指示を入力として受け取り、ロボットアクションを直接出力する基礎モデルであるVision-Language-Actionモデル。VLAは知覚、言語理解、制御を単一のニューラルネットワークで統合します。RT-2、OpenVLA、Octo、π0などが例として挙げられます。VLAはロボット学習の現在の最前線を代表し、ロボティクスの「GPTモーメント」を目指しています。