Glossaryに戻る

マスク付きオートエンコーダー

MLRepresentation LearningVision

画像のランダムなパッチをマスクし、ViTエンコーダ・デコーダが欠落したパッチの再構成を学習する自己教師あり事前学習アプローチです。MAE事前学習は強力な視覚表現を学習し、下流タスクへの転移性能が優れています。ロボティクスでは、MAE事前学習済みの視覚エンコーダは操作制御ポリシーに対して堅牢な特徴を提供し、特にラベル付きロボットデータが限定的な場合に有効です。

Related terms