Glossaryに戻る

アクション空間

PolicyControl

アクション空間は、ロボットポリシーが各タイムステップで生成できる出力の完全な集合。ロボットアームの場合、通常はジョイント位置、ジョイント速度、またはエンドエフェクタ姿勢(デカルト位置+四元数)を含む。移動ロボットの場合は車輪速度またはステアリングコマンドを含む。アクション空間は離散的(アクションの有限メニュー)または連続的(実数値ベクトル)として記述される。アクション空間の次元性と表現は、安定したポリシーを訓練することの容易さに大きく影響する:エンドエフェクタデルタ姿勢空間は模倣学習に適していることが多く、ジョイント・トルク空間はより細かい力制御を提供するが、より慎重な正規化が必要である。 実践例:当社の実世界評価 →

Related terms