Glossaryに戻る

連続制御

ControlReinforcement Learning

ロボット制御ポリシーが離散的なアクションセットから選択するのではなく、実数値のアクションベクトル(例:関節トルク、速度、またはデカルト座標デルタ)を出力する。ほとんどの物理的ロボット操作タスクは連続制御を必要とする。滑らかで正確な動きは有限のアクションメニューでは適切に表現できないためである。連続制御のための標準的な深層強化学習アルゴリズムにはDDPG、TD3、SACが含まれる。模倣学習では、動作のクローン作成とDiffusion Policyが連続アクション空間で一般的に使用される。 実践例を参照:ハードウェアストア →

Related terms