自己回帰制御ポリシー
多次元アクションを1次元ずつ生成し、後続の各次元を以前に生成された次元に条件付けする制御ポリシーアーキテクチャ。自己回帰ポリシーはガウス分布ポリシーよりも複雑で多峰性のアクション分布をより忠実にモデル化できます。トレードオフとして逐次生成により推論が遅くなります。BeT(Behavior Transformers)および一部の拡散ポリシーバリアントで使用されます。
多次元アクションを1次元ずつ生成し、後続の各次元を以前に生成された次元に条件付けする制御ポリシーアーキテクチャ。自己回帰ポリシーはガウス分布ポリシーよりも複雑で多峰性のアクション分布をより忠実にモデル化できます。トレードオフとして逐次生成により推論が遅くなります。BeT(Behavior Transformers)および一部の拡散ポリシーバリアントで使用されます。