アクタークリティックアルゴリズム (AC)は、方策勾配法 などの方策ベースの強化学習(RL)アルゴリズムと、価値反復、Q学習、SARSA、TD学習などの価値ベースのRLアルゴリズムを組み合わせた強化学習 ( RL ) アルゴリズムのファミリー です。[ 1 ]
ACアルゴリズムは、ポリシー関数に従ってどの行動を取るかを決定する「アクター 」と、価値関数に従ってそれらの行動を評価する「クリティック」という2つの主要なコンポーネントで構成されています。 [ 2 ] ACアルゴリズムには、オンポリシーのものとオフポリシーのものがあります。連続的な行動空間または離散的な行動空間のどちらかに適用できるものもあれば、両方のケースで機能するものもあります。
概要 アクタークリティック法は、ベースラインを導入することで、REINFORCEのような純粋なポリシー勾配法を改良したものと理解できる。
批評家 上記の不偏推定量では、次のような特定の関数V π θ 、 Q π θ 、 A π θ {\displaystyle V^{\pi _{\theta }},Q^{\pi _{\theta }},A^{\pi _{\theta }}} これらは批評家 によって近似されます。これらの関数はすべて行為者に依存するため、批評家は行為者と共に学習する必要があります。批評家は価値ベースの強化学習アルゴリズムによって学習されます。
例えば、批評家が状態価値関数を推定する場合V π θ ( s ) {\displaystyle V^{\pi _{\theta }}(s)} そうすれば、任意の値関数近似法で学習できる。批評家を関数近似器とする。V ϕ ( s ) {\displaystyle V_{\phi }(s)} パラメータ付きϕ {\displaystyle \phi } 。
最も単純な例はTD(1)学習であり、これはTD(1)エラーを最小化するように批評家を訓練する。δ 私 = R 私 + γ V ϕ ( S 私 + 1 ) − V ϕ ( S 私 ) {\displaystyle \delta _{i}=R_{i}+\gamma V_{\phi }(S_{i+1})-V_{\phi }(S_{i})} 批評家のパラメータは、TD誤差の二乗に対する勾配降下法によって更新されます。ϕ ← ϕ − α ∇ ϕ ( δ 私 ) 2 = ϕ + α δ 私 ∇ ϕ V ϕ ( S 私 ) {\displaystyle \phi \leftarrow \phi -\alpha \nabla _{\phi }(\delta _{i})^{2}=\phi +\alpha \delta _{i}\nabla _{\phi }V_{\phi }(S_{i})} どこα {\displaystyle \alpha } は学習率です。勾配は に関して取られることに注意してください。ϕ {\displaystyle \phi } でV ϕ ( S 私 ) {\displaystyle V_{\phi }(S_{i})} ただ、ϕ {\displaystyle \phi } でγ V ϕ ( S 私 + 1 ) {\displaystyle \gamma V_{\phi }(S_{i+1})} は移動するターゲットであり、勾配はそれに関して計算されるわけではありません。これは自動微分 を使用する実装でよく発生するエラーの原因であり、その時点で「勾配の計算を停止する」必要があります。
同様に、批評家が行動価値関数を推定している場合Q π θ {\displaystyle Q^{\pi _{\theta }}} すると、 Q学習 またはSARSA によって学習できます。SARSAでは、批評家は、によってパラメータ化されたQ関数の推定値を保持します。ϕ {\displaystyle \phi } と表記されるQ ϕ ( s 、 1 ) {\displaystyle Q_{\phi }(s,a)} すると、時間差誤差は次のように計算される。δ 私 = R 私 + γ Q θ ( S 私 + 1 、 A 私 + 1 ) − Q θ ( S 私 、 A 私 ) {\displaystyle \delta _{i}=R_{i}+\gamma Q_{\theta }(S_{i+1},A_{i+1})-Q_{\theta }(S_{i},A_{i})} 批評家はその後更新されますθ ← θ + α δ 私 ∇ θ Q θ ( S 私 、 A 私 ) {\displaystyle \theta \leftarrow \theta +\alpha \delta _{i}\nabla _{\theta }Q_{\theta }(S_{i},A_{i})} アドバンテージクリティックは、Q関数を訓練することによって訓練できます。Q ϕ ( s 、 1 ) {\displaystyle Q_{\phi }(s,a)} 状態値関数V ϕ ( s ) {\displaystyle V_{\phi }(s)} するとA ϕ ( s 、 1 ) = Q ϕ ( s 、 1 ) − V ϕ ( s ) {\displaystyle A_{\phi }(s,a)=Q_{\phi }(s,a)-V_{\phi }(s)} ただし、状態値関数のみを学習させる方が一般的です。V ϕ ( s ) {\displaystyle V_{\phi }(s)} 次に、 [ 3 ] によって利点を推定します。A ϕ ( S 私 、 A 私 ) ≈ ∑ j ∈ 0 : n − 1 γ j R 私 + j + γ n V ϕ ( S 私 + n ) − V ϕ ( S 私 ) {\displaystyle A_{\phi }(S_{i},A_{i})\approx \sum _{j\in 0:n-1}\gamma ^{j}R_{i+j}+\gamma ^{n}V_{\phi }(S_{i+n})-V_{\phi }(S_{i})} ここ、n {\displaystyle n} は正の整数です。n {\displaystyle n} つまり、利点推定におけるバイアスは小さくなるほど小さくなるが、その代償として分散は大きくなる。
一般化優位性推定(GAE) はハイパーパラメータを導入しますλ {\displaystyle \lambda } モンテカルロリターンの間を滑らかに補間する(λ = 1 {\displaystyle \lambda =1} 、高分散、バイアスなし)および 1 ステップTD 学習 (λ = 0 {\displaystyle \lambda =0} (低分散、高バイアス)。このハイパーパラメータは、優位性推定における最適なバイアス・分散のトレードオフを選択するために調整できます。これは、nステップのリターンの指数関数的に減衰する平均を使用し、λ {\displaystyle \lambda } 崩壊強度である。[ 4 ]
バリエーション 非同期アドバンテージアクタークリティック(A3C) :A2Cの並列非同期バージョン。 [ 3 ] ソフトアクタークリティック(SAC) :探索を改善するためにエントロピー最大化を取り入れています。[ 5 ] 深層決定論的方策勾配法(DDPG) :連続行動空間に特化。[ 6 ]
参考文献 ↑ Arulkumaran, Kai; Deisenroth, Marc Peter; Brundage, Miles; Bharath, Anil Anthony (2017年11月)「深層強化学習:簡単な概説」IEEE Signal Processing Magazine . 34 (6): 26–38 . arXiv : 1708.05866 . Bibcode : 2017ISPM...34...26A . doi : 10.1109/MSP.2017.2743240 . ISSN 1053-5888 . ↑ Konda, Vijay; Tsitsiklis, John (1999). "Actor-Critic Algorithms" . Advances in Neural Information Processing Systems . 12 . MIT Press. 1 2 3 Mnih, Volodymyr; Badia, Adrià Puigdomènech; Mirza, Mehdi; Graves, Alex; Lillicrap, Timothy P.; Harley, Tim; Silver, David; Kavukcuoglu, Koray (2016-06-16), Asynchronous Methods for Deep Reinforcement Learning , arXiv : 1602.01783 1 2 Schulman, John; Moritz, Philipp; Levine, Sergey ; Jordan, Michael; Abbeel, Pieter (2018-10-20), High-Dimensional Continuous Control Using Generalized Advantage Estimation , arXiv : 1506.02438 ↑ ハールノヤ、トゥオーマス。周、オーリック。ハルティカイネン、クリスチャン。タッカー、ジョージ。ハ、セフン。タン、ジエ。クマール、ヴィカシュ。朱、ヘンリー。 Gupta、Abhishek (2019-01-29)、 Soft Actor-Critic Algorithms and Applications 、 arXiv : 1812.05905 ↑ リリックラップ、ティモシー P.;ハント、ジョナサン J.アレクサンダー・プリッツェル。やあ、ニコラス。エレス、トム。タッサ、ユヴァル。シルバー、デイビッド。 Wierstra、Daan (2019-07-05)、 深層強化学習による連続制御 、 arXiv : 1509.02971 Konda, Vijay R.; Tsitsiklis, John N. (2003年1月). 「アクタークリティックアルゴリズムについて」 . SIAM Journal on Control and Optimization . 42 (4): 1143– 1166. doi : 10.1137/S0363012901385691 . ISSN 0363-0129 . サットン、リチャード・S.、バート、アンドリュー・G. (2018).強化学習入門 . 適応計算と機械学習シリーズ (第2 版). マサチューセッツ州ケンブリッジ: MIT Press. ISBN 978-0-262-03924-6 。 Bertsekas, Dimitri P. (2019).強化学習と最適制御 (第2 版). ベルモント、マサチューセッツ州:Athena Scientific. ISBN 978-1-886529-39-7 。 Grossi, Csaba (2010).強化学習のためのアルゴリズム . 人工知能と機械学習に関する総合講義(第1 版). Cham: Springer International Publishing. ISBN 978-3-031-00423-0 。 Grondman, Ivo; Busoniu, Lucian; Lopes, Gabriel AD; Babuska, Robert (2012年11月) 「アクタークリティック強化学習の概観:標準および自然方策勾配」 IEEE Transactions on Systems, Man, and Cybernetics - Part C: Applications and Reviews . 42 (6): 1291– 1307. Bibcode : 2012ITHMS..42.1291G . doi : 10.1109/TSMCC.2012.2218595 . ISSN 1094-6977 .