時間差 (TD )学習とは、価値関数の現在の推定値からブートストラップによって学習する 、モデルフリーの 強化学習 手法の一種を指します。これらの手法は、モンテカルロ法 のように環境からサンプリングし、動的計画 法のように現在の推定値に基づいて更新を実行します。
モンテカルロ法は結果が判明してから推定値を調整するのに対し、TD法は結果が判明する前に、将来に関するより正確な予測に合わせて予測値を調整します。[ 2 ] これはブートストラップ の一種であり、次の例で示されます。
土曜日の天気を予測したいとします。週の各日の天気から土曜日の天気を予測するモデルがあるとします。標準的なケースでは、土曜日まで待ってからすべてのモデルを調整します。しかし、たとえば金曜日であれば、土曜日の天気がどうなるかかなり正確に把握でき、土曜日が来る前に、たとえば土曜日のモデルを変更できるはずです。[ 2 ]
時間差法は、動物の学習 の時間差モデルに関連している。[ 3 ] [ 4 ] [ 5 ] [ 6 ] [ 7 ]
TD-ラムダ TD-Lambdaは、 アーサー・サミュエル による時間差学習に関する以前の研究に基づいて、リチャード・S・サットン が考案した学習アルゴリズムです。このアルゴリズムは、ジェラルド・テサウロによって TD-Gammonの 作成に応用され、熟練した人間のプレイヤーのレベルでバックギャモン をプレイすることを学習するプログラムとして有名になりました。
ラムダ(λ {\displaystyle \lambda } ) パラメータはトレース減衰パラメータを指し、0 ⩽ λ ⩽ 1 {\displaystyle 0\leqslant \lambda \leqslant 1} 設定値が高いほど痕跡が長持ちします。つまり、報酬からのクレジットの割合が、より遠い状態や行動に与えられる場合、λ {\displaystyle \lambda } より高いλ = 1 {\displaystyle \lambda =1} モンテカルロRLアルゴリズムへの並列学習を生成する。
神経科学において TDアルゴリズムは 神経科学 の分野でも注目を集めています。研究者らは、腹側被蓋野 (VTA) および黒質 (SNc)のドーパミン ニューロン の発火率が、アルゴリズムのエラー関数を模倣しているように見えることを発見しました。[ 3 ] [ 4 ] [ 5 ] [ 6 ] [ 7 ] エラー関数は、任意の状態または時間ステップでの推定報酬と実際に受け取った報酬との差を報告します。エラー関数が大きいほど、期待される報酬と実際の報酬の差が大きくなります。これが将来の報酬を正確に反映する刺激とペアになると、エラーを使用して刺激を将来の報酬と関連付けることができます 。
ドーパミン 細胞も同様の挙動を示すようです。ある実験では、サルに刺激とジュースの報酬を関連付けるように訓練している間に、ドーパミン細胞の測定が行われました。[ 14 ] 最初は、サルがジュースを受け取るとドーパミン細胞の発火率が増加し、期待される報酬と実際の報酬に差があることを示しました。時間が経つにつれて、この発火率の増加は、報酬に対する最も早く確実な刺激に伝播しました。サルが完全に訓練されると、予測された報酬が提示されても発火率の増加は見られませんでした。その後、期待された報酬が得られなかった場合、ドーパミン細胞の発火率は通常の活性化よりも低下しました。これは、TD のエラー関数が強化学習 に使用される方法とよく似ています。
モデルと潜在的な神経機能との関係から、TD を用いて行動研究の多くの側面を説明しようとする研究が生まれています。[ 15 ] [ 16 ] また、統合失調症 などの疾患や、ドーパミンの薬理学的操作が学習に及ぼす影響を研究するためにも使用されています。 [ 17 ]
注記 1 2 Sutton, Richard S. (1988年8月1日). 「時間差法による予測学習」 . Machine Learning . 3 (1): 9–44 . doi : 10.1007/BF00115009 . ISSN 1573-0565 . S2CID 207771194 . 1 2 Schultz, W、Dayan, P、Montague, PR. (1997). "予測と報酬の神経基盤". Science . 275 (5306): 1593– 1599. CiteSeerX 10.1.1.133.6176 . doi : 10.1126/science.275.5306.1593 . PMID 9054347 . S2CID 220093382 . {{cite journal}}: CS1 maint: 複数の名前: 著者リスト (リンク)1 2 Montague, PR; Dayan, P.; Sejnowski, TJ (1996-03-01). "予測的ヘッブ学習に基づく中脳ドーパミンシステムのフレームワーク" (PDF) . The Journal of Neuroscience . 16 (5): 1936– 1947. doi : 10.1523/JNEUROSCI.16-05-01936.1996 . ISSN 0270-6474 . PMC 6578666 . PMID 8774460 . 1 2 Montague, PR; Dayan, P.; Nowlan, SJ; Pouget, A.; Sejnowski, TJ (1993). "非周期的な強化を用いた指向性自己組織化" (PDF) . Advances in Neural Information Processing Systems . 5 : 969– 976. 1 2 Montague, PR; Sejnowski, TJ (1994). "予測脳: シナプス学習メカニズムにおける時間的一致と時間的順序" . Learning & Memory . 1 (1): 1– 33. doi : 10.1101/lm.1.1.1 . ISSN 1072-0502 . PMID 10467583. S2CID 44560099 . 1 2 Sejnowski, TJ; Dayan, P.; Montague, PR (1995). "予測的ヘッブ学習". 第8回計算学習理論年次会議 - COLT '95 議事録 . pp. 15–18 . doi : 10.1145/225298.225300 . ISBN 0897917235 . S2CID 1709691 . ↑ 割引率パラメータは、より即時の報酬を優先し、遠い将来の報酬を軽視する時間選好を反映する。 ↑ Schultz, W. (1998). "ドーパミンニューロンの予測報酬シグナル". Journal of Neurophysiology . 80 (1): 1– 27. CiteSeerX 10.1.1.408.5994 . doi : 10.1152/jn.1998.80.1.1 . PMID 9658025. S2CID 52857162 . ↑ Dayan, P. (2001). "動機づけられた強化学習" (PDF) . Advances in Neural Information Processing Systems . 14 . MIT Press: 11– 18. 2012-05-25 の オリジナル (PDF)からアーカイブ済み。2009-03-03 に 取得 。 ↑ Tobia, MJ, 他 (2016). "高齢者における反事実的利益に対する行動および神経応答の変化" . Cognitive, Affective, & Behavioral Neuroscience . 16 (3): 457– 472. doi : 10.3758/s13415-016-0406-7 . PMID 26864879 . S2CID 11299945 . {{cite journal}}: CS1 maint: 複数の名前: 著者リスト (リンク)↑ Smith, A., Li, M., Becker, S. および Kapur, S. (2006). "ドーパミン、予測誤差、および連想学習:モデルベースの説明". Network: Computation in Neural Systems . 17 (1): 61– 84. doi : 10.1080/09548980500361624 . PMID 16613795 . S2CID 991839 . {{cite journal}}: CS1 maint: 複数の名前: 著者リスト (リンク)
参考文献 サットン、リチャード S.、バート、アンドリュー G. (2018).強化学習入門 (第 2 版). マサチューセッツ州ケンブリッジ: MIT Press. Tesauro, Gerald (1995 年 3 月). 「時間差学習と TD-Gammon」 . Communications of the ACM . 38 (3): 58–68 . doi : 10.1145/203330.203343 . S2CID 6023746 .
さらに読む Meyn, SP (2007).複雑ネットワークの制御技術 . Cambridge University Press. ISBN 978-0521884419 。 最終章および付録を参照のこと。Sutton, RS; Barto, AG (1990). "パブロフ型強化の時間微分モデル" (PDF) . Learning and Computational Neuroscience: Foundations of Adaptive Networks : 497– 537. 2017年3月30日にオリジナル(PDF)からアーカイブ済み。 2017年3月29日 取得 。
外部リンク Connect Four TDGravityアプレット( 2012年7月24日にWayback Machine に アーカイブ済み)(+携帯電話版) – TD-Leafメソッド(TD-Lambdaと浅い木構造探索の組み合わせ)を使用して独学で開発 自己学習メタ三目並べ2014年3月19日にWayback Machine に アーカイブされました シンプルなボードゲームをプレイするミニマックスAIの状態評価定数を学習するために、時間差学習を使用する方法を示すWebアプリの例。 強化学習の問題、時間差学習を用いてQ学習を高速化する方法を説明する文書 TDシミュレーター:古典的条件付けのための時間差シミュレーター