アプローチ 専門家による実演とは、専門家が目的の作業を実行する様子を録画したもので、多くの場合、状態と動作のペアとして収集されます。( o t * 、 1 t * ) {\displaystyle (o_{t}^{*},a_{t}^{*})} 。
行動クローニング 行動クローニング (BC)は、模倣学習の最も基本的な形態です。基本的に、教師あり学習を使用してポリシーを訓練します。π θ {\displaystyle \pi _{\theta }} つまり、ある観測値が与えられた場合o t ot アクション分布が出力されるπ θ ( ⋅ | o t ) {\displaystyle \pi _{\theta }(\cdot |o_{t})} それは専門家の行動分布とほぼ同じである。[ 13 ]
BCは分布シフト の影響を受けやすい。具体的には、訓練されたポリシーが専門家のポリシーと異なる場合、専門家の軌跡から逸脱し、専門家の軌跡では決して起こらなかったであろう観測結果に至る可能性がある。[ 13 ]
これはALVINN によって既に指摘されており、彼らは人間のデモンストレーションを使用してバンを運転するニューラルネットワークを訓練しました。彼らは、人間のドライバーは決して経路から大きく外れないため、ネットワークは経路から大きく外れた場合にどのような行動を取るべきかを訓練されないことに気づきました。[ 6 ]
意思決定変換器のアーキテクチャ図 Decision Transformerアプローチは、強化学習をシーケンスモデリング問題としてモデル化します。[ 15 ] ビヘイビアクローニングと同様に、ロールアウトシーケンスをモデル化するTransformer などのシーケンスモデルをトレーニングします。( R 1 、 o 1 、 1 1 ) 、 ( R 2 、 o 2 、 1 2 ) 、 … 、 ( R t 、 o t 、 1 t ) 、 {\displaystyle (R_{1},o_{1},a_{1}),(R_{2},o_{2},a_{2}),\dots ,(R_{t},o_{t},a_{t}),} どこR t = r t + r t + 1 + ⋯ + r T {\displaystyle R_{t}=r_{t}+r_{t+1}+\dots +r_{T}} これは、ロールアウトにおける将来の報酬の合計です。トレーニング時間中、シーケンスモデルは各アクションを予測するようにトレーニングされます。1 t {\displaystyle a_{t}} 前回の展開を背景として:( R 1 、 o 1 、 1 1 ) 、 ( R 2 、 o 2 、 1 2 ) 、 … 、 ( R t 、 o t ) {\displaystyle (R_{1},o_{1},a_{1}),(R_{2},o_{2},a_{2}),\dots ,(R_{t},o_{t})} 推論時、シーケンスモデルを効果的なコントローラとして使用するには、単純に非常に高い報酬予測を与えるだけでよい。R {\displaystyle R} そして、高い報酬をもたらす行動を予測することで一般化します。これは、 41のアタリゲーム で超人的な10億のパラメータを持つトランスフォーマーに予測通りに拡張できる ことが示されました。[ 16 ]
その他のアプローチ その他の例については[ 17 ] [ 18 ] を参照してください。
逆強化学習 (IRL)は、専門家の行動を説明する報酬関数を学習し、その後、強化学習を使用してこの報酬を最大化する方策を見つけます。[ 19 ] 最近の研究では、ネットワークシステムにおけるIRLのマルチエージェント拡張も検討されています。[ 20 ]
生成敵対的模倣学習(GAIL)は、生成敵対ネットワーク (GAN)を使用して、エージェントの行動の分布を専門家のデモンストレーションの分布に一致させます。[ 21 ] これは、ゲーム理論を使用した以前のアプローチを拡張したものです。[ 22 ] [ 17 ]
さらに読む Hussein, Ahmed; Gaber, Mohamed Medhat; Elyan, Eyad; Jayne, Chrisina (2018-03-31). "模倣学習: 学習方法の概観" . ACM Computing Surveys . 50 (2): 1– 35. doi : 10.1145/3054912 . hdl : 10059/2298 . ISSN 0360-0300 .
参考文献 ↑ Wei, Yusi; Arvin, Farshad; Hu, Junyan (2026). "自律走行におけるロバストな軌道追跡のためのリアプノフ制約付き行動クローニング". IEEE Transactions on Vehicular Technology . doi : 10.1109/TVT.2026.3682470 . ↑ Russell, Stuart J.; Norvig, Peter (2021). "22.6 徒弟制度と逆強化学習". 人工知能:現代的アプローチ . Pearson 人工知能シリーズ (第 4 版). Hoboken: Pearson. ISBN 978-0-13-461099-3 。↑ サットン、リチャード S.、バート、アンドリュー G. (2018). 強化学習入門 . 適応計算と機械学習シリーズ(第 2 版). マサチューセッツ州ケンブリッジ: MIT Press. p. 470. ISBN 978-0-262-03924-6 。↑ Hussein, Ahmed; Gaber, Mohamed Medhat; Elyan, Eyad; Jayne, Chrisina (2017-04-06). "模倣学習: 学習方法の概観" . ACM Comput. Surv . 50 (2): 21:1–21:35. doi : 10.1145/3054912 . hdl : 10059/2298 . ISSN 0360-0300 . ↑ 「第21章 - 模倣学習」 。underactuated.mit.edu 。 2024年8月8 日 取得 。 1 2 Pomerleau, Dean A. (1988). "ALVINN: ニューラルネットワークによる自律型陸上車両" . ニューラル情報処理システムの進歩 . 1 . Morgan-Kaufmann. ↑ Bojarski, Mariusz; Del Testa, Davide; Dworakowski, Daniel; Firner, Bernhard; Flepp, Beat; Goyal, Prasoon; Jackel, Lawrence D.; Monfort, Mathew; Muller, Urs (2016-04-25). "End to End Learning for Self-Driving Cars". arXiv : 1604.07316v1 [ cs.CV ]. ↑ Kiran, B Ravi; Sobh, Ibrahim; Talpaert, Victor; Mannion, Patrick; Sallab, Ahmad A. Al; Yogamani, Senthil; Perez, Patrick (2022年6月)。「自動運転のための深層強化学習:概説」 。IEEE Transactions on Intelligent Transportation Systems。23 ( 6 ) : 4909–4926。arXiv : 2002.00444。Bibcode : 2022ITITr..23.4909K。doi : 10.1109 / TITS.2021.3054625。ISSN 1524-9050 。 ↑ Giusti, Alessandro; Guzzi, Jerome; Ciresan, Dan C.; He, Fang-Lin; Rodriguez, Juan P.; Fontana, Flavio; Faessler, Matthias; Forster, Christian; Schmidhuber, Jurgen; Caro, Gianni Di; Scaramuzza, Davide; Gambardella, Luca M. (2016年7月). "移動ロボットのための森林トレイルの視覚的認識への機械学習アプローチ" (PDF) . IEEE Robotics and Automation Letters . 1 (2): 661– 667. Bibcode : 2016IRAL....1..661G . doi : 10.1109/LRA.2015.2509024 . ISSN 2377-3766 . ↑ 「自律型ヘリコプター:スタンフォード大学AIラボ」 . heli.stanford.edu . 2024年8月8日 取得 。 ↑ 中西淳;森本 淳;遠藤元;チェン、ゴードン。シャール、ステファン。川人光男(2004年6月) 「二足歩行のデモンストレーションと適応から学ぶ」 。 ロボット工学と自律システム 。 47 ( 2–3 ): 79–91 . 土井 : 10.1016/j.robot.2004.03.003 。 ↑ カラクリシュナン、ムリナル。ブフリ、ジョナス。牧師、ピーター。シャール、ステファン(2009 年 10 月)。 「地形テンプレートを使用した起伏の多い地形での移動の学習」 。 2009 年知能ロボットおよびシステムに関する IEEE/RSJ 国際会議 。 IEEE。 pp. 167–172 . doi : 10.1109/iros.2009.5354701 。 ISBN 978-1-4244-3803-7 。1 2 3 カリフォルニア大学バークレー校 CS 285: 深層強化学習。講義2: 行動の教師あり学習 ↑ Ross, Stephane; Gordon, Geoffrey; Bagnell, Drew (2011-06-14). "模倣学習と構造化予測を後悔のないオンライン学習に還元する" . Proceedings of the Fourteenth International Conference on Artificial Intelligence and Statistics . JMLR Workshop and Conference Proceedings: 627–635 . ↑ Chen, Lili; Lu, Kevin; Rajeswaran, Aravind; Lee, Kimin; Grover, Aditya; Laskin, Misha; Abbeel, Pieter; Srinivas, Aravind; Mordatch, Igor (2021). "Decision Transformer: Reinforcement Learning via Sequence Modeling" . Advances in Neural Information Processing Systems . 34 . Curran Associates, Inc.: 15084– 15097. arXiv : 2106.01345 . ↑ Lee, Kuang-Huei; Nachum, Ofir; Yang, Mengjiao; Lee, Lisa; Freeman, Daniel; Xu, Winnie; Guadarrama, Sergio; Fischer, Ian; Jang, Eric (2022-10-15), Multi-Game Decision Transformers , arXiv : 2205.15241 1 2 Hester, Todd; Vecerik, Matej; Pietquin, Olivier; Lanctot, Marc; Schaul, Tom; Piot, Bilal; Horgan, Dan; Quan, John; Sendonaris, Andrew (2017-04-12). "Deep Q-learning from Demonstrations". arXiv : 1704.03732v4 [ cs.AI ]. ↑ Duan, Yan; Andrychowicz, Marcin; Stadie, Bradly; Jonathan Ho, OpenAI; Schneider, Jonas; Sutskever, Ilya; Abbeel, Pieter; Zaremba, Wojciech (2017). "One-Shot Imitation Learning" . Advances in Neural Information Processing Systems . 30 . Curran Associates, Inc. ↑ A, Ng (2000). "逆強化学習のためのアルゴリズム" . 第17回国際機械学習会議議事録、2000年 : 663–670 。 ↑ VS Donge、B. Lian、FL Lewis、A. Davoudi、「逆強化学習を用いたマルチエージェントグラフィカルゲーム」、IEEE Transactions on Control of Network Systems、vol. 10、no. 2、pp. 841-852、2023年6月、doi:10.1109/TCNS.2022.3210856。 ↑ Ho, Jonathan; Ermon, Stefano (2016). "Generative Adversarial Imitation Learning" . Advances in Neural Information Processing Systems . 29 . Curran Associates, Inc. arXiv : 1606.03476 . ↑ Syed, Umar; Schapire, Robert E (2007). "見習い学習へのゲーム理論的アプローチ" . Advances in Neural Information Processing Systems . 20 . Curran Associates, Inc.