深層強化学習(ディープRL )は、強化学習(RL)と深層学習を組み合わせた機械学習のサブフィールドです。RLは、計算エージェントが試行錯誤によって意思決定を学習するという問題を扱います。ディープRLは、深層学習をソリューションに組み込むことで、エージェントが状態空間を手動で設計することなく、非構造化入力データから意思決定を行えるようにします。ディープRLアルゴリズムは、非常に大きな入力(たとえば、ビデオゲームで画面にレンダリングされるすべてのピクセル)を受け取り、目的(たとえば、ゲームスコアの最大化)を最適化するために実行すべきアクションを決定できます。深層強化学習は、ロボット工学、ビデオゲーム、自然言語処理、コンピュータビジョン[ 1 ]、教育、輸送、金融、ヘルスケア[ 2 ]など、さまざまなアプリケーションで使用されています。

ディープラーニングは、人工ニューラルネットワークを介して入力のセットを出力のセットに変換する機械学習の一種です。ラベル付きデータセットを用いた教師あり学習を多用するディープラーニング手法は、従来の手法よりも手動による特徴エンジニアリングを少なくして、複雑で高次元の生入力データ(画像など)を扱うタスクを解決できることが示されており、コンピュータビジョンや自然言語処理など、いくつかの分野で大きな進歩をもたらしています。過去10年間、ディープRLは、囲碁、Atari Games、Dota 2などのシングルプレイヤーおよびマルチプレイヤーゲームからロボット工学まで、さまざまな問題で目覚ましい成果を上げています。[ 3 ]

強化学習とは、エージェントが試行錯誤を通して意思決定を学習するプロセスです。この問題は、多くの場合、マルコフ決定過程(MDP)として数学的にモデル化され、エージェントは各タイムステップで状態にあるとされます。行動を起こすスカラー報酬を受け取り、次の状態に遷移する環境のダイナミクスに応じてエージェントはポリシーを学習しようと試みるまたは、観測から行動へのマッピングを行い、その報酬(期待される報酬の合計)を最大化します。強化学習(最適制御とは対照的に)では、アルゴリズムは動態のみにアクセスできます。サンプリングを通じて。
多くの実際的な意思決定問題において、MDP は高次元 (例えば、カメラからの画像やロボットからの生のセンサー ストリーム) であり、従来の強化学習アルゴリズムでは解くことができません。深層強化学習アルゴリズムは、このような MDP を解くために深層学習を取り入れており、多くの場合、方策を表します。あるいは、ニューラルネットワークとして他の学習機能を活用し、この環境で優れた性能を発揮する特殊なアルゴリズムを開発する。
1980年代半ばからニューラルネットワークへの関心が高まるにつれ、強化学習においてニューラルネットワークを用いて方策や価値関数を表現する深層強化学習への関心も高まった。このようなシステムでは、ロボットやエージェントのセンサーからモーターに至るまでの意思決定プロセス全体が単一のニューラルネットワークによって行われるため、エンドツーエンド強化学習と呼ばれることもある。[ 4 ]ニューラルネットワークを用いた強化学習の最初の成功例の一つは、 1992年にバックギャモンをプレイするために開発されたコンピュータプログラムTD-Gammonである。[ 5 ]盤上の特定の位置にある特定の色の駒の数を表す4つの入力が使用され、合計198個の入力信号があった。ゼロ知識を組み込んだネットワークは、自己プレイとTD()。
サットンとバルトによる強化学習に関する先駆的な教科書[ 6 ] 、ベルツェカスとツィティクリスによる神経動的プログラミングに関する教科書[ 7 ] 、その他[ 8 ]は、この分野の知識と関心を高めた。
柴田勝成のグループは、この枠組みの中で、画像認識、色恒常性、センサーの動き(能動的認識) 、手と目の協調と手の到達運動、脳活動の説明、知識の伝達、記憶、 [ 12 ]選択的注意、予測、探索など、さまざまな機能が現れることを示した。 [ 9 ] [10] [ 11 ]
2012年頃から始まった、いわゆるディープラーニング革命により、様々な分野で関数近似器として深層ニューラルネットワークを利用することへの関心が高まりました。これにより、既存の強化学習アルゴリズムに存在する方策関数、価値関数、および/またはQ関数を学習するために深層ニューラルネットワークを用いる研究者への関心が再び高まりました。
2013 年頃から、DeepMind はディープ RL を使用してAtari のビデオ ゲームをプレイするという印象的な学習結果を示しました。 [ 14 ] [ 15 ]コンピュータ プレイヤーは、ディープ RL アルゴリズムを使用してトレーニングされたニューラル ネットワーク、つまりディープ Q ネットワーク (DQN) と呼ばれるQ 学習のディープ バージョンを使用し、ゲーム スコアを報酬としています。入力として 4 フレームの RGB ピクセル (84x84) を処理するために、ディープ畳み込みニューラル ネットワークを使用しました。49 のゲームすべてが同じネットワーク アーキテクチャを使用して最小限の事前知識で学習され、ほぼすべてのゲームで競合手法を上回り、プロの人間のゲーム テスターと同等またはそれ以上のレベルでパフォーマンスを発揮しました。[ 15 ]
深層強化学習は、2015 年に別のマイルストーンを達成しました。深層強化学習で囲碁をプレイするように訓練されたコンピュータ プログラム AlphaGo [ 16 ] が、19×19 のフルサイズの盤でハンディキャップなしで人間のプロ囲碁プレイヤーに勝った最初のコンピュータ囲碁プログラムとなったのです。2017 年の次のプロジェクトでは、AlphaZero が囲碁のパフォーマンスを向上させると同時に、同じアルゴリズムを使用してチェスと将棋を、これらのゲームの既存のコンピュータ プログラムと同等またはそれ以上のレベルでプレイすることを学習できることも実証し、2019 年にMuZeroで再び向上しました。[ 17 ]また、カーネギー メロン大学の研究者たちは、 2019 年にポーカーをプレイするコンピュータ プログラムPluribusを開発し、ノーリミットテキサス ホールデムのマルチプレイヤー ゲームでプロに勝った最初のプログラムとなったことで、別のマイルストーンを達成しました。5対 5 のDota 2をプレイするプログラムOpenAI Fiveは、 2019 年のデモ マッチで以前の世界チャンピオンに勝ちました。
深層強化学習は、ゲーム以外の多くの分野にも応用されています。ロボット工学では、ロボットが簡単な家事を行うようにしたり[ 18 ]、ロボットハンドでルービックキューブを解くようにしたりするために使用されています。[ 19 ] [ 20 ]深層強化学習は、データセンターのエネルギー消費を削減するために、持続可能性の応用も見出されています。[ 21 ]自動運転のための深層強化学習は、学術界と産業界で活発に研究されている分野です。[ 22 ] Loonは、高高度気球の自律航行のために深層強化学習を研究しました。[ 23 ]
深層強化学習アルゴリズムを用いてタスクを解決するためのポリシーを訓練する手法は様々あり、それぞれに利点がある。最も基本的なレベルでは、モデルベース強化学習とモデルフリー強化学習という区別があり、これはアルゴリズムが環境ダイナミクスの順方向モデルを学習しようとするかどうかを指す。
モデルベースの深層強化学習アルゴリズムでは、環境ダイナミクスの順方向モデルが、通常はニューラルネットワークを用いた教師あり学習によって推定されます。次に、学習されたモデルを用いたモデル予測制御によって行動が決定されます。実際の環境ダイナミクスは学習されたダイナミクスと乖離することが多いため、エージェントは環境内で行動を実行する際に頻繁に再計画を行います。選択された行動は、交差エントロピー法などのモンテカルロ法、あるいはモデル学習とモデルフリー法の組み合わせを用いて最適化される場合があります。
モデルフリー深層強化学習アルゴリズムでは、ポリシー順方向のダイナミクスを明示的にモデル化することなく学習されます。方策は、方策勾配を直接推定することで報酬を最大化するように最適化できますが[ 24 ]、分散が大きいため、深層強化学習における関数近似には実用的ではありません。その後、より安定した学習のためのアルゴリズムが開発され、広く応用されています。[ 25 ] [ 26 ]モデルフリーの深層強化学習アルゴリズムのもう1つのクラスは、時間差学習とQ学習に触発された動的計画法に依存しています。離散的な行動空間では、これらのアルゴリズムは通常、ニューラルネットワークのQ関数を学習します。行動を起こした場合の将来の収益を推定する州から[ 14 ]連続空間では、これらのアルゴリズムはしばしば値推定と方策の両方を学習します。[ 27 ] [ 28 ] [ 29 ]
深層強化学習は活発な研究分野であり、複数の研究方向が存在する。
RLエージェントは、探索と活用のトレードオフのバランスを取る必要があります。これは、すでに高い報酬が得られることがわかっている行動を追求するか、より高い報酬を発見するために他の行動を探索するかを決定する問題です。RLエージェントは通常、離散行動空間におけるボルツマン分布や連続行動空間におけるガウス分布などの何らかの確率的ポリシーでデータを収集し、基本的な探索行動を誘発します。新規性に基づく、または好奇心に基づく探索の背後にある考え方は、エージェントに未知の結果を探索して最良のソリューションを見つける動機を与えることです。これは、「探索を促す項を追加することによって損失関数(またはネットワークアーキテクチャ)を修正する」ことによって行われます。[ 30 ]エージェントは、成功した軌跡のデモンストレーションを利用したり、報酬シェーピングを利用したりすることによって探索を支援されることもあります。報酬シェーピングとは、エージェントが完了しようとしているタスクに合わせてカスタマイズされた中間報酬を与えることです。[ 31 ]
強化学習における重要な区別は、データ収集を行うポリシーを評価または改善する必要のあるオンポリシーアルゴリズムと、任意のポリシーによって生成されたデータからポリシーを学習できるオフポリシーアルゴリズムとの違いです。一般的に、Q学習などの価値関数ベースの手法はオフポリシー学習に適しており、サンプル効率も優れています。学習に必要なデータ量が削減されるのは、学習にデータが再利用されるためです。極端な例として、オフライン(または「バッチ」)強化学習では、環境との追加的な相互作用なしに、固定データセットからポリシーを学習します。
逆強化学習とは、エージェントの行動に基づいてエージェントの報酬関数を推論することを指します。逆強化学習は、デモンストレーションからの学習(または徒弟学習)に、デモンストレーターの報酬を推論し、その後、強化学習で報酬を最大化するポリシーを最適化することによって使用できます。ディープラーニングのアプローチは、さまざまな形式の模倣学習と逆強化学習に使用されています。[ 32 ]
もう一つの活発な研究分野は、目標条件付きポリシー(文脈ポリシーまたは普遍ポリシーとも呼ばれる)の学習である。追加の目標を取り入れるエージェントに望ましい目標を伝えるための入力として使用されます。[ 33 ]後知恵経験再生は、タスクを完了するための過去の失敗した試みを保存して学習する、目標条件付き強化学習の手法です。[ 34 ]失敗した試みは意図した目標に到達しなかったかもしれませんが、後知恵による再ラベル付けによって意図しない結果を達成する方法の教訓として役立ちます。
強化学習の多くの応用例では、単一のエージェントだけでなく、複数のエージェントが共に学習し、相互に適応する仕組みが用いられています。これらのエージェントは、多くのゲームのように競争的な場合もあれば、現実世界の多くのマルチエージェントシステムのように協調的な場合もあります。マルチエージェント強化学習は、このような状況で生じる問題を研究する分野です。
強化学習で深層学習ツールを使用する利点は汎化、つまりこれまで見たことのない入力に対しても正しく動作する能力です。たとえば、画像認識用に訓練されたニューラルネットワークは、その特定の画像やその特定の鳥を見たことがなくても、その画像に鳥が含まれていることを認識できます。深層強化学習では生データ(ピクセルなど)を入力として使用できるため、環境を事前に定義する必要性が少なくなり、モデルを複数のアプリケーションに汎化できます。この抽象化レイヤーにより、深層強化学習アルゴリズムは汎用的に設計でき、同じモデルをさまざまなタスクに使用できます。[ 35 ]深層強化学習ポリシーで訓練されたポリシーの汎化能力を高める方法の1つは、表現学習を組み込むことです。[ 36 ]
金融意思決定のための深層強化学習
金融問題、特にポートフォリオ最適化に深層強化学習を用いる研究がますます増えている。現代ポートフォリオ理論(MPT)のような従来のアプローチは、リスクとリターンのバランスを取るために平均分散最適化に依存している。しかし、それらは変動の激しい市場で必要とされる適応性に欠けることが多い。一方、深層強化学習は、マルコフ決定過程(MDP)や部分観測マルコフ決定過程(POMDP)などのフレームワークを用いて、問題を動的な意思決定プロセスとして再定義する。
このアプローチにより、深層強化学習エージェントは市場と継続的に相互作用し、変化するデータに基づいて長期的な収益を最大化するための意思決定を行うことができます。状態空間や行動空間、報酬関数、ポリシー最適化手法など、深層強化学習モデルの重要な構成要素は、この適応性において重要な役割を果たします。深層決定論的ポリシー勾配(DDPG)や近接ポリシー最適化(PPO)などのモデルは、連続的な行動空間への適用と金融市場の複雑さに対処する可能性において際立っています。[ 37 ] [ 38 ] [ 39 ]
金融問題の分野における深層強化学習の実装は、依然として発展途上の研究分野である。