Loading article…
逐次意思決定は制御理論とオペレーションズリサーチの概念であり、累積報酬の最大化やコストの最小化など、目的関数を最適化するために時間の経過とともに一連の意思決定を行うことを伴います。このフレームワークでは、現在の状態、利用可能なアクション、および状態遷移の確率的性質を考慮に入れながら、各意思決定が後続の選択とシステムの結果に影響を与えます。[1]このプロセスは、特に不確実性の下での動的システムのモデリングと調整に使用され、マルコフ決定プロセス(MDP)や動的計画法などの方法を使用して一般的に対処されます。[2]
