アクションモデル学習(略してアクション学習とも呼ばれる)は、ソフトウェアエージェントが自身の環境内で実行可能なアクションの効果と前提条件に関する知識を作成および変更することに関わる機械学習の一分野である。この知識は通常、論理ベースのアクション記述言語で表現され、自動プランナーへの入力として使用される。
目標が変わると、行動モデルの学習が重要になります。エージェントがしばらく行動すると、その領域での行動に関する蓄積された知識を使用して、より良い意思決定を行うことができます。したがって、行動モデルの学習は強化学習とは異なります。それは、世界での高価な試行の代わりに、行動について推論することを可能にします。[ 1 ]行動モデル学習は帰納的推論の一形態であり、エージェントの観察に基づいて新しい知識が生成されます。
行動モデル学習の一般的な動機は、プランナーのための行動モデルを手動で指定することが、多くの場合、困難で時間のかかる、エラーが発生しやすい作業であるという事実にある(特に複雑な環境では)。
トレーニングセットが与えられた場合例から成る、 どこ連続する2つの時間ステップにおける世界状態の観測値であるそしてタイムステップで観測されたアクションインスタンス一般的に、アクションモデル学習の目標はアクションモデルを構築することである。、 どここれは、 STRIPS、ADL、PDDLなどのアクション記述形式におけるドメインダイナミクスの記述であり、は、の要素上で定義された確率関数である。[ 2 ]しかし 、最先端のアクションラーニング手法の多くは決定論を前提としており、決定論に加えて、個々の手法は、ドメインの他の属性(例えば、部分的な観測可能性や感覚ノイズ)への対処方法においても異なっている。
最近のアクションラーニング手法は、さまざまなアプローチを採用し、人工知能と計算論理のさまざまな分野から幅広いツールを採用しています。命題論理に基づく手法の例として、エージェントの観測を使用して時間とともに長い命題式を構築し、その後充足可能性 (SAT) ソルバーを使用して解釈する SLAF (Simultaneous Learning and Filtering) アルゴリズム[ 1 ]を挙げることができます。学習を充足可能性問題 (この場合は重み付きMAX-SAT )に変換し、SAT ソルバーを使用する別の手法は、ARMS (Action-Relation Modeling System) [ 3 ]に実装されています。 アクションラーニングに対する相互に類似した、完全に宣言的な 2 つのアプローチは、論理プログラミング パラダイムAnswer Set Programming (ASP) [ 4 ]とその拡張である Reactive ASP [ 5 ]に基づいています。別の例では、ボトムアップの帰納的論理プログラミングアプローチが採用されました。[ 6 ]いくつかの異なるソリューションは、直接論理に基づいていません。例えば、パーセプトロンアルゴリズムを使用したアクションモデル学習[ 7 ]や、可能なアクションモデルの空間に対するマルチレベル貪欲探索[ 8 ]などがある。 1992年の古い論文[ 9 ]では、アクションモデル学習は強化学習の拡張として研究されていた。
しかしながら、異なる仮定の下で動作するアルゴリズムも存在します。FAMA [ 10 ]は、一部の観測データが欠落している場合でも機能し、一般的な(リフトされた)計画モデルを生成します。これは、行動モデルの学習を計画問題のように扱い、学習されたモデルが与えられた観測データと一致することを保証します。NOLAM [ 11 ]は、ノイズの多いデータや不完全なデータからでも一般的な行動モデルを学習できます。LOCM [ 12 ]は、データ内の行動の順序のみに焦点を当て、それらの行動間の状態に関する詳細を無視します。安全行動モデル(SAM)学習手法のファミリー[ 13 ]は、それらを使用して作成された計画が実際に現実世界で機能することを保証するモデルを作成します。数値条件と効果を持つ行動モデルを学習できるN-SAM [ 14 ]と呼ばれる拡張機能もあります。
さらに、N-SAMのような数値アクションモデルは、RAMPアルゴリズムを通じて強化学習(RL)のパフォーマンスを向上させるために使用できます。[ 15 ]
アクションラーニングに関する研究論文のほとんどは、人工知能全般に焦点を当てた学術誌や学会(例:Journal of Artificial Intelligence Research (JAIR)、Artificial Intelligence, Applied Artificial Intelligence (AAI)、AAAI学会など)で発表されています。アクションモデル学習は、これらのトピックに相互関連性があるにもかかわらず、International Conference on Automated Planning and Scheduling (ICAPS)のような計画関連の学会では通常取り上げられません。