ゲーム理論では、動き、行動、またはプレイとは、最適な結果が自分の行動だけでなく他のプレイヤーの行動にも依存する状況において、プレイヤーが選択できるオプションのいずれかを指します。 [ 1 ]この分野は主に、ゲームにおけるプレイヤーの行動が他のプレイヤーの行動に影響を与えることを扱います。ゲームの例としては、チェス、ブリッジ、ポーカー、モノポリー、ディプロマシー、バトルシップなどがあります。[ 2 ]
戦略という用語は、一般的に、ゲームをプレイするための完全なアルゴリズムを意味し、あらゆる状況においてプレイヤーが何をすべきかを指示するものです。プレイヤーの戦略は、ゲームのどの段階でプレイヤーが取る行動を決定します。しかし、ほとんどのゲームでは、動きと純粋な戦略が対応しているため、戦略の概念は動きや行動の概念と混同されることがよくあります。つまり、任意の動きXに対して、「常に動きXを行う」は有効な戦略の一例であり、結果として、すべての動きを戦略とみなすこともできます。一方、戦略を行動とは異なる種類のものとして扱い、したがって区別する著者もいます。
「戦略」を方向性のリスト、そして「行動」を方向性のリストにおける単一のターンと考えると理解しやすいでしょう。この戦略は、各行動の報酬または結果に基づいています。各エージェントの目標は、競合相手の行動に基づいて自身の報酬を検討することです。たとえば、競合相手Aは、競合相手Bが市場に参入すると想定できます。そこから、競合相手Aは参入した場合と参入しない場合で得られる報酬を比較します。次のステップは、競合相手Bが参入しないと想定し、競合相手Aが参入するかしないかに基づいてどちらの報酬が良いかを検討することです。この手法により、プレイヤーが競合相手の行動に関係なく報酬を最大化するために取ることができる行動を特定できる支配戦略を特定できます。
戦略プロファイル(戦略組み合わせとも呼ばれる)とは、ゲーム内のすべてのプレイヤーの行動を完全に規定する、プレイヤー全員の戦略の集合である。戦略プロファイルには、各プレイヤーにつき必ず1つの戦略のみを含めなければならない。
プレイヤーの戦略セットとは、そのプレイヤーが実行可能な戦略を定義するものです。
プレイヤーが選択できる戦略が複数ある場合、そのプレイヤーは有限の戦略セットを持つと言えます。例えば、じゃんけんゲームでは、各プレイヤーは1回ずつ手を打ちます。そして、各プレイヤーは相手の手を知らずに、相手の手に対する反応としてではなく、自分の手を打ちます。したがって、各プレイヤーは有限の戦略セット{じゃんけん}を持つことになります。
それ以外の場合、戦略集合は無限になります。例えば、ケーキカットゲームでは、戦略集合{ケーキの0%から100%の間で任意の場所を切る}の中に、限定された連続的な戦略が存在します。
動的ゲーム、つまり一定期間にわたってプレイされるゲームでは、戦略セットは、プレイヤーがロボットやエージェントにゲームのプレイ方法に関して与えることができる可能なルールの集合で構成されます。例えば、最後通牒ゲームでは、2番目のプレイヤーの戦略セットは、どの提案を受け入れ、どの提案を拒否するかに関するすべての可能なルールで構成されます。
ベイズゲーム、つまりプレイヤー同士が互いについて不完全な情報しか持たないゲームでは、戦略セットは動的ゲームにおける戦略セットと類似している。それは、考えられるあらゆる私的情報に対してどのような行動を取るべきかを定めたルールから構成される。
応用ゲーム理論において、戦略集合の定義は、ゲームを解決可能かつ意味のあるものにするための重要な要素である。ゲーム理論家は、全体的な問題、すなわち2人以上のプレイヤー間の摩擦に関する知識を利用して、戦略空間を制限し、解決を容易にすることができる。
例えば、厳密に言えば最後通牒ゲームでは、プレイヤーは次のような戦略をとることができます。($1, $3, $5, ..., $19) のオファーを拒否し、($0, $2, $4, ..., $20) のオファーを受け入れる。このような戦略をすべて含めると、戦略空間が非常に大きくなり、やや難しい問題になります。ゲーム理論家は、代わりに戦略セットを次のように制限できると考えるかもしれません。{ x ≤ のオファーを拒否し、 xより大きいオファーを受け入れる。ただし、x は($0, $1, $2, ..., $20) の範囲内}。
純粋戦略とは、ゲームにおけるあらゆる状況下でプレイヤーがどのように行動するかを、完全かつ決定論的に計画したものです。プレイヤーが持つあらゆる情報に基づき、各意思決定ポイントでどのような行動を取るかを正確に規定します。プレイヤーの戦略セットは、プレイヤーが選択可能なすべての純粋戦略から構成されます。
混合戦略とは、純粋戦略の集合に対する確率分布のことです。プレイヤーは単一の行動方針に固執するのではなく、指定された確率に従って純粋戦略の中からランダムに選択します。混合戦略は、純粋戦略が最適反応とならないゲームにおいて特に有効であり、プレイヤーが予測可能な行動をとることを避けることができます。結果は確率に依存するため、得られる報酬は期待報酬と呼ばれます。
純粋戦略は、混合戦略の特殊なケースと見なすことができる。つまり、単一の純粋戦略が確率1で選択され、他のすべての純粋戦略が確率0で選択されるケースである。
完全混合戦略とは、プレイヤーの戦略セットに含まれるすべての純粋戦略に厳密に正の確率が割り当てられる混合戦略のことです。つまり、どの純粋戦略も除外されたり、確率がゼロでプレイされたりすることはありません。これは、プレイヤーがすべての選択肢をランダムに選択し、どれか一つを完全に除外することはないことを意味します。完全混合戦略は、プレイヤーが時折小さなミスを犯すという考え方をモデル化する「震える手完全均衡」のような高度なゲーム理論の概念において重要です。この文脈では、最適ではない戦略であってもすべての戦略に正の確率を割り当てることで、プレイヤーが意思決定における小さな「震え」のために最終的にそれらの戦略を選択する可能性を捉えることができます。
サッカーのペナルティキックでは、キッカーはゴールの右側か左側のどちらに蹴るかを選択しなければならず、同時にゴールキーパーはどちらの方向にブロックするかを決めなければなりません。また、キッカーには得意なシュート方向があり、右利きの場合は左です。サッカーのゲームのマトリックスはこの状況を示しており、Chiappori、Levitt、およびGroseclose(2002)によって研究されたゲームの簡略化された形式です。[ 3 ]ゴールキーパーの予想が正しければキックはブロックされ、両方のプレイヤーの基本利得は0に設定されていると想定しています。ゴールキーパーの予想が間違っていた場合、キックは左側(キッカーの利得は+2、ゴールキーパーの利得は-2)の方が右側(キッカーの利得は+1、ゴールキーパーの利得は-1)よりもゴールに入る可能性が高くなります。
このゲームには純粋戦略均衡が存在しない。なぜなら、どちらかのプレイヤーが戦略のプロファイルから逸脱するからである。例えば、(左、左)は均衡ではない。なぜなら、キッカーは右に逸脱し、利得を0から1に増やすからである。
キッカーの混合戦略均衡は、左キックと右キックの利得が完全に等しくない限り、キッカーがランダム化から逸脱するという事実から求められます。ゴールキーパーが確率 g で左に傾く場合、左キックからのキッカーの期待利得は g(0) + (1-g)(2) であり、右キックからの期待利得は g(1) + (1-g)(0) です。これらを等しくすると、g = 2/3 となります。同様に、ゴールキーパーは、キッカーが混合戦略確率 k を選択し、左に傾く場合の利得 k(0) + (1-k)(-1) が右に傾く場合の利得 k(-2) + (1-k)(0) と等しくなる場合にのみランダム化を行う意思があります。したがって、k = 1/3 となります。したがって、混合戦略均衡は (Prob(Kick Left) = 1/3, Prob(Lean Left) = 2/3) となります。
均衡状態では、キッカーは自分の得意な方向にキックする確率が3分の1に過ぎません。これは、ゴールキーパーがその方向をより多く守っているためです。また、均衡状態では、キッカーはどちらの方向にキックしても構わないのですが、均衡状態を維持するためには、正確に3分の1の確率でキックする必要があります。
キアッポリ、レヴィット、グロスクローズは、キッカーが得意な側にキックすることの重要性を測定し、センターキックなどを加え、プロの選手が実際にどのように行動するかを調べた。その結果、キッカーは45%の確率で得意な側にキックし、ゴールキーパーは57%の確率で得意な側にキックするということがわかった。彼らの論文は、現実世界で人々がどのように混合戦略を用いるかを示す例としてよく知られている。
ジョン・フォーブス・ナッシュは、有名な論文の中で、すべての有限ゲームには均衡が存在することを証明しました。ナッシュ均衡は2種類に分けられます。純粋戦略ナッシュ均衡とは、すべてのプレイヤーが純粋戦略でプレイしているナッシュ均衡です。混合戦略ナッシュ均衡とは、少なくとも1人のプレイヤーが混合戦略でプレイしている均衡です。ナッシュはすべての有限ゲームにナッシュ均衡が存在することを証明しましたが、すべてのゲームに純粋戦略ナッシュ均衡が存在するわけではありません。純粋戦略でナッシュ均衡が存在しないゲームの例としては、「マッチングペニー」を参照してください。しかし、多くのゲームには純粋戦略ナッシュ均衡が存在します(例:協調ゲーム、囚人のジレンマ、鹿狩り)。さらに、ゲームには純粋戦略均衡と混合戦略均衡の両方が存在する場合があります。簡単な例として、純粋協調ゲームがあります。このゲームでは、純粋戦略(A,A)と(B,B)に加えて、両方のプレイヤーが確率1/2でどちらかの戦略をプレイする混合均衡が存在します。
1980年代には、混合戦略の概念は、弱いナッシュ均衡であり、プレイヤーは均衡戦略の確率に従うか、他の確率に逸脱するかについて無関心であるため、「直感的に問題がある」として激しく批判された。[ 4 ] [ 5 ]ゲーム理論家のアリエル・ルービンシュタインは、この概念を理解するための別の方法を説明している。1つ目は、ハーサニー(1973)によるもので、[ 6 ]浄化と呼ばれ、混合戦略の解釈は、プレイヤーの情報と意思決定プロセスに関する知識の欠如を反映しているにすぎないと仮定している。一見ランダムな選択は、指定されていない、利得とは無関係な外生的要因の結果と見なされる。[ 5 ] 2つ目の解釈では、ゲームプレイヤーはエージェントの大規模な集団を表していると想定している。各エージェントは純粋戦略を選択し、利得は各戦略を選択するエージェントの割合に依存する。したがって、混合戦略は、各集団によって選択された純粋戦略の分布を表す。しかし、これはプレイヤーが個人エージェントである場合の正当化にはならない。
その後、AumannとBrandenburger(1995)[ 7 ]は、ナッシュ均衡を行動ではなく信念の均衡として再解釈した。例えば、じゃんけんでは、信念の均衡では、各プレイヤーが相手がどちらの戦略を取る可能性も等しいと信じていることになる。しかし、この解釈はナッシュ均衡の記述力を弱める。なぜなら、このような均衡では、各プレイヤーがゲームの各プレイで実際に純粋戦略であるグーを取ることが可能であり、時間の経過とともに確率は混合戦略の確率になるからである。
混合戦略は純粋戦略に対する確率分布を割り当てるのに対し、行動戦略(または行動的戦略)は各情報セットにおいて可能な行動の集合に対する確率分布を割り当てます。この2つの概念は標準形ゲームの文脈では非常に密接に関連していますが、展開形ゲームでは全く異なる意味を持ちます。大まかに言えば、混合戦略はゲームツリーを通して決定論的なパスをランダムに選択するのに対し、行動戦略は確率的なパスと見なすことができます。混合戦略と行動戦略の関係は、従来のゲーム理論的仮説に対する行動的視点であるクーンの定理の対象となっています。この定理は、完全記憶を持つ任意の有限展開形ゲームにおいて、任意のプレイヤーと任意の混合戦略に対して、他のプレイヤーのあらゆる戦略プロファイルに対して、混合戦略と同じ終端ノード上の分布を誘導する行動戦略が存在することを示しています。逆もまた真です。
完全な記憶が等価性に必要とされる理由を示す有名な例として、PiccioneとRubinstein(1997)による「うっかりドライバー」ゲームが挙げられる。
結果等価性とは、プレイヤー i の混合戦略と行動戦略を、プレイヤー i の対戦相手の純粋戦略と関連付けたものです。結果等価性とは、プレイヤー i が取る任意の混合戦略と行動戦略に対して、プレイヤー i の対戦相手が取る任意の純粋戦略に対応して、混合戦略と行動戦略の結果分布が等しくなければならない状況として定義されます。この等価性は、次の式で表すことができます。(Q^(U(i), S(-i)))(z) = (Q^(β(i), S(-i)))(z)、ここで U(i) はプレイヤー i の混合戦略、β(i) はプレイヤー i の行動戦略、S(-i) は対戦相手の戦略を表します。[ 8 ]
完全記憶とは、ゲームをプレイしているすべてのプレイヤーが、ゲーム内での過去のすべての行動を記憶し、想起できる能力と定義されます。完全記憶は等価性のために必要であり、不完全な記憶を伴う有限ゲームでは、プレイヤーIの混合戦略が存在し、それに対して同等の行動戦略は存在しません。これは、 PiccioneとRubinsteinによって定式化された「うっかり者の運転手」ゲームで完全に説明されています。簡単に言うと、このゲームは、高速道路の2番目の出口から家に戻る必要があるものの、どの交差点に到着したかを覚えていない、不完全な記憶を持つ運転手の意思決定に基づいています。図[2]はこのゲームを示しています。
完全な情報がない場合(つまり、不完全な情報の場合)、プレイヤーは、それ以前の決定を知らないまま、各決定ノードで選択を行います。したがって、プレイヤーの混合戦略は、行動戦略では得られない結果を生み出すことができ、その逆もまた然りです。これは、うっかり者のドライバーゲームで実証されています。完全な記憶と情報がある場合、ドライバーは、交差点(または決定ノード)に到着したときに自分がどの交差点にいるかを認識しているため、[続行、終了]という単一の純粋戦略を持ちます。一方、計画最適段階のみを見ると、最大の報酬は両方の交差点で続行することで得られ、p=2/3(参照)で最大化されます。この単純な1人用ゲームは、結果の等価性にとって完全な記憶が重要であること、およびそれが通常形式および拡張形式ゲームに与える影響を示しています。[ 9 ]