ゲーム理論において、囚人のジレンマは、 2人の合理的なエージェントが、相互利益のために協力するか、個人の利益のためにパートナーを裏切る(「裏切る」)かを選択できる思考実験である。このジレンマは、裏切ることは各エージェントにとって合理的であるにもかかわらず、協力することで各エージェントにとってより高い報酬が得られるという事実から生じる。このパズルは、 1950年にランド研究所で働いていたメリル・フラッドとメルビン・ドレッシャーによって考案された。[ 1 ]彼らは経済学者のアーメン・アルチアンと数学者のジョン・ウィリアムズを招き、100ラウンドのゲームをプレイしてもらい、アルチアンとウィリアムズがしばしば協力することを選択するのを観察した。結果について尋ねられたジョン・ナッシュは、反復版のゲームにおける合理的な行動は、1ラウンド版のゲームにおける合理的な行動とは異なる可能性があると述べた。この洞察は、ゲーム理論における重要な結果を予見していた。すなわち、協力は、1回の相互作用では合理的でない状況であっても、繰り返しの相互作用の中で生じる可能性があるということである。
アルバート・W・タッカーは後に、報酬を懲役刑に例えることで、このゲームを「囚人のジレンマ」と名付けた。[ 2 ]囚人のジレンマは、戦略的行動を伴う多くの現実世界の状況をモデル化している。日常的な用法では、「囚人のジレンマ」というラベルは、2つの主体が協力することで重要な利益を得るか、協力しないことで損害を被るが、選択を調整することが困難または費用がかかる状況に適用される。

このゲームの「典型的な現代版」は、ウィリアム・パウンドストーンの1993年の著書『囚人のジレンマ』に記述されている。
犯罪組織のメンバー2人が逮捕され、投獄された。囚人はそれぞれ独房に収容され、互いに話したりメッセージを交換したりする手段はない。警察は、主たる罪状で2人を有罪にするのに十分な証拠がないことを認めている。彼らは、より軽い罪状で2人とも懲役1年の刑を言い渡す予定だ。同時に、警察はそれぞれの囚人にファウスト的な取引を持ちかける。もし彼がパートナーに不利な証言をすれば、彼は釈放され、パートナーは主たる罪状で懲役3年の刑を受けることになる。ああ、もちろん、落とし穴がある…もし両方の囚人が互いに不利な証言をすれば、両方とも懲役2年の刑を言い渡される。囚人には少し考える時間が与えられるが、最終的な決断を下すまでは、相手が何を決めたのかを知ることは決して許されない。それぞれに、相手の囚人も全く同じ取引を持ちかけられていることが伝えられる。それぞれの囚人は、自分の身の安全、つまり自分の刑期を最小限にすることだけを考えている。[ 3 ]
これにより、囚人AとBには3つの異なる結果が考えられる。
2人の囚人は個別の部屋に隔離され、互いに連絡を取ることはできません。両方の囚人はゲームの性質を理解しており、互いに忠誠心はなく、ゲーム外で報復や報酬を得る機会もないものと想定されています。通常のゲームは以下に示されています。[ 4 ]
相手がどう決断しようとも、囚人はそれぞれ相手を裏切る(「寝返る」)ことでより高い報酬を得る。この推論は、両プレイヤーの最善の反応を分析することに基づいている。Bは協力するか寝返るかのどちらかである。Bが協力する場合、Aは寝返るべきである。なぜなら、1年間服役するよりも自由になる方が良いからである。Bが寝返る場合、Aも寝返るべきである。なぜなら、3年間服役するよりも2年間服役する方が良いからである。したがって、Bの戦略に関係なく、寝返ることがAの最善の反応であるため、どちらにしてもAは寝返るべきである。同様の推論により、Bが寝返るべきであることが示される。[ 5 ]
裏切りは常に協力よりも有利な結果をもたらすため、裏切りは両プレイヤーにとって厳密に支配的な戦略である。相互裏切りは、このゲームにおける唯一の強力なナッシュ均衡である。相互協力という集団的に理想的な結果は自己利益の観点からは非合理的であるため、このナッシュ均衡はパレート効率的ではない。[ 6 ]
伝統的な囚人のジレンマの構造は、元の囚人設定から一般化することができる。2人のプレイヤーを赤と青の色で表し、各プレイヤーが「協力」するか「裏切る」かを選択すると仮定する。
両方のプレイヤーが協力すれば、両方とも報酬を受け取ることができる。協力した場合。両方のプレイヤーが裏切った場合、両方とも罰則報酬を受け取ります。青が裏切り、赤が協力した場合、青は誘惑による報酬を受け取る。一方、レッドは「カモ」の報酬を受け取り、同様に、青が協力し赤が裏切った場合、青は騙された者への報酬を受け取る。一方、レッドは誘惑の報酬を受け取る。。
これは通常の形式で表現できます。
そして、厳密な意味での囚人のジレンマゲームであるためには、利得に関して以下の条件が満たされなければならない。
報酬関係相互協力は相互裏切りよりも優れていることを示唆している一方、利得関係はそして両エージェントにとって裏切りが支配的な戦略であることを示唆している。[ 7 ]
2人のプレイヤーが囚人のジレンマを連続して複数回プレイし、相手の過去の行動を記憶し、それに応じて戦略を変更することが許される場合、そのゲームは反復囚人のジレンマと呼ばれます。
上記の一般形式に加えて、反復バージョンではさらに以下の条件も必要となる。、相互協力よりも大きな報酬を与えるような、協力と裏切りの交互の行為を防ぐため。
反復囚人のジレンマは、人間の協力と信頼に関するいくつかの理論の基礎となっている。このゲームが信頼を必要とする2人間の取引を効果的にモデル化していると仮定すると、集団における協力行動は、このゲームのマルチプレイヤー反復バージョンによってモデル化できる。1975年、グロフマンとプールは、このゲームに関する学術論文の数が2,000以上あると推定した。反復囚人のジレンマは「平和戦争ゲーム」とも呼ばれる。[ 8 ] [ 9 ]反復ゲームのいくつかのバリエーションが研究されており、各ラウンド後にプレイヤーが退出オプションを持つバージョンも含まれる。[ 10 ]
反復囚人のジレンマが有限回プレイされ、両プレイヤーがそれを知っている場合、支配戦略およびナッシュ均衡は、すべてのラウンドで裏切ることである。証明は帰納的である。相手が後で報復する機会がないため、最後のターンで裏切るのが妥当である。したがって、両者とも最後のターンで裏切ることになる。同様に、相手は何をしても最後のターンで裏切るため、プレイヤーは最後から2番目のターンで裏切るのが妥当である、といった具合である。ゲームの長さが不明だが上限が既知の場合も同様である。
合理的なプレイヤー間で協力関係が成立するためには、ラウンド数が未知または無限でなければならない。その場合、「常に裏切る」戦略はもはや支配的な戦略ではなくなる可能性がある。ロバート・オーマンが1959年の論文で示したように[ 11 ] 、無限に長いゲームで繰り返し相互作用する合理的なプレイヤーは協力関係を維持できる。具体的には、相手が何度も協力しなかったために失望した場合、プレイヤーは協力する意欲が低下する可能性がある。逆に、時間が経過するにつれて、参加プレイヤー間の「暗黙の合意」が確立されるため、協力の可能性は高まる傾向がある。実験状況では、両方の参加者が何回の反復が行われるかを知っている場合でも、協力関係が成立する可能性がある。[ 12 ]
2019年にAmerican Economic Reviewに掲載された実験研究では、完全な監視下で繰り返される囚人のジレンマの状況で現実の被験者がどのような戦略を使用したかを検証したところ、選択された戦略の大部分は常に裏切り、しっぺ返し、そしてグリムトリガーであった。被験者がどの戦略を選択したかは、ゲームのパラメーターによって異なった。[ 13 ]
反復囚人のジレンマへの関心は、ロバート・アクセルロッドが1984年の著書『協力の進化』で火をつけた。彼はその中で、 Nステップ囚人のジレンマ(Nは固定)のトーナメントを主催したことを報告している。このトーナメントでは、参加者は戦略を繰り返し選択し、過去の遭遇を記憶しなければならない。アクセルロッドは世界中の学術関係者を招き、反復囚人のジレンマのトーナメントで競うためのコンピュータ戦略を考案させた。参加したプログラムは、アルゴリズムの複雑さ、初期の敵対性、許しの能力などにおいて大きく異なっていた。
アクセルロッドは、このような遭遇を長期間にわたって多数のプレイヤーがそれぞれ異なる戦略を用いて繰り返したところ、利己的な戦略は長期的に見て非常に不利になる傾向があり、より利他的な戦略は、純粋に自己利益の観点から判断すると、より良い結果を出すことを発見した。彼はこの発見を利用して、自然選択によって、当初は純粋に利己的なメカニズムから利他的な行動へと進化する可能性のあるメカニズムを示した。
優勝した決定論的戦略は、アナトール・ラポポートが開発し、トーナメントに出品した「しっぺ返し」でした。これは出品されたプログラムの中で最もシンプルで、BASICの 4 行しか含まれていませんでしたが、[ 14 ]コンテストで優勝しました。この戦略は、ゲームの最初の反復で協力するという単純なものです。その後、プレイヤーは前の手で相手が行ったことを行います。[ 15 ]状況によっては、「許し付きしっぺ返し」という少し優れた戦略もあります。相手が裏切った場合、次の手でプレイヤーは、わずかな確率 (対戦相手のラインナップによって 1 ~ 5% 程度) で協力することがあります。これにより、裏切りのサイクルに陥ることから時折回復することができます。
アクセルロッドは、最高得点を獲得した戦略を分析した後、戦略が成功するために必要ないくつかの条件を述べた。[ 16 ]
1回限りの囚人のジレンマゲームとは対照的に、反復囚人のジレンマにおける最適戦略は、対戦相手の戦略、裏切りや協力に対する反応、そして将来の利得の割引率に依存します。例えば、常に裏切るプレイヤーばかりで、1人だけがしっぺ返し戦略をとる場合、最初のターンで負けるため、そのプレイヤーはわずかに不利になります。このような集団では、毎回裏切るのが最適戦略です。より一般的には、一定割合の常に裏切るプレイヤーと、残りがしっぺ返し戦略をとるプレイヤーからなる集団の場合、最適戦略は、その割合とプレイした反復回数に依存します。
最適な戦略を導き出す方法は、一般的に次の2つです。
「勝ったら維持、負けたら切り替え」と呼ばれる戦略では、協力に失敗したプレイヤーは次のターンに戦略を切り替える。[ 21 ]特定の状況下では、パブロフは同様の戦略を使用する仲間プレイヤーに優先的な扱いを与えることで、他のすべての戦略に勝つ。
しっぺ返し戦略は最も堅牢な基本戦略と考えられているが、イギリスのサウサンプトン大学のチームは、20周年記念反復囚人のジレンマ競技会でより成功した戦略を発表した。この戦略は、プログラム間の共謀を利用して、単一のプログラムが最高得点を獲得することを目的としていた。同大学は、競技会に60個のプログラムを提出した。これらのプログラムは、開始時に5~10回の一連の操作で互いを認識するように設計されていた。[ 22 ]この認識が行われると、一方のプログラムは常に協力し、もう一方のプログラムは常に裏切り、裏切り者の得点を最大化する。プログラムが、対戦相手がサウサンプトン大学のプレイヤーではないと認識した場合、競合するプログラムの得点を最小限に抑えるために、継続的に裏切りを行った。その結果、2004年の囚人のジレンマトーナメントの結果では、GRIM戦略よりも勝利数が少なく敗北数が多いにもかかわらず、サウサンプトン大学の戦略が上位3位(および下位のいくつかの順位)を占めた。サウサンプトンの戦略は、この大会では複数チームでの参加が認められており、チームのパフォーマンスは最高得点選手の成績によって評価されるという事実を利用している(つまり、自己犠牲的な選手の起用は一種のミニマックス戦略であった)。
この新しいルールのため、この競技はアクセルロッドの画期的なトーナメントと比較すると、単一エージェント戦略を分析する際の理論的な意義は低い。しかし、特にノイズが存在する状況下で、マルチエージェントフレームワークにおける協調戦略の実現方法を分析するための基礎を提供した。
この新ルールトーナメントが開催されるずっと前に、リチャード・ドーキンスは著書『利己的な遺伝子』の中で、複数のエントリーが認められればこうした戦略が勝利する可能性を指摘したが、アクセルロッドは提出されたとしてもおそらく認めなかっただろうと述べている。こうした戦略は、プレイヤー間のコミュニケーションを禁じるルールも回避する。サウサンプトン・プログラムの「10手ダンス」は、プレイヤー同士が互いを認識することを可能にし、コミュニケーションがいかにゲームのバランスを変える上で重要であるかを改めて示している。
ソフトウェア戦略間の暗黙の共謀がなくても、しっぺ返し戦略は必ずしもあらゆるトーナメントで絶対的な勝者になるとは限りません。より正確に言えば、一連のトーナメントにおける長期的な結果はライバルを上回りますが、これは短期的に最も成功する戦略であることを意味するものではありません。許しを伴うしっぺ返し戦略やその他の最適戦略についても同様です。
これは、ダーウィンの進化的に安定な戦略(ESS)シミュレーションを用いて説明することもできます。このようなシミュレーションでは、しっぺ返し戦略がほぼ常に優勢になりますが、しっぺ返し戦略の集団には報復しない善良な戦略が入り込む可能性があり、善良な戦略は逆に悪質な戦略の格好の餌食となるため、悪質な戦略が集団に出入りすることになります。ドーキンスは、このような状況では、戦略の静的な組み合わせが安定した均衡を形成することはなく、システムは常に境界の間で振動することを示しました。
確率的反復囚人のジレンマゲームでは、戦略は「協力確率」によって規定されます。[ 23 ]プレイヤーXとプレイヤーYの遭遇において、Xの戦略はYと協力する確率Pの集合によって規定されます。Pは、彼らの過去の遭遇の結果、またはその一部に依存する関数です。Pが彼らの直近のn回の遭遇のみに依存する関数である場合、それは「記憶n」戦略と呼ばれます。記憶1戦略は、4つの協力確率によって規定されます。ここで、P cdは、前回の遭遇でX が協力し、Yが裏切ったという条件の下で、今回の遭遇で X が協力する確率です。それぞれの確率が 1 または 0 の場合、その戦略は決定論的と呼ばれます。決定論的戦略の例としては、次のように表されるしっぺ返し戦略があります。これは、Xが前回の遭遇でYがしたように反応するケースである。もう一つは、勝ったら現状維持、負けたら切り替える戦略であり、次のように記述される。任意のメモリ n 戦略に対して、同じ統計結果をもたらす対応するメモリ 1 戦略が存在することが示されており、メモリ 1 戦略のみを考慮すればよい。[ 23 ]
もしは、Xの上記の 4 要素戦略ベクトルとして定義され、Yの4要素戦略ベクトルとして(インデックスはYから)X の視点から、遷移行列M をXに対して定義することができ、そのij番目の要素は、前回の遭遇がiであった場合に、 XとYの特定の遭遇の結果がjになる確率です。ここで、iとj は4 つの結果インデックス ( cc、cd、dc、dd)のいずれかです。たとえば、Xの視点から、前回の遭遇がcdであった場合に、現在の遭遇の結果がcdになる確率は、次のようになります。これらの定義の下では、反復囚人のジレンマは確率過程として適格であり、Mは確率行列であるため、確率過程の理論のすべてを適用することができる。[ 23 ]
確率論の1つの結果として、行列vに対して定常ベクトルvが存在し、一般性を失うことなく、 v は、その 4 つの成分の合計が 1 になるように正規化されていると指定できます。これは、 nステップ前の遭遇がiである場合に、XとYの遭遇の結果がjになる確率を示します。nが無限大に近づく極限では、M は固定値を持つ行列に収束し、 iとは無関係にj を生み出す遭遇の長期的な確率を示します。言い換えれば、は同一となり、多数の相互作用を明示的に評価する必要なく、反復囚人のジレンマの長期均衡結果確率を与える。v は定常ベクトルであることがわかる。そして特にそうすれば、各行のはvと等しくなります。したがって、定常ベクトルはXの均衡結果確率を指定します。そして{ cc,cd,dc,dd }の結果に対する短期的な利得ベクトル( Xの視点から)として、XとYの均衡利得は次のように指定できます。そしてこれにより、2つの戦略PとQの長期的な収益を比較することが可能になる。

2012年、ウィリアム・H・プレスとフリーマン・ダイソンは、確率的反復囚人のジレンマに対する「ゼロ決定性」(ZD)戦略と呼ばれる新しいクラスの戦略を発表した。[ 23 ] XとYの遭遇に対する長期的な利得は、2つの戦略と短期的な利得ベクトルの関数である行列の決定性として表現できる。そして定常ベクトルvを含まない。行列式関数は線形したがって、(どこ)これらは定義上ZD戦略であり、長期的なペイオフは次の関係に従う。。
しっぺ返しは、相手プレイヤーに対して優位に立たないという意味で「公平」な ZD 戦略です。しかし、ZD 空間には、2 人のプレイヤーの場合、一方のプレイヤーが他方のプレイヤーのスコアを一方的に設定したり、あるいは進化的なプレイヤーに自分の利得よりも数パーセント低い利得を達成させたりできる戦略も含まれています。脅迫されたプレイヤーは裏切ることもできますが、そうすると利得が低くなるため、自分自身に不利益が生じます。したがって、脅迫ソリューションは、反復囚人のジレンマを一種の最後通牒ゲームに変えます。具体的には、Xは、、一方的にs y を特定の値の範囲内の特定の値に設定することで、Yの戦略とは無関係に、 XがプレイヤーYを「脅迫」する機会が生まれます(逆もまた同様)。しかし、X がs x を特定の値に設定しようとすると、可能性の範囲ははるかに狭くなり、完全な協力か完全な裏切りのみとなります。[ 23 ]
反復囚人のジレンマの拡張として、進化的確率反復囚人のジレンマがあり、そこでは特定の戦略の相対的な存在量が変化することが許容され、より成功した戦略が相対的に増加します。このプロセスは、成功度の低いプレイヤーがより成功した戦略を模倣するか、成功度の低いプレイヤーをゲームから排除し、より成功したプレイヤーを増やすことによって達成できます。不公平な ZD 戦略は進化的に安定していないことが示されています。重要な直観は、進化的に安定な戦略は、他の集団に侵入できるだけでなく (強奪的な ZD 戦略はこれができます)、同じタイプの他のプレイヤーに対してもうまく機能する必要があるということです (強奪的な ZD プレイヤーは互いの余剰を減らすため、うまく機能しません)。[ 24 ]
理論とシミュレーションは、臨界個体数を超えると、ZD恐喝はより協調的な戦略との進化的な競争で負け、その結果、個体数が多いほど個体群の平均報酬が増加することを確認している。さらに、恐喝者が均一な裏切り者と勝てば留まり、負ければ切り替えるエージェントとの対立を打破するのを助けることで、協力を促進するケースもある。[ 25 ]
強引な ZD 戦略は大規模な集団では安定しないが、「寛大な」戦略と呼ばれる別の ZD クラスは安定かつ堅牢である。集団が小さすぎない場合、これらの戦略は他の ZD 戦略に取って代わることができ、繰り返し囚人のジレンマの一般的な戦略の幅広い範囲に対しても、勝てば留まる、負ければ切り替えるなど、優れたパフォーマンスを発揮する。これは、2013 年に Alexander Stewart と Joshua Plotkin によって寄付ゲームで具体的に証明された。 [ 26 ]寛大な戦略は他の協力的なプレイヤーと協力し、裏切りに直面した場合、寛大なプレイヤーはライバルよりも多くの効用を失う。寛大な戦略は、ZD 戦略と、いわゆる「良い」戦略の交点である。「良い」戦略は、Ethan Akin によって、プレイヤーが過去の相互協力に対して将来の協力で反応し、少なくとも協力の期待利得を受け取った場合は期待利得を均等に分割する戦略として定義された。[ 27 ]良い戦略の中で、寛大な (ZD) サブセットは、集団が小さすぎない場合に優れたパフォーマンスを発揮する。人口が非常に少ない場合、離反戦略が優勢になる傾向がある。[ 26 ]
反復囚人のジレンマに関する研究のほとんどは、プレイヤーが協力するか裏切るかのどちらかである離散ケースに焦点を当ててきました。これは、このモデルが分析が比較的簡単だからです。しかし、一部の研究者は、プレイヤーが他のプレイヤーに対して可変的な貢献をすることができる連続反復囚人のジレンマのモデルを調べてきました。LeとBoyd [ 28 ]は、このような状況では、協力は離散反復囚人のジレンマよりも進化するのがはるかに難しいことを発見しました。連続囚人のジレンマでは、集団が非協力均衡から始まる場合、非協力者よりもわずかに協力的なプレイヤーは、互いに集まることでほとんど利益を得ません。対照的に、離散囚人のジレンマでは、しっぺ返しの協力者は、非協力者と比較して、非協力均衡で互いに集まることで大きな利益を得ます。自然界は協力か裏切りかの厳密な二分法よりも多様な協力の機会をより多く提供していると言えるため、理論モデルではしっぺ返しが頑健に見えるにもかかわらず、現実世界でしっぺ返しのような協力の例が極めてまれである理由を説明するのに役立つかもしれない[ 29 ]。
人間の相互作用や自然現象の多くの事例には、囚人のジレンマのような利得行列が存在する。そのため、経済学、政治学、社会学といった社会科学だけでなく、動物行動学や進化生物学といった生物科学においても、囚人のジレンマは興味深い研究対象となっている。多くの自然現象は、生物が囚人のジレンマの無限ゲームに従事しているというモデルに抽象化されている。
環境研究において、このジレンマは地球温暖化などの危機において顕著に現れる。安定した気候はすべての国に利益をもたらすと主張されているが、どの国もCO2排出量の抑制に消極的な場合が多い。現状維持による各国の当面の利益は、すべての国の行動が変われば最終的に得られるとされる利益よりも大きいと認識されており、これが2007年の気候変動に関する行き詰まりの原因となっている。[ 30 ]
気候変動政治と囚人のジレンマの重要な違いは不確実性である。汚染が気候を変化させる程度と速度は不明である。したがって、政府が直面するジレンマは、協力の報酬が不明であるという点で囚人のジレンマとは異なる。この違いは、国家が実際の反復囚人のジレンマよりもはるかに協力しないことを示唆しており、起こりうる気候変動の大惨事を回避できる確率は、実際の反復囚人のジレンマを用いた状況のゲーム理論的分析によって示唆されるよりもはるかに小さい。[ 31 ]
トーマス・オサンとアルンダティ・ナンディは、マイケル・ポーターの仮説に沿って、競合企業に対する政府の規制が実質的である場合の規制主導のウィンウィン状況について、証明付きの理論的説明を提供している。[ 32 ]
多くの動物の協力行動は、反復囚人のジレンマの一例として理解できる。動物はしばしば長期的なパートナーシップを結ぶ。例えば、グッピーはグループで協力して捕食者を検査し、非協力的な検査者を罰すると考えられている。[ 33 ]
吸血コウモリは社会性のある動物で、食物の相互交換を行います。囚人のジレンマの利得を適用することで、この行動を説明することができます。[ 34 ]
依存症研究と行動経済学において、ジョージ・エインズリーは、依存症は、依存症者の現在と未来の自己との間の時間的囚人のジレンマ問題として捉えることができると指摘している。この場合、「裏切る」とは再発を意味し、今日と将来の両方で再発しないことが断然最良の結果となる。今日断酒しても将来再発してしまう場合は最悪の結果となる。ある意味では、今日断酒するために費やした規律と自己犠牲は「無駄」になってしまう。なぜなら、将来再発すれば、依存症者は振り出しに戻ってしまい、最初からやり直さなければならないからだ。今日と明日再発することは、依存症者にとってはわずかに「良い」結果となる。なぜなら、依存症者はまだ依存症ではあるものの、やめようと努力していないからだ。最後のケース、つまり今日依存行動にふけり、明日は控えるというケースでは、(他の囚人のジレンマと同様に)「今日」裏切ることに明らかな利点があるが、明日も同じ囚人のジレンマに直面し、その時にも同じ明らかな利点が存在するため、最終的には裏切りの無限連鎖につながるという問題がある。[ 35 ]
ジョン・ゴットマンは著書『信頼の科学』の中で、良好な関係とは、パートナーが相互裏切り行為に陥らないこと、あるいは少なくともそのループに陥らないことを知っている関係であると定義している。認知神経科学では、異なるラウンドの処理に関連する脳の高速信号が、次のラウンドでの選択を示す可能性がある。相互協力の結果は、次の機会に人がどれだけ早く同じように協力するかを予測する脳活動の変化を伴う。[ 36 ]この活動は、基本的な恒常性および動機付けプロセスに関連している可能性があり、相互協力への近道の可能性を高める可能性がある。
囚人のジレンマは社会心理学の大腸菌と呼ばれており、寡占競争や集団的利益を生み出すための集団行動など、さまざまなトピックの研究に広く用いられてきた。 [ 37 ]
広告は、囚人のジレンマの具体例として挙げられることがあります。米国でタバコの広告が合法だった時代、競合するタバコメーカーは広告にどれだけの費用をかけるかを決めなければなりませんでした。A社の広告効果は、B社が行う広告によって部分的に左右されました。同様に、B社が広告から得る利益も、A社が行う広告によって影響を受けます。A社とB社がともに一定期間に広告を出稿した場合、それぞれの広告は互いの効果を打ち消し合い、収入は一定のままですが、広告費の増加により支出は増加します。両社とも広告費を削減すれば利益を得られます。しかし、B社が広告を出稿しない場合、A社は広告によって大きな利益を得られる可能性があります。とはいえ、一方の企業が行う最適な広告量は、他方の企業が行う広告量に依存します。最適な戦略は他方の企業が選択する戦略に依存するため、支配戦略は存在せず、囚人のジレンマとは若干異なります。しかし、結果は似通っており、両社とも均衡状態よりも広告費を少なくした方が利益は大きくなるだろう。
ビジネスの場面では、協力的な行動が現れることもある。例えば、タバコメーカーは、タバコの広告を禁止する法律の制定を支持した。これは、業界全体のコスト削減と利益増加につながると理解していたからである。[ 38 ] [ d ]
強制力のある合意がない場合、カルテルのメンバーは(複数プレイヤーの)囚人のジレンマにも巻き込まれます。[ 39 ]「協力する」とは、通常、価格の下限に合意することを意味し、「裏切る」とは、この最低水準を下回る価格で販売し、他のカルテルメンバーから即座にビジネスを奪うことを意味します。独占禁止当局は、潜在的なカルテルメンバーが相互に裏切ることを望んでおり、消費者に可能な限り低い価格を保証するようにしています。
スポーツにおけるドーピングは、囚人のジレンマの例として挙げられる。2人の競技選手は、パフォーマンスを向上させるために違法かつ/または危険な薬物を使用する選択肢を持っている。どちらの選手も薬物を服用しなければ、どちらも有利にならない。片方の選手だけが服用すれば、その選手は競技者に対して大きな有利になるが、薬物を服用したことによる法的および/または医学的な危険性によってその利点は減少する。しかし、両方の選手が薬物を服用すれば、利点は相殺され、危険性だけが残るため、どちらもドーピングしなかった場合よりも悪い状況に陥る。[ 40 ]
国際関係論では、囚人のジレンマは、国家間の協力が全体としては最適だが個々には最適ではない状況で、なぜ協力が失敗するのかを説明するためによく用いられる。[ 41 ] [ 42 ]古典的な例として安全保障ジレンマがある。これは、ある国家の安全保障の強化(軍事力の増強など)が、他国に攻撃行動への恐怖から自国の安全保障への不安を抱かせるというものである。[ 43 ]その結果、安全保障強化策は、一つまたは複数の他国との緊張、エスカレーション、または紛争につながり、どの当事者も真に望まない結果を生み出す可能性がある。[ 44 ] [ 43 ] [ 45 ] [ 46 ] [ 47 ]安全保障ジレンマは、攻撃兵器と防御兵器を区別することが難しく、あらゆる紛争において攻撃が防御よりも優位にある状況で特に深刻になる。[ 43 ]
囚人のジレンマは、国際関係論の現実主義理論家によって、国際的な無秩序状態下では、すべての国家(国内政策や公言するイデオロギーに関係なく)が、たとえ協力によってすべての国が利益を得る場合であっても、互いに協力することに苦労する理由を説明するために頻繁に用いられてきた。
現実主義の批判者たちは、反復と未来の影の延長が囚人のジレンマの解決策だと主張する。行為者が囚人のジレンマを一度プレイする場合、裏切るインセンティブがあるが、それを繰り返しプレイすると予想される場合、協力するインセンティブが大きくなる。[ 48 ]
現実の多くのジレンマには複数のプレイヤーが関わっています。[ 49 ]比喩的ではありますが、ギャレット・ハーディンの共有地の悲劇は、囚人のジレンマのマルチプレイヤー一般化の例として見ることができます。各村人は、個人的な利益か抑制かを選択します。全員一致または頻繁な裏切りに対する集団的な報酬は、非常に低い報酬と共有地の破壊です。
コモンズが常に搾取されるわけではない。囚人のジレンマに関する著書の中で、ウィリアム・パウンドストーンは、ニュージーランドで新聞ボックスの鍵がかかっていない状況を描写している。人々は代金を支払わずに新聞を持ち出す(裏切る)ことができるが、そうする人はほとんどいない。なぜなら、自分が支払わなければ他の人も支払わず、システムが崩壊してしまうと考えているからである。[ 50 ] 2009年にノーベル経済学賞を受賞したエリノア・オストロムによるその後の研究では、コモンズの悲劇は単純化されすぎており、負の結果は外部の影響によって左右されるという仮説が立てられた。複雑な圧力がかからなければ、集団は相互の利益のためにコモンズを互いにコミュニケーションを取り、管理し、資源を保全し集団にとって最大の利益を達成するための社会規範を強制する。これは囚人のジレンマにおける最良の結果を実現する例である。[ 51 ] [ 52 ]
囚人のジレンマは、協力と競争の複雑さを説明するために、さまざまな学術的な場面で使用されてきました。注目すべき例の1つは、 1980年代にハミルトン大学の社会学教授ダン・チャンブリスが行った教室実験です。1981年から、チャンブリスは、期末試験を誰も受けなければ全員がA評価になるが、1人でも受ければ受けなかった学生は0点になるという実験を提案しました。1988年、1年生のジョン・ワーナーは、クラスメートを組織して試験をボイコットすることに成功し、ゲーム理論と囚人のジレンマの概念の実践的な応用を示しました。[ 53 ]
約25年後、2013年にジョンズ・ホプキンス大学で同様の事件が発生した。ピーター・フローリッヒ教授の成績評価方針は、最終試験の点数を最高点に基づいて調整するもので、全員が同じ点数を取った場合、全員がAとなるはずだった。フローリッヒ教授の授業の学生たちは最終試験のボイコットを組織し、誰も試験を受けないようにした。その結果、すべての学生がAを受け取った。[ 54 ] [ 55 ]これらの例は、囚人のジレンマが教育の文脈における協力行動や戦略的意思決定を探求するためにどのように使用できるかを示している。

ダグラス・ホフスタッター[ 56 ]は、囚人のジレンマ問題のような問題は、単純なゲームやトレードオフの形で示されると理解しやすくなることが多いと示唆した。彼が用いた例の一つが「袋の交換」である。
二人が会って、片方の袋にはお金が入っていて、もう片方には購入品が入っているという了解のもと、閉じた袋を交換する。どちらのプレイヤーも、合意した内容を自分の袋に入れることで取引を履行するか、空の袋を渡すことで取引を破棄するかを選択できる。
「Friend or Foe?」は、2002年から2003年にかけてアメリカのGame Show Networkで放送されたゲーム番組です。この番組では、3組のペアが競い合います。ペアが脱落すると、囚人のジレンマに似たゲームで賞金の分配方法を決定します。両者が協力した場合(Friend)、賞金は50対50で分け合います。一方が協力し、もう一方が裏切った場合(Foe)、裏切った方が賞金を全て獲得し、協力した方は何も獲得しません。両者が裏切った場合、両者とも何も獲得できません。報酬マトリックスは、上記の標準的なものとは若干異なり、「両者が裏切る」場合と「相手が裏切る間に協力する」場合の報酬が同じであることに注意してください。このため、「両者が裏切る」ケースは、標準的な囚人のジレンマの厳密な均衡と比較すると、弱い均衡となります。参加者が相手が「Foe」に投票することを知っている場合、参加者自身の選択は賞金に影響しません。ある意味で、『フレンド・オア・フォー』は、囚人のジレンマとチキンゲームの中間的な報酬モデルを持っている。
これが報酬マトリックスです。
この利得マトリックスは、イギリスのテレビ番組「Trust Me」、「Shafted」、「The Bank Job」、「Golden Balls」、「The Inner Circle」、アメリカのゲーム番組「Take It All 」、リアリティ番組「Bachelor Pad」と「Love Island」の優勝カップルにも使用されています。経済学者のチームが「Golden Balls」のデータを分析し、現実世界では重大な金額になるものの、ゲームの文脈では比較的低い金額に対して、協力が「驚くほど高い」ことを発見しました。[ 57 ]
このジレンマは、複数の裏切り者が決勝進出者としてゲームに残っている場合、『ザ・トレイターズ』のゲームメカニクスとしても機能します。これは、 『ザ・トレイターズ・オーストラリア』のシーズン2の最終回で実際に起こりました。3人の裏切り者決勝進出者に対して、このジレンマの3人版が提示されました。彼らは賞金を「分け合う」か「奪う」かの選択を迫られました。3人全員が分け合うことを選択した場合、それぞれが賞金の3分の1を受け取ります。1人または2人の裏切り者が奪うことを選択した場合、分け合うことを選択した者は何も得られず、賞金は奪った者で分けられます。3人全員が奪うことを選択した場合、誰も何も得られません。
ローザンヌ大学とエジンバラ大学の研究者らは、「反復雪崩ゲーム」が現実世界の社会状況をより忠実に反映している可能性があると示唆しているが、このモデルは実際にはチキンゲームである。このモデルでは、裏切りによって搾取されるリスクが低く、個人は協力的な選択をすることで常に利益を得る。雪崩ゲームは、雪崩の両側で立ち往生した2人のドライバーを想定しており、それぞれが雪かきをして道を切り開くか、車の中に留まるかを選択できる。プレイヤーの最大の利益は、相手に雪をすべて自分で取り除かせることだが、相手もその作業に対して名目上は報酬を得る。
これは現実世界のシナリオをよりよく反映しているかもしれない。研究者らは、2人の科学者がレポートを共同執筆している例を挙げ、お互いがもっと頑張ればどちらも利益を得られると述べている。「しかし、共同研究者が全く仕事をしない場合は、おそらく自分で全ての仕事をした方が良いでしょう。それでも最終的にはプロジェクトは完成します。」[ 58 ] [ 59 ]
協調ゲームでは、プレイヤーは良い結果を得るために戦略を調整する必要があります。例えば、吹雪の中で突然出会った2台の車を考えてみましょう。それぞれが左にハンドルを切るか右にハンドルを切るかを選択しなければなりません。両方とも左にハンドルを切るか、両方とも右にハンドルを切るかによって、車は衝突しません。地域の左側通行と右側通行の慣習が、彼らの行動を調整するのに役立つのです。
対称的な協調運動ゲームには、スタッグハントやバッハ・ストラヴィンスキーなどがある。
より一般的なゲーム群は非対称である。囚人のジレンマと同様に、最良の結果は協力であり、裏切りの動機が存在する。ただし、対称的な囚人のジレンマとは異なり、一方のプレイヤーは他方のプレイヤーよりも失うものが多く、かつ/または得るものが多い。このようなゲームの中には、一方の囚人がアリバイを持っている囚人のジレンマとして説明されるものもあり、そのため「アリバイゲーム」という用語が用いられる。[ 60 ]
実験では、繰り返しゲームで不平等な報酬を得るプレイヤーは利益を最大化しようとするかもしれないが、それは両方のプレイヤーが平等な報酬を受け取るという条件の下でのみである。これは、不利なプレイヤーがXゲームごとに裏切り、もう一方のプレイヤーが常に協力するという安定した均衡戦略につながる可能性がある。このような行動は、実験における公平性に関する社会的規範に依存する可能性がある。[ 61 ]
囚人のジレンマのシミュレーションやトーナメントを実行するためのソフトウェアパッケージがいくつか開発されており、その一部はソースコードが公開されている。
ハンヌ・ラジャニエミは、自身の『量子泥棒』三部作の冒頭シーンを「ジレンマの牢獄」に設定した。このシリーズの主要テーマは「二元宇宙の不十分さ」と表現され、究極の敵役は「全裏切り者」と呼ばれるキャラクターである。シリーズ第1作は2010年に出版され、続編である『フラクタル・プリンス』と『因果の天使』はそれぞれ2012年と2014年に出版された。
反復囚人のジレンマをモデルにしたゲームは、2012年のビデオゲーム『Zero Escape: Virtue's Last Reward 』の中心的な要素であり、2016年の続編『Zero Escape: Zero Time Dilemma 』ではマイナーな要素となっている。
トレントン・リー・スチュワート著『ミステリアス・ベネディクト・ソサエティと囚人のジレンマ』では、主人公たちはまず、このゲームの変形版をプレイし、「監獄」から脱出する。その後、彼らは実際に囚われの身となり、再び脱出を試みる。
『アドベンチャー・ゾーン:バランス』の「苦しみのゲーム」というサブストーリーにおいて、プレイヤーキャラクターは2体のリッチの領域にいる間に、囚人のジレンマに2度直面する。1度は協力し、もう1度は裏切るという状況だ。
ジェームズ・S・A・コーリーの小説『ティアマトの怒り』では、ジェイソン・イリッチ大佐がウィンストン・ドゥアルテの娘テレサに囚人のジレンマを説明し、彼女に戦略的思考を身につけさせようとする。
2008年の映画『ダークナイト』には、ジョーカーが囚人を乗せたフェリーと民間人を乗せたフェリーの2隻に爆弾を仕掛け、両グループに互いのフェリーで爆弾を爆発させる手段を与え、躊躇すれば両方とも爆発させると脅迫するという、この問題をゆるやかにベースにしたシーンが含まれている。[ 66 ] [ 67 ]
囚人のジレンマは、個人の利益と共同体の利益との間に生じる潜在的な緊張関係を示す例として、道徳哲学における思考ツールとして一般的に用いられる。
単発型囚人のジレンマと反復型囚人のジレンマはどちらも道徳哲学に応用できる。実際、大量虐殺のような多くの道徳的状況は、一度以上繰り返すことは容易ではない。さらに、多くの状況では、前のラウンドの結果は必ずしも同じではないため(例えば、路上で物乞いをする人とのやり取り)、プレイヤーには分からない。[ 68 ]
哲学者デイヴィッド・ゴーティエは囚人のジレンマを用いて、道徳と合理性がどのように衝突しうるかを示している。[ 69 ]
ゲーム理論家の中には、囚人のジレンマを道徳哲学における思考ツールとして使用することに批判的な者もいる。[ 69 ]ケネス・ビンモアは、囚人のジレンマは人類がプレイするゲームを正確に記述するものではなく、むしろ協調ゲームに近いと主張した。ブライアン・スカイムズもこの見解を共有している。他のゲーム理論家の中には、囚人のジレンマはプレイヤーが認識する可能性のある非ジレンマゲームに関する不確実性から生じると考える者もいる。[ 70 ]
スティーブン・クーンは、道徳的行動がゲームの利得行列を変化させ、囚人のジレンマを他のゲームに変える可能性があると考えることで、これらの見解を調和させることができると示唆している。[ 69 ]
囚人のジレンマは、混合戦略が純粋戦略よりも期待利得が高くなる可能性がある場合、「不純」であると見なされます。これは、功利主義的観点(つまり、行動の善を最大化することを目指す)からの道徳的行動には、80%の確率で協力し、20%の確率で裏切るなど、戦略のランダム化が必要になる可能性があるという興味深い可能性を生み出します。[ 71 ]
{{cite journal}}: CS1 maint: 複数の名前: 著者リスト (リンク){{cite book}}: CS1メンテナンス: パブリッシャーの場所 (リンク)