
Tit for tatは「同等の報復」を意味する英語のことわざです。これはtip for tap「blow for blow」[ 1 ]の交互表現で、 1558 年に初めて記録されました。[ 2 ]
これはゲーム理論においても非常に効果的な戦略である。この戦略を用いるエージェントは、まず協力し、その後、相手の以前の行動を模倣する。相手が以前に協力的であった場合、エージェントも協力的となる。そうでない場合は、エージェントは裏切る。これは生物学における互恵的利他主義に似ている。
しっぺ返し戦略は、反復囚人のジレンマの戦略として非常に有効に活用されてきた。この戦略は、 1980年頃に開催されたロバート・アクセルロッドの2つのトーナメントで、アナトール・ラポポートによって初めて導入された[ 3 ]。注目すべきは、この戦略が(どちらの場合も)最も単純な戦略であり、直接的な競争において最も成功した戦略であったことである。ゲーム理論的アプローチを金融などの他の応用分野に拡張した例はほとんどない。その文脈では、しっぺ返し戦略はトレンドフォロー戦略と関連していることが示された[ 4 ] 。
その名称は敵対的な性質を強調しているものの、実際には協調的な要素が強い「しっぺ返し戦略」の成功は、多くの人々を驚かせた。様々なチームが考案した戦略を相手に、この戦略は2つの大会で勝利を収めた。最初の大会後、しっぺ返し戦略に対抗するために特別に考案された新たな戦略は、互いに負の相互作用を起こし、失敗に終わった。しっぺ返し戦略以外の成功する戦略は、しっぺ返し戦略と、この戦略自体の両方を念頭に置いて考案する必要があっただろう。
この結果は、動物の集団、特に人間社会が、自然界で絶え間ない対立状態にある個体から予想されるような激しい競争や攻撃的な生き方ではなく、ほとんど、あるいは完全に協力的な生き方をするように進化してきた理由を説明するのに役立つかもしれない。この点、そして特にそれが人間社会や政治にどのように応用されるのかは、ロバート・アクセルロッドの著書『協力の進化』の主題となっている。
さらに、しっぺ返し戦略は、社会心理学者や社会学者が紛争を軽減するための効果的な手法を研究する上で有益な役割を果たしてきました。研究によると、一定期間競争関係にあった個人が互いに信頼しなくなった場合、最も効果的な競争逆転策はしっぺ返し戦略を用いることです。個人は一般的に行動同化というプロセスに従事します。これは、協力関係にある、あるいは競争関係にあるグループメンバーの行動に合わせて、自分の行動を調整する傾向のあるプロセスです。したがって、しっぺ返し戦略が協力から始まれば、協力関係が継続します。一方、相手が競争すれば、しっぺ返し戦略は相手にも競争を促すことになります。最終的に、相手メンバーの行動には必ず対応する反応が返され、競争には競争、協力には協力が返されるのです。
紛争解決において、しっぺ返し戦略はいくつかの理由から効果的です。この手法は、明確で、親切で、挑発的で、寛容であると認識されています。まず、これは明確で認識しやすい戦略です。この戦略を用いる者は、その偶発性をすぐに認識し、それに応じて行動を調整します。さらに、協力から始まり、競争に応じてのみ裏切るため、親切であると考えられています。また、競争相手に即座に報復できるため、挑発的でもあります。最後に、競争相手が協力的な行動をとれば、すぐに協力関係が生まれるため、寛容であると言えます。
報復戦略の影響は、紛争研究、解決、および応用社会科学の多くの側面に関連している。[ 5 ]
例えば、次のような無限に繰り返される囚人のジレンマゲームを考えてみましょう。
しっぺ返し戦略は、相手プレイヤーが以前に選択した戦略を模倣する。プレイヤーが戦略(C,C)を選択して協力すれば、彼らは永遠に協力し続ける。
協力すると、次の利益が得られます((割引率):
合計が
プレイヤーが裏切り(D)に走った場合、次のラウンドで罰せられる。p1が協力しp2が裏切る場合と、その逆の場合を交互に繰り返す。
逸脱によって得られる報酬は以下のとおりです。
2 つの等比級数の和は
逸脱による利益が協力による利益よりも優れていない場合は、協力関係が期待される。
協力を続ける場合、
以下の場合は引き続き離反してください。
アクセルロッドは、直接競争の場合、この戦略が最適であることを経験的に示しましたが、しっぺ返し戦略をとる2人のエージェントは脆弱なままです。どちらかのプレイヤーがイベントを解釈する際に一度だけ、1ビットの誤りがあると、終わりのない「死のスパイラル」につながる可能性があります。つまり、一方のエージェントが裏切り、相手が協力すると、両方のエージェントが協力と裏切りを交互に繰り返すことになり、両方のエージェントが継続的に協力する場合よりも低い利得しか得られません。この状況は、校庭での喧嘩から内戦や地域戦争まで、現実世界の紛争で頻繁に発生します。これらの問題の原因は、割引率のナイフエッジ条件を除いて、しっぺ返し戦略が部分ゲーム完全均衡ではないことです。[ 6 ] この部分ゲームは、しっぺ返し戦略をとる2人のエージェントによって直接到達することはできませんが、部分ゲーム完全であるためには、戦略はすべての部分ゲームでナッシュ均衡でなければなりません。さらに、エージェントのシグナリングにノイズが許容される場合、この部分ゲームに到達する可能性があります。基本的な評判メカニズムを用いることで、「悔恨の報復」として知られる、報復の完全版のサブゲームを作成することができる。[ 7 ]
ナイフエッジ均衡とは、「外生変数の正確な値の場合にのみ存在する均衡である。変数をほんの少しでも変化させると、ナイフエッジ均衡は消滅する。」[ 8 ]
ナッシュ均衡とナイフエッジ均衡の両方になり得る。均衡がまさにその値に「危うく乗っている」ことから、ナイフエッジ均衡と呼ばれる。
例:
X = 0 と仮定します。この場合、(下、左)または(上、右)からの逸脱は利益になりません。しかし、X の値がどんなに小さくても逸脱すると、均衡は維持されなくなります。例えば、X の値が 0 ではなく 0.000001 の場合、上方向への逸脱が利益になります。このように、均衡は非常に不安定です。Wikipedia の記事で使用されている「ナイフエッジ条件」とは、ごくまれに、特定の条件が満たされ、例えば X が特定の値に等しい場合にのみ均衡が存在するという事実を指しています。
この問題を軽減するために、Tit for 2 tats が使用される可能性があります。以下の説明を参照してください。[ 9 ]「許しを伴う Tit for tat」は、死のスパイラルから抜け出すための同様の試みです。相手が裏切った場合、この戦略を採用しているプレイヤーは、次の手で協力することがあります。プレイヤーが協力して反応する正確な確率は、対戦相手の並びによって異なります。
さらに、しっぺ返し戦略は、完全な競争ではない状況では最適とは証明されていません。例えば、当事者同士が友人である場合、相手が時折逸脱しても、一方のプレイヤーが常に協力することが友情にとって最善となる可能性があります。現実世界のほとんどの状況は、しっぺ返し戦略が勝利を収めたような完全な競争よりも競争度が低いのです。
しっぺ返し戦略は、グリムトリガー戦略とは大きく異なり、相手が協力することを選択した場合、すぐに協力関係を生み出すという点で寛容な性質を持っています。一方、グリムトリガー戦略は最も容赦のない戦略であり、たった1つの欠陥でも、グリムトリガー戦略を使用しているプレイヤーはゲームの残りの間ずっと欠陥者となってしまいます。[ 10 ]
しっぺ返し戦略はしっぺ返し戦略に似ていますが、相手が合意した戦略から2回まで逸脱しても、プレイヤーが報復できる点が異なります。このため、しっぺ返し戦略を用いるプレイヤーは、相手に対してより「寛容」に見えるようになります。
しっぺ返し戦略では、相手が裏切ると、しっぺ返し戦略のプレイヤーは次の手で即座に裏切ることで応じます。これは、2つの報復戦略が互いに裏切りを繰り返すという不幸な結果をもたらし、両方のプレイヤーにとって悪い結果となります。しっぺ返し戦略のプレイヤーは、前の例のような「死のスパイラル」を避けるために、最初の裏切りには異議を唱えません。相手が2回連続で裏切った場合、しっぺ返し戦略のプレイヤーは裏切ることで応じます。
この戦略は、ロバート・アクセルロッドがランド研究所で行った2回目のコンピュータシミュレーションで提案されたものです。最初の実験の結果を分析した後、彼は参加者が「tit for two tats」戦略を採用していれば、他のどのプログラムよりも高い累積スコアを獲得できたであろうと判断しました。その結果、彼は2回目のトーナメントで高い期待を抱いてこの戦略を採用しました。しかし残念ながら、2回目のラウンドに参加したプログラムは、この戦略の寛容性を利用することができたため、より攻撃的な性質を持っていたことから、「tit for two tats」は「tit for tat」よりも(ゲーム理論的な意味で)著しく悪い結果となりました。[ 11 ]
寛大な報復は、相互裏切りの長いサイクルを防ぐために許しのメカニズムを導入した、報復戦略のバリエーションです。標準的な報復シナリオでは、一方のプレイヤーがミス、意思疎通の誤り、またはシステム内の「ノイズ」のために裏切ると、もう一方のプレイヤーは次のラウンドで裏切ります。これは、両方のプレイヤーが継続的に裏切るという終わりのない報復の「死のスパイラル」につながり、両者にとって悪い結果をもたらします。[ 12 ] [ 13 ]
寛大な報復戦略は、相手が裏切った後でも時折協力することでこの問題を解決しようとする。この戦略は一般的に次の3つのルールに従う。
時折許しを与えることで、この戦略は報復の連鎖を断ち切り、ゲームを相互協力の状態に戻すことができる。この用語を考案したゲーム理論家のロバート・アクセルロッドは、この戦略はリスクを伴うものの、「ノイズ」(不完全な情報や実行上のミス)のある環境において非常に効果的であることを発見した。なぜなら、偶発的な衝突が際限なくエスカレートするのを防ぐことができるからである。
BitTorrentピアは、ダウンロード速度を最適化するために、しっぺ返し戦略を使用します。[ 14 ]より具体的には、ほとんどのBitTorrentピアは、 BitTorrent用語でレギュラーアンチョーキングと呼ばれるしっぺ返し戦略の変種を使用します。BitTorrentピアは、他のピアに割り当てるアップロードスロットの数が限られています。したがって、ピアのアップロード帯域幅が飽和すると、しっぺ返し戦略を使用します。協力は、アップロード帯域幅をダウンロード帯域幅と交換することで実現します。したがって、ピアが自分のピアのアップロードに対してアップロードしない場合、BitTorrentプログラムは非協力的なピアとの接続をチョークし、このアップロードスロットを、より協力的なピアに割り当てます。レギュラーアンチョーキングは、囚人のジレンマの最初の動きで常に協力することに相当します。定期的に、ピアはランダムに選択された非協力的なピアにアップロードスロットを割り当てます(アンチョーク)。これは楽観的アンチョーキングと呼ばれます。この行動により、より協力的な仲間を探し出すことが可能になり、これまで協力しなかった仲間にも二度目のチャンスが与えられる。この戦略の最適な閾値については、現在も研究が続けられている。
動物の向社会行動に関する研究は、多くの動物行動学者や進化心理学者に、利他主義が多くの動物社会で進化する理由を説明するために、しっぺ返し戦略を適用するように促してきた。フォン・ノイマンとモルゲンシュテルン(1953)によって定式化された数学理論から派生した進化ゲーム理論は、メイナード・スミス(1972)によって最初に考案され、ロバート・ハインドによって鳥類の行動においてさらに探求された。彼らがゲーム理論を動物の戦略の進化に適用したことで、動物の行動を分析する全く新しい方法が生まれた。
互恵的利他主義は、食物、交配権、巣作り、縄張りなどの取引において、恩恵を与える側のコストが、恩恵を受ける側の利益よりも少ない動物社会で機能します。この理論では、ニーズのバランスが逆転した場合、利他行為は報われるべきだとされています。互恵的利他主義を規制するためには、報復を怠る「裏切り者」を特定して罰する仕組み、つまり一種の「しっぺ返し」が重要です。例えば、グッピーの捕食者に対する協力的な警戒行動は、「しっぺ返し」の仕組みによるものだと考えられています。
どちらの側も弱者と見なされたり、敵に協力していると見なされたりすることを恐れ、紛争から身を引くことができないという報復合戦は、歴史を通じて多くの長期にわたる紛争の原因となってきた。
しかし、アナリストたちは、第一次世界大戦の塹壕戦で発生した「生かして生かしておく」と呼ばれる自発的な非暴力行動にも、報復戦略が見られることを発見した。わずか数百フィートしか離れていない塹壕に陣取った兵士たちは、暗黙の了解を育んだ。狙撃兵が一方の兵士を殺害した場合、もう一方の側は同等の報復を期待した。逆に、しばらくの間誰も死ななかった場合、もう一方の側はこの暗黙の「休戦」を認め、それに応じて行動した。こうして塹壕の間に「独自の平和」が生まれた。[ 15 ]
北アイルランド紛争中、この用語は、アイルランド共和主義者とアルスター統一主義者の間での目には目をの応酬行動の増加を表すために使用されました。[ 16 ]これは、IRAによるレッドライオンパブ爆破事件に続いてマクガークスバー爆破事件が発生したことからもわかります。どちらも民間人を標的としていました。具体的には、大量虐殺の攻撃は、統一主義者と共和主義者のコミュニティの相互殺害を中心に構成され、どちらのコミュニティも一般的には暴力に関心を持っていませんでした。[ 17 ]この宗派主義的な考え方により、 「目には目をの爆破」という用語が北アイルランド社会の一般的な語彙に入り込みました。 [ 18 ] [ 19 ]