ゲーム理論において、グリムトリガー(グリム戦略、または単にグリムとも呼ばれる)は、繰り返しゲームのためのトリガー戦略である。
当初、グリムトリガーを使用するプレイヤーは協力するが、相手が裏切ると(つまりトリガー条件を満たすと)、グリムトリガーを使用するプレイヤーは、反復ゲームの残りの間、裏切りを続ける。相手が一度裏切ると永久に裏切りが続くため、グリムトリガーは反復ゲームにおいて最も厳しく容赦のない戦略である。
ロバート・アクセルロッドの著書『協力の進化』では、グリムトリガーは「フリードマン」と呼ばれている[ 1 ]。これは、この概念を使用しているジェームズ・W・フリードマンの1971年の論文に由来する[ 2 ] [ 3 ]。
無限回繰り返される囚人のジレンマは、グリムトリガー戦略のよく知られた例である。囚人2人による通常のゲームは以下の通りである。
囚人のジレンマでは、各プレイヤーは各段階で2つの選択肢を持つ。
プレイヤーが裏切った場合、そのプレイヤーはゲームの残りの間、罰せられます。実際には、両プレイヤーとも相手を裏切るよりも黙っている(協力する)方が有利なので、(C、C)をプレイすることは協力的なプロファイルであり、(D、D)をプレイすることは(このゲームにおける唯一のナッシュ均衡でもありますが)罰を与えるプロファイルです。
グリムトリガー戦略では、プレイヤーは最初のラウンドと、相手が合意を破らない限り以降のラウンドで協力する。しかし、相手が前のゲームで裏切ったことが分かると、プレイヤーは永久に裏切る。
ゲームの以下のグリムトリガー戦略に対する部分ゲーム完全均衡(SPE)を評価するために、プレイヤーiとjの戦略 S*は次のようになります。
そして、割引率がつまり、割引率が1/2より大きい場合、プレイヤー1もプレイヤー2も協力プロファイルから逸脱するインセンティブはない。[ 5 ]
その戦略がSPEであることを証明するには、協力は相手プレイヤーの協力に対する最善の対応であり、裏切りは相手プレイヤーの裏切りに対する最善の対応でなければならない。[ 4 ]
ステップ1:Dがこれまで一度もプレイされていないと仮定します。
CがDより優れているのは、。
ステップ2:誰かが以前にDをプレイしたと仮定すると、プレイヤーjはどんな場合でもDをプレイします。
以来Dポジションを取るのが最適だ。
前述の議論は、協力プロファイルから逸脱するインセンティブ(利益のある逸脱)がないことを強調している。そしてこれはすべての部分ゲームに当てはまります。したがって、無限回繰り返される囚人のジレンマゲームの戦略は、部分ゲーム完全ナッシュ均衡です。
反復囚人のジレンマ戦略競争において、グリムトリガーはノイズがなくてもパフォーマンスが悪く、シグナルエラーを加えるとさらに悪くなります。永久裏切りを脅す能力は理論的には信頼を維持する効果的な方法となりますが、その容赦のない性質と、この脅威を事前に伝えることができないため、パフォーマンスは劣ります。[ 6 ]
国際関係の観点から見ると、厳しい引き金となるのは、過去に相手国に搾取されたことがない場合にのみ、国家が協力するという考え方である。一度相手国が裏切ると、その国は将来にわたって協力を拒否するため、協力関係の無期限の解消が、そのような戦略を限定的なものにする脅威となる。[ 7 ]
ゲーム理論は近年、将来の通信システムの開発に利用されており、グリムトリガー戦略を採用したユーザーネットワーク相互作用ゲームにおけるユーザーはその一例である。[ 8 ]グリムトリガーがユーザーネットワーク相互作用ゲームで使用されると決定された場合、ネットワークが一定の品質を維持している限り、ユーザーはネットワークに留まり(協力し)、相手が裏切ったと判明するとすぐに相互作用を停止してネットワークから離脱することでネットワークを罰する。[ 9 ] Antoniou らは、「このような戦略が与えられた場合、ネットワークは顧客を永久に失う脅威に直面するため、一定の品質に関する約束を守るインセンティブがより強くなる」と説明している。[ 8 ]
しっぺ返し戦略とグリムトリガー戦略は、どちらも相手プレイヤーの裏切りに対して罰を与えることができる場合、プレイヤーが先に裏切ることを拒否するというトリガー戦略であるという点で類似している。しかし、違いは、グリムトリガーは1回の裏切りに対して最大限の罰を求めるのに対し、しっぺ返し戦略はより寛容で、裏切りごとに1つの罰を与えるという点である。[ 10 ]