GOR法(Garnier–Osguthorpe–Robsonの略)は、タンパク質の二次構造を予測するための情報理論に基づく方法です。[ 1 ]これは、より単純なChou–Fasman法の直後の1970年代後半に開発されました。Chou–Fasman法と同様に、GOR法は、 X線結晶構造解析によって解明された既知のタンパク質三次構造の経験的研究から得られた確率パラメータに基づいています。しかし、Chou–Fasman法とは異なり、GOR法は、個々のアミノ酸が特定の二次構造を形成する傾向だけでなく、そのアミノ酸のすぐ隣のアミノ酸がすでにその構造を形成している場合に、そのアミノ酸が二次構造を形成する条件付き確率も考慮に入れています。したがって、この方法は本質的にベイズ分析に基づいています。[ 2 ]
GOR法は、17アミノ酸配列ウィンドウに基づいて、各位置におけるαヘリックス、βシート、ターン、またはランダムコイルの二次構造を予測するために配列を解析します。この方法の元の説明には、17×20サイズの4つのスコアリングマトリックスが含まれており、列は対数オッズスコアに対応し、17残基配列の各位置で特定のアミノ酸が見つかる確率を反映しています。4つのマトリックスは、中央の9番目のアミノ酸がヘリックス、シート、ターン、またはコイルのコンフォメーションにある確率を反映しています。この方法のその後の改訂では、ターン領域の配列の変動性が高いため(特にこのような大きなウィンドウにわたって)、ターンマトリックスは削除されました。この方法では、領域をヘリックスとして分類するために、少なくとも4つの連続する残基がαヘリックスとしてスコアリングされ、βシートの場合は少なくとも2つの連続する残基が必要であるとみなされました。[ 3 ]
GOR法の数学とアルゴリズムは、主にJournal of Molecular BiologyとThe Biochemical Journalに報告されたRobsonらによる以前の一連の研究に基づいていた。[ 4 ] [ 5 ]後者は、条件付き情報尺度の観点から情報理論的展開を記述している。GOR論文のタイトルに「単純」という言葉が使われているのは、上記の以前の方法が、1970年代初頭のタンパク質科学ではあまり馴染みがなく、やや難解な証明と技術を提供していたという事実を反映している。当時、ベイズ法でさえ馴染みがなく、議論の的となっていた。GOR法に受け継がれたこれらの初期の研究の重要な特徴は、1970年代初頭の疎なタンパク質配列データを期待情報尺度で処理することであった。つまり、実際の頻度(観測数)が与えられた場合の妥当な情報尺度値の分布を考慮したベイズ的期待値である。この分布および類似の分布を積分することによって得られる期待値は、「不完全」または拡張ゼータ関数、例えば、不完全ゼータ関数 z(s, n) = 1 + (1/2) s + (1/3) s + (1/4) s + .... +(1/ n ) sを用いた z(s,観測頻度) − z ( s ,期待頻度) で構成されていると見なすことができます。GOR 法では s=1 を使用しました。また、GOR 法および以前の方法では、例えばヘリックス H の反対の状態、すなわち ~H の測定値が H の測定値から減算され、同様にベータシート、ターン、コイルまたはループについても減算されました。したがって、この方法は、対数予測オッズのゼータ関数推定値を使用していると見なすことができます。調整可能な決定定数も適用でき、これは決定理論アプローチを意味します。GOR 法では、異なるクラスのタンパク質の予測を最適化するために決定定数を使用するオプションが認められました。情報拡張の基礎として使用される期待情報尺度は、GOR法の発表時には、少なくとも当時考慮されていた用語についてはタンパク質配列データが豊富になったため、重要性が低下していました。その後、s=1の場合、頻度が増加するにつれて、式z(s,観測頻度) − z(s,期待頻度)は(観測頻度 / 期待頻度)の自然対数に近づきます。しかし、この尺度(sの他の値の使用を含む)は、情報拡張におけるより複雑な用語のデータが必然的に疎になる高次元データを用いた後のより一般的なアプリケーションでは依然として重要です。[ 6 ]