| PSIPRED | |
|---|---|
| 原著著者 |
|
| 開発者 | ユニバーシティ・カレッジ・ロンドン、バイオインフォマティクスグループ |
| リリース | 1999年 (1999年) |
| 安定放出 | |
| 執筆 | C |
| オペレーティング·システム | Windows 2000、Unix |
| プラットフォーム | x86、Java |
| サイズ | 14MB |
| 利用可能 | 英語 |
| タイプ | バイオインフォマティクスによる二次構造予測 |
| ライセンス | 独自のフリーウェアソースコード |
| Webサイト | bioinf |
PSI-blast に基づく二次構造予測( PSIPRED ) は、タンパク質の構造を調査するために使用される方法です。そのアルゴリズムには、人工ニューラルネットワーク機械学習法が使用されています。 [ 2 ] [ 3 ] [ 4 ]これはサーバーサイドプログラムであり、フロントエンドインターフェースとして機能するWeb サイトを備えており、一次配列からタンパク質の二次構造 (ベータシート、アルファヘリックス、コイル) を予測できます。
PSIPREDは、ウェブサービスおよびソフトウェアとして利用可能です。ソフトウェアはソースコードとして配布され、技術的にはプロプライエタリソフトウェアとしてライセンスされています。改変は許可されていますが、ソフトウェアおよびその成果物の営利目的での配布を禁止することで、フリーウェアとしての規定を遵守しています。
二次構造は、タンパク質や核酸(DNA、RNA )などの生体高分子の局所的なセグメントの一般的な三次元形態です。ただし、三次元空間における特定の原子位置を記述するものではなく、それらは三次構造とみなされます。二次構造は、原子分解能構造で観察される生体高分子の水素結合によって形式的に定義できます。タンパク質では、二次構造は主鎖アミノ基とカルボキシル基の間の水素結合のパターンによって定義されます。逆に、核酸では、二次構造は窒素塩基間の水素結合で構成されます。水素結合パターンは大きく歪む可能性があり、そのため二次構造の自動決定は困難です。タンパク質の一次構造配列のみに基づいて、コンピュータを使用してタンパク質の二次構造を予測する試みは、1970年代から続けられています。[ 5 ]
二次構造予測とは、バイオインフォマティクスにおける一連の手法であり、タンパク質やRNA配列の一次構造(それぞれアミノ酸配列またはヌクレオチド配列)の情報のみに基づいて、それらの局所的な二次構造を予測することを目的としています。タンパク質の場合、予測はアミノ酸配列の領域を、可能性の高いαヘリックス、βストランド(しばしば伸長コンフォメーションと呼ばれる)、またはターンとして割り当てることから成ります。予測の成功は、タンパク質の結晶構造に適用されたDSSPアルゴリズムの結果と比較することによって判断されます。核酸の場合は、水素結合パターンから判断されることがあります。タンパク質の膜貫通ヘリックスやコイルドコイル、RNAの典型的なマイクロRNA構造など、特定の明確なパターンを検出するために、専用のアルゴリズムが開発されています。
この方法の考え方は、進化的に関連するタンパク質の情報を使用して、新しいアミノ酸配列の二次構造を予測することです。PSI BLASTは、関連する配列を見つけて位置特異的スコアリングマトリックスを構築するために使用されます。このマトリックスは、入力配列の二次構造を予測するように構築およびトレーニングされた人工ニューラルネットワークによって処理されます[ 3 ] [ 6 ]。つまり、これは機械学習法です[ 7 ] [ 8 ]。
予測方法またはアルゴリズムは、配列プロファイルの生成、初期二次構造の予測、予測された構造のフィルタリングの 3 つの段階に分かれています。[ 9 ] PSIPRED は、PSIBLAST によって生成された配列プロファイルを正規化します。[ 3 ] 次に、ニューラル ネットワークを使用して、初期二次構造を予測します。配列内の各アミノ酸について、ニューラル ネットワークには 15 個のアミノ酸のウィンドウが入力されます。ウィンドウが鎖の N 末端または C 末端にまたがるかどうかを示す追加情報が付加されます。これにより、最終的な入力層は 315 個の入力ユニットで構成され、21 個のユニットからなる 15 のグループに分割されます。ネットワークには 75 個のユニットからなる 1 つの隠れ層と 3 つの出力ノード (各二次構造要素 (らせん、シート、コイル) に 1 つ) があります。[ 6 ]
2 番目のニューラルネットワークは、最初のネットワークの予測構造をフィルタリングするために使用されます。このネットワークにも 15 ポジションのウィンドウが入力されます。鎖末端でのウィンドウの可能な位置を示すインジケーターも転送されます。これにより、4 つずつ 15 グループに分けられた 60 個の入力ユニットが得られます。ネットワークには 60 個のユニットからなる 1 つの隠れ層があり、3 つの出力ノード (各二次構造要素 (らせん、シート、コイル) に 1 つずつ) が得られます。[ 9 ]
3 つの最終出力ノードは、ウィンドウの中心位置の各二次構造要素に対してスコアを出力します。最も高いスコアを持つ二次構造を使用して、PSIPRED はタンパク質予測を生成します。[ 9 ] Q3 値は、二次構造状態、すなわちヘリックス、ストランド、およびコイルで正しく予測された残基の割合です。[ 9 ]