PICRUSt [ 1 ]はバイオインフォマティクスソフトウェアパッケージ です。この名前はPhylogenetic Investigation of Communities by Reconstruction of Unobserved States の略です。
このツールはメタゲノム解析の分野で使用され、 1つまたは複数のサンプルに沿ったマーカー遺伝子調査に基づいて微生物 群集の機能プロファイルを推定することができます。基本的に、PICRUStは、各サンプルにおけるマーカー遺伝子配列(最も一般的には16Sクラスター)とその相対存在量を表す、ユーザーが提供する操作的分類単位テーブル(通常OTUテーブルと呼ばれる)を受け取ります。PICRUStの出力は、サンプルと機能遺伝子カウントのマトリックスであり、調査対象の各サンプルにおける各機能遺伝子のカウントを示します。PICRUStが特定のサンプルの機能遺伝子プロファイルを推定する能力は、既知の配列ゲノムのセットに依存します。これは、16SリボソームRNAアンプリコンライブラリに配列が見つかった生物に存在する可能性のある遺伝子ファミリーを手動で調査する自動化された代替手段と考えることもできます。以下の説明はPICRUStのオリジナルバージョンに対応していますが、このツールのメジャーアップデートが現在開発中です。[ 2 ]
初期前処理段階では、PICRUSt は、配列決定されたゲノムを持つ生物を参照として使用し、参照ツリー内の各細菌および古細菌株における各遺伝子ファミリーのコピー数について信頼区間と点予測を構築します。より具体的には、PICRUSt は各遺伝子ファミリーについて、既知の遺伝子コピー数 (完全な配列決定されたゲノムから) を参照の生命のツリーにマッピングします。これらの遺伝子ファミリーのコピー数は連続形質として扱われ、ブラウン運動の仮定の下で進化モデルが構築されます。これらの進化モデルは、最尤法、緩和最尤法、またはワグナー最小進化法のいずれかを使用して構築できます。この進化モデルは、配列決定されたゲノムを持たない微生物のコピー数について点推定値と信頼区間の両方を予測するために使用されます。この「ゲノム予測」ステップでは、細菌の種類 (具体的には操作的分類単位(OTU)) と遺伝子ファミリー のコピー数の関係を示す大きな表が生成されます。この表はエンドユーザーに配布されます。この予測方法は、最近傍法(つまり、最も近い配列決定済みのゲノムを検索する方法)とは異なる点に注意が必要です。この方法は、最近傍法に比べて精度がわずかではあるものの有意に向上することが示されています。ただし、 PICRUStでは最近傍法による予測もオプションとして利用可能です。
特筆すべきは、この機能は通常、細菌における遺伝子コピー数の予測に使用されるが、原理的には、多様な生物の形質データと参照系統樹が与えられた場合、他のあらゆる連続形質の予測にも使用できるということである。
Langilleら[ 1 ]は、入力されたシーケンス済みゲノムセットに対してリーブワンアウト交差検証を使用して、このゲノム予測ステップの精度をテストした。追加のテストでは、系統推定のエラー、ゲノムデータの不足、および遺伝子内容の信頼区間の精度に対する感度を調べた。
同様の手順で、16S rRNA遺伝子のコピー数を予測する。
PICRUStを16S rRNA遺伝子ライブラリに適用すると、PICRUStは参照操作分類単位( OTU)をテーブルと照合し、各遺伝子ファミリーの予測16S rRNAコピー数と遺伝子コピー数を取得します。各OTUの存在量は、その予測コピー数で除算され(細菌が複数の16Sコピーを持つ場合、16S rRNAデータにおける見かけの存在量は過大評価されます)、次に遺伝子ファミリーのコピー数を乗算します。これにより、サンプル(メタゲノム)全体の遺伝子含有量に対する各OTUの寄与が予測されます。最後に、これらの個々の寄与を合計して、メタゲノムに存在する遺伝子の推定値を生成します。
Langille et al., 2013 [ 1 ]は、同じ生物学的サンプルに対して 16S rRNA 遺伝子増幅とショットガンメタゲノミクスを実施した既報のデータセットを使用して、このゲノム予測ステップの精度をテストしました。これらのケースでは、ショットガンメタゲノミクスの結果が「真の」コミュニティの代表として扱われ、16S rRNA 遺伝子アンプリコンライブラリが PICRUSt に入力され、これらのデータの予測が試みられました。テストデータセットには、ヒトマイクロバイオームプロジェクトのヒトマイクロバイオームサンプル、土壌サンプル、多様な哺乳類サンプル、およびゲレロネグロ微生物マットのサンプルが含まれていました。
PICRUSt および進化比較ゲノミクス全般は、配列決定されたゲノムに依存するため、十分に研究された環境 (多くの配列決定されたゲノム) からの生物学的サンプルは、十分に研究されていない環境よりも予測精度が高くなります。利用可能なゲノムの数を評価するために、PICRUSt ではオプションで、ユーザーがサンプルの最近傍配列決定分類群インデックス (NSTI) を計算できます。このインデックスは、サンプル内の各16S rRNA遺伝子配列と、完全に配列決定されたゲノムからの 16S rRNA 遺伝子配列との間の平均系統発生距離を反映しています。一般的に、NSTI スコアが低いほど、PICRUSt の予測精度は高くなります。たとえば、[ 1 ]は、PICRUSt が、配列決定された近縁種が存在しない細菌を多数含むゲレーロ・ネグロの微生物マットサンプルよりも 、多様な土壌サンプルおよびヒトマイクロバイオームプロジェクトのサンプルで遥かに正確であることを示しました。
奥田ら(2012年)[ 3 ]は、仮想メタゲノムを予測するために境界付きk近傍法を用いた同様の手法を発表した。彼らはショットガンメタゲノムから抽出した16S rRNA遺伝子配列を用いて手法を検証し、その手法による予測を完全なメタゲノムと比較した。
CopyRighter [ 4 ]は、PICRUSt と同様に、進化モデリングと 系統発生特性予測を使用して、サンプル中の各細菌および古細菌タイプの 16S rRNA 遺伝子配列コピー数を推定し、これらの推定値を使用してコミュニティ構成の推定値を補正します。
PanFP [ 5 ]は同様の手法を提示したが、各分類群のゲノム予測に基づいている。ベンチマークでは、同じデータセットで比較した場合、PICRUSt と非常に類似したパフォーマンスを示した。利点の 1 つは、参照系統樹表にあるものだけでなく、すべての OTU を使用できることである。欠点の 1 つは、信頼区間と進化モデルが構築されないことである。
PAPRICA [ 6 ]は、入力された 16S rRNA 遺伝子配列を、参照ゲノムに対応する既知の系統樹に配置することに基づくメタゲノム予測ツールです。主な予測出力は、酵素委員会番号に対応します。
Piphillin [ 7 ]は、 Second Genome社が開発したツールで、入力された 16S rRNA 遺伝子配列と参照ゲノムの 16S rRNA 遺伝子配列の最近傍クラスタリングに基づいてメタゲノム予測を行います。Second Genome の Web サイトには、このツールを実行するための Web ポータルがあります。このツールは、2020 年の出版物[ 8 ]にまとめられているように、継続的に開発され、検証が行われています。
Tax4Fun [ 9 ]は、 KEGGのすべての生物の 16S リボソーム RNA 遺伝子をSILVA リボソーム RNA データベースで見つかった 16S rRNA 遺伝子配列にリンクすることに基づく同様のツールです。当初、このツールは SILVA データベースで見つかった 16S rRNA 遺伝子配列に限定されていました。しかし、このツールの最新バージョンである Tax4Fun2 は、任意のクラスタリング パイプラインからの OTU またはアンプリコン配列バリアントで使用できます。