Bioconductorは、分子生物学におけるウェットラボ実験によって生成されたゲノムデータの解析と理解のための、無料のオープンソースかつオープン開発のソフトウェアプロジェクトです。
Bioconductorは主に統計プログラミング言語Rをベースとしていますが、他のプログラミング言語による貢献も含まれています。Rの半年ごとのリリースに合わせて、年に2回リリースされます。常にリリースバージョン(Rのリリースバージョンに対応)と開発バージョン( Rの開発バージョンに対応)が存在します。ほとんどのユーザーは、リリースバージョンがニーズに適していると感じるでしょう。さらに、主に、ただしそれだけに限らず、さまざまな種類のマイクロアレイに対応したゲノムアノテーションパッケージが多数利用可能です。
このプロジェクトは2001年秋に開始され、主にフレッド・ハッチンソンがん研究センターを拠点とするバイオコンダクターの中核チームが監督しており、その他のメンバーは国際的な研究機関から参加している。
Bioconductorのコンポーネントのほとんどは、RのアドオンモジュールであるRパッケージとして配布されています。当初、Bioconductorソフトウェアパッケージのほとんどは、シングルチャネルのAffymetrixマイクロアレイと、2チャネル以上のcDNA /オリゴマイクロアレイの解析に重点を置いていました。プロジェクトが成熟するにつれて、ソフトウェアパッケージの機能範囲は拡大し、SAGE、シーケンス、SNPデータなど、あらゆる種類のゲノムデータの解析が含まれるようになりました。
これらのプロジェクトの大まかな目標は以下のとおりです。
Bioconductor の各リリースは、選択されたバージョンの R で最適に動作するように開発されています。[ 1 ]バグ修正やアップデートに加えて、新しいリリースでは通常パッケージが追加されます。以下の表は、Bioconductor のリリースと R のバージョンを対応付け、そのリリースで利用可能な Bioconductor ソフトウェア パッケージの数を示しています。
小型RNAシーケンスは、RNAを介した遺伝子サイレンシングプロセス、またはRNAサイレンシング/遺伝子サイレンシングプロセスとして知られるプロセスにおいて重要な役割を果たすマイクロRNA(miRNA)、低分子干渉RNA(siRNA)、piwi相互作用RNA (piRNA)を研究するために広く使用されている技術です。RNAサイレンシングプロセスでは、さまざまな種類の基質が使用され、マイクロRNA、siRNAなど、さまざまな種類のRNA集団が生成されます。実験室では、小型RNAシーケンスは通常、細胞または組織からのRNA抽出から始まり、小型RNAの5'末端と3'末端へのアダプターライゲーション、逆転写、PCR増幅を経てcDNAライブラリーが生成されます。最後に、ハイスループットシーケンス(最も一般的なのはIlluminaプラットフォーム)を使用して、数百万のショートリードが生成されます。これらの結果データは、特定の種の参照ゲノムまたはmiRNAデータベースにリードをアラインメントするために、計算処理を受けます。
Bioconductor (BioC) [ 2 ]は、さまざまなタイプの小型 RNA シーケンスおよびゲノムデータを解析するための広く使用されているオープンソース プラットフォームです。主にR プログラミング言語を使用し、バイオインフォマティクスおよび計算生物学のための幅広いパッケージを提供しています。Bioconductor は、小型 RNA seq データを処理するための幅広いパッケージ[ 3 ]を提供しており、その中でも研究者によって広く使用されているものがいくつかあります。DESeq2 [ 4 ]、edgeR [ 5 ]、limma + voom [ 6 ] [ 7 ]、GenomicAlignment [ 8 ] 、GenomicFeatures [ 8 ]、Rsubread [ 9 ]、ShortRead [ 10 ] 、 featureCounts [ 11 ]などの人気のある Bioconductor パッケージは、 RNA-seq データの堅牢な解析を提供します。[ 12 ]
RNA-seq データのリードカウントの差分発現解析には、負の二項分布モデルを使用します。[ 13 ]これは、分散推定、正規化、および PCA プロットやMA プロットによる可視化によく使用されます。[ 4 ]
また、RNA seq データのリードカウントの差分発現解析には負の二項分布モデルを使用します。DESeq2 とは対照的に、サンプル数が比較的少ない場合に使用されます。[ 5 ] [ 13 ]
これは、カウントデータの平均-分散関係を推定し、それをlog2カウント/百万(CPM)に変換するために使用されます。マイクロアレイデータの解析や、RNA-seqデータからのCPM値の計算にも使用されます。[ 6 ]
BAMやSAMファイルのアライメントのようなリードは、下流解析のためにアライメントされたリードを遺伝子やmiRNAに割り当てるために広く普及している。[ 8 ] [ 14 ]
これは、GTF/GFF ファイルから遺伝子、エクソン、転写産物に関する情報を格納する TxDb オブジェクトのような転写産物中心の注釈データベースを構築するために使用されます。[ 8 ] [ 15 ]
これは主にリードの要約とマッピングに使用され、align()、featureCounts()などの関数はSTARやHISAT2などの外部アライナーの効率的な代替手段を提供するために使用されます。[ 16 ]
これは、Illuminaシーケンスなどのシーケンスプラットフォームから得られる生のFASTQデータの品質をチェックするために、生のFASTQファイルを前処理するためによく使用されます。[ 10 ]
FASTQファイル[ 17 ]は通常、ShortRead [ 10 ]などのさまざまなBioconductorパッケージを使用してインポートされ、品質評価レポートが提供されます。
Cutadapt [ 18 ] 、 trimmomatic [ 19 ]などのさまざまな外部ツールを使用して、生のFASTQファイルからアダプター配列を除去します。これにより、リードの品質が向上します。
処理されたリードは参照ゲノムにアライメントされます。このアライメントは、Rsubreadなどのさまざまなアライナー、またはSTARなどの外部ツールを使用して実行でき、結果はSAM(Sequence Alignment Map)ファイルやBAM(Binary Alignment Map)ファイルなどの標準形式で保存されます。
BioconductorはmiRBaseデータの統合をサポートしており、miRBaseConverter [ 20 ] 、 AnnotationHub [ 21 ] 、 org.Mm.eg.db [ 22 ]などのさまざまなパッケージを使用してリードを既知のmiRNAに注釈付けします。
カウントされたリードは既知の遺伝子またはマイクロRNAにマッピングされ、サンプル全体にわたるカウントを要約します。
マイクロRNAの発現をマッピングおよび定量化した後、 DESeq2 、edgeRなどの確立された様々なパッケージを使用して、差次的発現解析を行います。
miRNA発現結果を解釈および提示するために、ggplot2 [ 23 ] pheatmap [ 24 ] ComplexHeatmapなどのさまざまな可視化パッケージが使用され、 Volcanoプロット(統計)、PCAプロット(主成分分析)、MAプロットが生成されます。pheatmapは、差分発現データを可視化するために使用されます。