約4万個のプローブがスポットされたオリゴマイクロアレイの例。詳細を示すために拡大した挿入図付き。マイクロアレイ解析技術は、DNA(遺伝子チップ解析)、RNA、およびタンパク質マイクロアレイを用いた実験から得られたデータの解釈に使用され、研究者は、多数の遺伝子(多くの場合、生物の全ゲノム)の発現状態を単一の実験で調査することができます。[ 1 ]このような実験では非常に大量のデータが生成され、研究者は細胞や生物の全体的な状態を評価することができます。このような大量のデータは、コンピュータプログラムの助けなしには分析することが困難、あるいは不可能です。
導入
マイクロアレイデータ解析は、マイクロアレイチップによって生成されたデータの読み取りと処理の最終段階です。サンプルは、精製やマイクロチップを使用したスキャンなど、さまざまなプロセスを経て、コンピュータソフトウェアによる処理が必要な大量のデータが生成されます。これは、下の図に示すように、いくつかの明確なステップから構成されます。いずれかのステップを変更すると解析結果が変わるため、一連の標準的な戦略を特定するためにMAQCプロジェクト[ 2 ]が作成されました。MAQCプロトコルを使用して完全な解析を実行する企業も存在します。[ 3 ]
マイクロアレイ実験に必要な手順テクニック
国立毒性研究センターの科学者がマイクロアレイデータを検証するアフィメトリクスやアジレントなどのマイクロアレイメーカーのほとんどは、マイクロアレイ製品とともに商用データ解析ソフトウェアを提供しています。 [ 4 ]また、マイクロアレイデータの解析にさまざまな方法を利用するオープンソースのオプションもあります。
集計と正規化
2 つの異なるアレイまたは同じアレイにハイブリダイズされた 2 つの異なるサンプルを比較する場合、一般的には手順の違いや色素強度効果によって生じる系統誤差の調整が必要になります。2 色のアレイの色素正規化は、多くの場合、局所回帰によって行われます。LIMMA は、背景補正とスケーリングのためのツールセットと、スライド上の重複スポットを平均化するオプションを提供します。[ 5 ]アレイの正規化がどの程度適切かを評価する一般的な方法は、データのMA プロットを作成することです。MA プロットは、R や MATLAB などのプログラムや言語を使用して作成できます。[ 6 ] [ 7 ]
生の Affy データには、同じ RNA ターゲットに対して約 20 個のプローブが含まれています。これらの半分は、ターゲット配列と正確に一致しない「ミスマッチ スポット」です。これらは、理論的には、特定のターゲットに対する非特異的結合の量を測定することができます。ロバスト マルチ アレイ平均 (RMA) [ 8 ]は、これらのミスマッチ スポットを利用しない正規化アプローチですが、メディアン ポリッシュによって完全な一致を要約する必要があります。[ 9 ]メディアン ポリッシュ アルゴリズムは、ロバストではありますが、分析されたサンプルの数によって動作が異なります。[ 10 ]また、RMA の一部である分位点正規化は、さらなる比較を意味のあるものにするために、アレイのバッチを正規化する合理的なアプローチの 1 つです。
完全一致プローブと不一致プローブの両方を使用する現在のアフィメトリクスMAS5アルゴリズムは、引き続き人気があり、直接比較テストで良好な結果を示しています。[ 11 ]
アジレント社のMAS5アルゴリズムの動作原理を示すフローチャート。頑健なマイクロアレイ要約のための因子分析(FARMS) [ 12 ]は、完全一致プローブレベルでアレイデータを要約するためのモデルベースの手法です。これは、ガウス測定ノイズの仮定の下でベイズ最大事後確率法によってモデルパラメータを最適化する因子分析モデルに基づいています。Affycompベンチマーク[ 13 ]によると、FARMSは感度と特異度に関して他のすべての要約手法を上回りました。
有意な差次的発現の同定
異常なレベルの過剰発現または低発現を示すアレイプローブを特定するための戦略は数多く存在する。最も単純な方法は、処理群間で平均で少なくとも2倍異なるプローブを「有意」とみなすことである。より洗練されたアプローチは、効果量と変動性の両方を考慮に入れるt検定やその他のメカニズムに関連していることが多い。興味深いことに、特定の遺伝子に関連付けられたp値は、反復実験間でうまく再現されず、単純なフォールドチェンジによって生成されたリストの方がはるかに優れたパフォーマンスを示す。[ 14 ] [ 15 ]これは、実験を行う目的が一般的な挙動を予測することにあるため、非常に重要な観察である。MAQCグループは、フォールドチェンジ評価と厳密でないp値カットオフを使用することを推奨しており、さらに、バックグラウンド補正とスケーリングプロセスの変更は、フォールドチェンジの差の順位に最小限の影響しか与えないが、p値には大きな影響を与えることを指摘している。[ 14 ]
クラスタリング
クラスタリングは、類似した発現パターンを持つ遺伝子をグループ化するために用いられるデータマイニング手法である。階層的クラスタリングとk平均法クラスタリングは、マイクロアレイ解析において広く用いられている手法である。
階層的クラスタリング
階層的クラスタリングは、比較的均質なクラスターを見つけるための統計的手法です。階層的クラスタリングは、2 つの独立したフェーズで構成されます。最初に、遺伝子間のすべてのペアワイズ距離を含む距離行列が計算されます。ピアソン相関係数とスピアマン相関係数は、類似度推定値としてよく使用されますが、マンハッタン距離やユークリッド距離などの他の方法も適用できます。利用可能な距離尺度の数と、それらがクラスタリングアルゴリズムの結果に与える影響を考慮して、いくつかの研究では、マイクロアレイデータのクラスタリングのために、さまざまな距離尺度を、その固有の特性とノイズに対する堅牢性を考慮して比較および評価しています。[ 16 ] [ 17 ] [ 18 ]初期距離行列の計算後、階層的クラスタリングアルゴリズムは、(A) 単一のデータポイントから始めて最も近い 2 つのクラスターを繰り返し結合するか (凝集型、ボトムアップ アプローチ、これはかなり一般的に使用されています)、または (B) 完全なセットから始めてクラスターを繰り返し分割します (分割型、トップダウン アプローチ)。各ステップの後、新しく形成されたクラスターと他のクラスター間の新しい距離行列が再計算されます。階層的クラスタ分析手法には、次のものがあります。
- 単連結法(最小法、最近傍法)
- 平均連結法(UPGMA)
- 完全連結法(最大法、最遠隣接法)
様々な研究により、単連結クラスタリングアルゴリズムを遺伝子発現マイクロアレイデータに適用すると結果が悪くなることが経験的に示されており、したがって避けるべきである。[ 18 ] [ 19 ]
K平均クラスタリング
K平均クラスタリングは、パターンに基づいて遺伝子またはサンプルをK個のグループにグループ化するアルゴリズムです。グループ化は、データと対応するクラスタ中心間の距離の二乗和を最小化することによって行われます。したがって、K平均クラスタリングの目的は、類似の発現に基づいてデータを分類することです。[ 20 ] K平均クラスタリングアルゴリズムとそのいくつかのバリアント(k-メドイドを含む)は、遺伝子発現データに対して良好な結果(少なくとも階層的クラスタリング法よりも優れている)を生成することが示されています。k平均、k-メドイド、階層的方法、およびさまざまな距離尺度の経験的比較は文献で見つけることができます。[ 18 ] [ 19 ]
マイクロアレイの有意性分析(SAM)

マイクロアレイの有意性解析(SAM)は、遺伝子発現の変化が統計的に有意であるかどうかを判断するために、2001年にバージニア・タッシャー、ロバート・ティビシラニ、ギルバート・チューによって確立された統計的手法です。DNAマイクロアレイの登場により、単一のハイブリダイゼーション実験で数千の遺伝子の発現を測定することが可能になりました。生成されるデータは膨大であり、何が有意で何が有意でないかを選別する方法が不可欠です。SAMはスタンフォード大学によってRパッケージとして配布されています。[ 31 ]
SAM は、遺伝子特異的t 検定を実行することで統計的に有意な遺伝子を特定し、各遺伝子jに対して統計量d jを計算します。これは、遺伝子発現と応答変数との関係の強さを測定します。[ 32 ] [ 33 ] [ 34 ]この分析では、データが正規分布に従わない可能性があるため、ノンパラメトリック統計を使用します。応答変数は、実験条件に基づいてデータを記述およびグループ化します。この方法では、データの繰り返し順列を使用して、いずれかの遺伝子の発現が応答と有意に関連しているかどうかを判断します。順列ベースの分析を使用すると、遺伝子の相関が考慮され、個々の遺伝子の分布に関するパラメトリックな仮定が回避されます。これは、等分散および/または遺伝子の独立性を仮定する他の手法 ( ANOVAおよびBonferroniなど)よりも優れています。[ 35 ]
基本プロトコル
- オリゴヌクレオチドおよびcDNAプライマーを用いたDNAマイクロアレイ、SNPアレイ、タンパク質アレイなど、マイクロアレイ実験を実施します。これにより、遺伝子発現、遺伝的変異、またはタンパク質間相互作用のハイスループット解析が可能になります。
- Microsoft Excel の入力式分析 — 下記参照
- SAMをMicrosoft Excelアドインとして実行する
- Delta チューニング パラメータを調整して、許容可能な偽発見率 (FDR) とともに有意な数の遺伝子を取得し、SAM Plot Controller で発現の平均差を計算してサンプル サイズを評価します。
- 発現差のある遺伝子(正に発現している遺伝子と負に発現している遺伝子)を一覧表示する
SAMを実行中
- SAMは、登録手続きを完了後、学術ユーザーおよび非学術ユーザー向けにhttp://www-stat.stanford.edu/~tibs/SAM/からオンラインでダウンロードできます。
- SAMはExcelアドインとして実行され、SAMプロットコントローラーでは偽発見率とデルタをカスタマイズできます。また、SAMプロットとSAM出力機能では、有意遺伝子のリスト、デルタテーブル、およびサンプルサイズの評価が生成されます。
- 順列はサンプル数に基づいて計算されます
- ブロック順列
- ブロックはマイクロアレイのバッチです。たとえば、8 つのサンプルを 2 つのグループ (コントロールと罹患) に分割すると、各ブロックに 4!=24 通りの順列があり、順列の総数は (24)(24)= 576 通りになります。最低 1000 通りの順列が推奨されます。[ 32 ] [ 36 ] [ 37 ]
SAMを実行するデータセットに正しい値を代入する際に、順列の数はユーザーによって設定されます。
タイプ: [ 32 ]
- 定量的― 実数値(心拍数など)
- 1つのクラスは、平均遺伝子発現がゼロと異なるかどうかをテストします。
- 2つのクラス― 2つの測定セット
- 非対応— 2つのグループで測定単位が異なる。例:異なる患者からのサンプルを用いた対照群と治療群
- ペアリング— 2つのグループで同じ実験単位が測定される。例:同じ患者から採取した治療前後のサンプル。
- 多クラス分類― それぞれ異なる実験単位を含む2つ以上のグループ。2クラス非対応型の一般化
- 生存期間― ある事象(例えば、死亡や再発)までの時間を示すデータ
- 時間経過— 各実験単位は複数の時点で測定される。実験単位は1クラスまたは2クラス設計に分類される。
- パターン発見— 明示的な応答パラメータは指定されません。ユーザーは発現データの固有遺伝子(主成分)を指定し、それを定量的応答として扱います。
アルゴリズム
SAMは、発現データの順列解析に基づいて遺伝子発現の相対差の検定統計量を計算し、偽発見率を計算します。プログラムの主な計算は以下に示されています。[ 32 ] [ 33 ] [ 34 ]


定数s oは、 d iの変動係数を最小化するように選択されます。r i は、 y 実験条件下における遺伝子iの発現レベル (x) に等しくなります。

フォールドチェンジ(t)は、有意な変化を示す遺伝子が、少なくとも事前に指定された量だけ変化することを保証するものです。つまり、2つの条件それぞれにおける遺伝子の平均発現レベルの絶対値は、正の変化を示すためにはフォールドチェンジ(t)よりも大きく、負の変化を示すためにはフォールドチェンジ(t)の逆数よりも小さくなければなりません。
SAMアルゴリズムは次のように表すことができます。
- 検定統計量を大きさ順に並べる[ 33 ] [ 34 ]
- 各順列について、順序付けられたヌル(影響を受けない)スコアを計算します[ 33 ] [ 34 ]
- 順序付き検定統計量を期待される帰無スコアに対してプロットします[ 33 ] [ 34 ]
- 各遺伝子の検定統計量の絶対値からその遺伝子の平均検定統計量を引いた値が規定の閾値よりも大きい場合、その遺伝子は有意であると判断します[ 34 ]。
- 期待値と観測値に基づいて偽発見率を推定する[ 33 ] [ 34 ]
出力
- 重要な遺伝子セット
- 正の遺伝子セット — 遺伝子セット内のほとんどの遺伝子の発現量が高いほど、表現型yの値が高くなる。
- 負の遺伝子セット — 遺伝子セット内のほとんどの遺伝子の発現が低いほど、表現型yの値が高くなる。
エラー修正と品質管理
品質管理
アレイ全体には、目視検査、同じ実験グループ内のアレイとのペアワイズ比較、またはRNA分解の分析によって検出可能な明らかな欠陥がある可能性があります。[ 39 ]これらのアレイを分析から完全に除外することで、結果が改善される可能性があります。
スポットフィルタリング
印刷不良や洗浄不良などの局所的な欠陥を視覚的に確認することで、個々のスポットを除去する必要性が示唆される場合もある。アレイの製造品質によっては、これにはかなりの時間を要する可能性がある。さらに、一部の手順では、特定の強度閾値以下の発現値を持つすべてのスポットを除去する必要がある。
参考文献
- 1 2 Subramanian A、Tamayo P、Mootha VK、et al. (2005)。「遺伝子セット濃縮分析:ゲノムワイド発現プロファイルを解釈するための知識ベースのアプローチ」。Proc . Natl . Acad . Sci. USA。102 ( 43 ) : 15545–50。doi : 10.1073/ pnas.0506580102。PMC 1239896。PMID 16199517。
- ↑レミング・シー博士、国立毒性研究センター。「マイクロアレイ品質管理(MAQC)プロジェクト」。米国食品医薬品局。2005年12月8日のオリジナルからアーカイブ。 2007年12月26日取得。
- ↑ 「GenUs BioSystems - サービス - データ分析」 。 2008年1月2日取得。
- ↑ 「Agilent | DNA Microarrays」 。 2007年12月22日にオリジナルからアーカイブ済み。2008年1月2日に取得。
- ↑ 「LIMMAライブラリ:マイクロアレイデータのための線形モデル」 。 2008年1月1日取得。
- ↑ Gatto, Laurent; Breckels, Lisa M.; Naake, Thomas; Gibb, Sebastian (2015). "RとBioconductorを使用したプロテオミクスデータの可視化" . Proteomics . 15 (8): 1375– 1389. doi : 10.1002/pmic.201400392 . ISSN 1615-9853 . PMC 4510819 . PMID 25690415 .
- ↑ 「マイクロアレイデータの強度対比率散布図の作成 - MATLAB mairplot」。MathWorks 。 2023年11月24日取得。
- ↑ Irizarry, RA ; Hobbs, B; Collin, F; Beazer-Barclay, YD; Antonellis, KJ; Scherf, U; Speed, TP (2003). "高密度オリゴヌクレオチドアレイプローブレベルデータの探索、正規化、および要約" . Biostatistics . 4 (2): 249– 64. doi : 10.1093/biostatistics/4.2.249 . PMID 12925520 .
- ↑ Bolstad BM、Irizarry RA、Astrand M、Speed TP (2003)。 「分散とバイアスに基づく高密度オリゴヌクレオチドアレイデータの正規化方法の比較」。Bioinformatics。19 ( 2): 185–93。doi : 10.1093 /bioinformatics/19.2.185。PMID 12538238。
- ↑ Giorgi FM、Bolger AM、Lohse M、Usadel B (2010)。「マイクロアレイデータのメディアンポリッシュ要約におけるアルゴリズム駆動型アーティファクト」。BMC Bioinformatics。11:553。doi:10.1186 / 1471-2105-11-553。PMC 2998528。PMID 21070630。
- ↑ Lim WK、Wang K、Lefebvre C、Califano A (2007)。 「マイクロアレイ正規化手順の比較分析:遺伝子ネットワークのリバースエンジニアリングへの影響」。Bioinformatics。23 ( 13 ) : i282–8。doi : 10.1093/bioinformatics/btm201。PMID 17646307。
- ↑ Hochreiter S、 Clevert DA、Obermayer K (2006)。「Affymetrixプローブレベルデータの新しい要約方法」。Bioinformatics。22 ( 8 ): 943–949。doi : 10.1093/bioinformatics / btl033。PMID 16473874。
- ↑ 「Affycomp III:Affymetrix GeneChip発現測定のベンチマーク」。
- 1 2 Shi L、Reid LH、Jones WD、et al. (2006)。「マイクロアレイ品質管理(MAQC)プロジェクトは、遺伝子発現測定のプラットフォーム間およびプラットフォーム内再現性を示しています」。Nat . Biotechnol . 24 (9): 1151–61 . doi : 10.1038/nbt1239 . PMC 3272078. PMID 16964229 .
- ↑ Guo L、Lobenhofer EK、Wang C、et al. (2006)。「ラット毒性ゲノム研究により、マイクロアレイプラットフォーム間での分析の一貫性が明らかになった」。Nat . Biotechnol . 24 (9): 1162–9 . doi : 10.1038/nbt1238 . PMID 17061323. S2CID 8192240 .
- ↑ジェントルマン、ロバート他 (2005). RとBioconductorを用いたバイオインフォマティクスと計算生物学ソリューション. ニューヨーク: Springer Science+Business Media. ISBN 978-0-387-29362-2。
- ↑ Jaskowiak, Pablo A.; Campello, Ricardo JGB; Costa, Ivan G. (2013). "遺伝子発現マイクロアレイデータのクラスタリングのための近接度尺度:検証方法論と比較分析". IEEE /ACM Transactions on Computational Biology and Bioinformatics . 10 (4): 845–857 . doi : 10.1109/TCBB.2013.9 . PMID 24334380. S2CID 760277 .
- 1 2 3 Jaskowiak, Pablo A; Campello, Ricardo JGB; Costa, Ivan G (2014). "遺伝子発現データクラスタリングに適した距離の選択について" . BMC Bioinformatics . 15 (Suppl 2): S2. doi : 10.1186/1471-2105-15-S2-S2 . PMC 4072854 . PMID 24564555 .
- 1 2デ・ソウト、マルシリオ CP。コスタ、イヴァン G.デ・アラウホ、ダニエルSA;ルデルミール、テレサ B.シュリープ、アレクサンダー (2008)。「がん遺伝子発現データのクラスタリング: 比較研究」。BMCバイオインフォマティクス。9 (1): 497.土井: 10.1186/1471-2105-9-497。PMC 2632677。PMID 19038021。
- ↑ 「ホーム」 . biostat.ucsf.edu .
- ↑ 「Ingenuity Systems」 。 2007年12月31日取得。
- ↑ 「Ariadne Genomics: Pathway Studio」。2007年12月30日にオリジナルからアーカイブ済み。2007年12月31日に取得。
- ↑ 「FunRich: 機能的濃縮分析」 。 2014年9月9日取得。
- ↑ [「マイクロアレイの有意性分析」 。 2007年12月31日取得。]
- ↑ 「ソフトウェア - 広範」 。 2007年12月31日取得。
- ↑ 「BioCarta - 生命の経路を図示する」 。 2007年12月31日取得。
- ↑ Vinayagam A、Hu Y、Kulkarni M、Roesel C、et al. (2013). "ハイスループットデータセットのためのタンパク質複合体ベースの解析フレームワーク。6、rs5 (2013)" . Sci. Signal . 6 (r5): rs5. doi : 10.1126/scisignal.2003629 . PMC 3756668 . PMID 23443684 .
- ↑ 「DBI Web」。2007年7月5日にオリジナルからアーカイブ済み。2007年12月31日に取得。
- ↑ 「SCOPE」。2011年8月17日にオリジナルからアーカイブ済み。2007年12月31日に取得。
- ↑ "RssGsc" . 2008年10月15日取得。
- ↑ "SAM: マイクロアレイの有意性分析" . tibshirani.su.domains . 2023-11-24に取得.
- 1 2 3 4 5 6 7 8 9 Chu, G.、Narasimhan, B、Tibshirani, R、Tusher, V.「SAM「マイクロアレイの有意性分析」ユーザーガイドおよび技術文書」
- 1 2 3 4 5 6 7 8 9 Zang, S.; Guo, R.; et al. (2007). "発現プロファイリング研究におけるデータ解析の感度と特異度を向上させるための統計的推論手法と新しい制御尺度の統合" . Journal of Biomedical Informatics . 40 (5): 552– 560. doi : 10.1016/j.jbi.2007.01.002 . PMID 17317331 .
- 1 2 3 4 5 6 7 8 9 <Zhang, S. (2007). "SAM、SAM Rパッケージの包括的な評価と、そのパフォーマンスを向上させるための簡単な修正" BMC Bioinformatics 8: 230.
- 1 2 3 Tusher, VG; Tibshirani, R.; et al. (2001). "電離放射線応答に適用されたマイクロアレイの有意性分析" (PDF) . Proceedings of the National Academy of Sciences . 98 (9): 5116– 5121. Bibcode : 2001PNAS...98.5116G . doi : 10.1073/pnas.091062498 . PMC 33173 . PMID 11309499 .
- ↑ Dinu, IP; JD; Mueller, T; Liu, Q; Adewale, AJ; Jhangri, GS; Einecke, G; Famulski, KS; Halloran, P; Yasui, Y. (2007). "SAM-GSによるマイクロアレイデータの遺伝子セット解析の改善" . BMC Bioinformatics . 8 : 242. doi : 10.1186/1471-2105-8-242 . PMC 1931607 . PMID 17612399 .
- ↑ Jeffery, IH; DG; Culhane, AC. (2006). "マイクロアレイデータから差次的発現遺伝子リストを生成する方法の比較と評価" . BMC Bioinformatics . 7 : 359. doi : 10.1186/1471-2105-7-359 . PMC 1544358 . PMID 16872483 .
- ↑
- ↑ Wilson CL、Miller CJ (2005)。 「Simpleaffy: Affymetrix品質管理とデータ解析のためのBioConductorパッケージ」。Bioinformatics。21 ( 18): 3683–5。doi : 10.1093 /bioinformatics/ bti605。PMID 16076888。
- ↑ 「J. クレイグ・ベンター研究所 - ソフトウェア」 。 2008年1月1日取得。
- ↑ 「Agilent | GeneSpring GX」 。 2008年1月2日取得。
- ↑ 「Ocimum Biosolutions | Genowiz」。2009年11月24日にオリジナルからアーカイブ済み。2009年4月2日に取得。
外部リンク
- ArrayExplorer - マイクロアレイを並べて比較し、研究ニーズに最適なものを見つけましょう
- FARMS - 堅牢なマイクロアレイ要約のための因子分析、Rパッケージ— ソフトウェア
- StatsArray - オンラインマイクロアレイ解析サービス- ソフトウェア
- ArrayMining.net - マイクロアレイデータのオンライン解析用ウェブアプリケーション- ソフトウェア
- FunRich - 遺伝子セット濃縮解析を実行するソフトウェア
- 生命科学リファレンスモジュールにおける比較トランスクリプトミクス解析
- SAMのダウンロード手順
- GeneChip®発現解析-データ解析の基礎(アフィメトリックス社刊)
- デューク大学データ分析基礎マニュアル