
機能ゲノミクスは、遺伝子(およびタンパク質)の機能と相互作用を解明しようとする分子生物学の一分野です。機能ゲノミクスは、ゲノムシーケンスプロジェクトやRNAシーケンスなどのゲノムおよびトランスクリプトームプロジェクトによって生成される膨大なデータを利用します。機能ゲノミクスは、 DNA配列や構造といったゲノム情報の静的な側面とは対照的に、遺伝子転写、翻訳、遺伝子発現の調節、タンパク質間相互作用といった動的な側面に焦点を当てます。機能ゲノミクス研究の重要な特徴は、これらの疑問に対してゲノム全体にわたるアプローチを採用することであり、一般的に、より伝統的な「候補遺伝子」アプローチではなく、ハイスループット法を用います。
機能ゲノミクスを理解するためには、まず機能を定義することが重要です。Graur らは論文[ 1 ]で、機能を 2 つの方法で定義しています。それは「選択効果」と「因果的役割」です。「選択効果」機能とは、形質 (DNA、RNA、タンパク質など) が選択される機能を指します。「因果的役割」機能とは、形質が十分かつ必要となる機能を指します。機能ゲノミクスは通常、「因果的役割」による機能の定義を検証します。
機能ゲノミクスの目標は、遺伝子やタンパク質の機能を理解することであり、最終的にはゲノムのすべての構成要素を理解することです。機能ゲノミクスという用語は、生物の遺伝子やタンパク質を研究するための多くの技術的アプローチを指すためによく使用され、「各遺伝子産物の生化学的、細胞的、および/または生理学的特性」[ 2 ]を含みますが、一部の著者は定義に非遺伝子要素の研究を含めています。[ 3 ]機能ゲノミクスには、時間経過(生物の発生など)や空間(体の部位など)における自然な遺伝的変異の研究、および突然変異などの機能障害の研究も含まれる場合があります。
機能ゲノミクスの真価は、ゲノムおよびプロテオームに関する知識を生成・統合し、生物の動的な特性を理解することにある。これは、単一遺伝子の研究と比較して、ゲノムがどのように機能を規定するのかについて、より包括的な理解をもたらす可能性がある。機能ゲノミクスデータの統合は、システム生物学的手法の一部としてしばしば用いられる。
機能ゲノミクスには、ゲノム自体の機能に関連する側面(変異や多型(一塩基多型(SNP)解析など)に加え、分子活性の測定が含まれます。後者には、トランスクリプトミクス(遺伝子発現)、プロテオミクス(タンパク質産生)、メタボロミクスといった多数の「オミクス」が含まれます。機能ゲノミクスでは、主にマルチプレックス技術を用いて、生物学的サンプル中のmRNAやタンパク質などの多くの、あるいはすべての遺伝子産物の量を測定します。より焦点を絞った機能ゲノミクスのアプローチでは、1つの遺伝子のすべての変異体の機能をテストし、シーケンスを活性の読み取り値として使用することで、変異体の影響を定量化することができます。これらの測定手法を組み合わせることで、様々な生物学的プロセスを定量化し、遺伝子とタンパク質の機能および相互作用に関する理解を深めることを目指します。
遺伝子の系統的なペアワイズ欠失や遺伝子発現の阻害は、物理的に相互作用しない遺伝子であっても、関連する機能を持つ遺伝子を特定するために使用できる。エピスタシスとは、2つの異なる遺伝子のノックアウトによる効果が加算的ではないことを指す。つまり、2つの遺伝子が阻害されたときに生じる表現型は、単一の遺伝子のノックアウトによる効果の合計とは異なる可能性がある。
mRNA(メッセンジャーRNA、タンパク質合成のためのDNA由来のコード化情報)の翻訳によって形成されるタンパク質は、遺伝子発現の調節において重要な役割を果たします。タンパク質がどのように遺伝子発現を調節するのかを理解するには、タンパク質が相互作用するDNA配列を特定する必要があります。DNA-タンパク質相互作用部位を特定するための技術が開発されています。これには、ChIPシーケンス、CUT&RUNシーケンス、およびCalling Cardsが含まれます。[ 4 ]
ゲノム上でアクセス可能な領域を特定するためのアッセイが開発されている。これらのアクセス可能なクロマチン領域は、調節領域の候補となる。これらのアッセイには、ATAC-seq、DNase-Seq、FAIRE-Seqなどがある。

マイクロアレイは、サンプル中の特定の遺伝子またはプローブDNA配列に対応するmRNAの量を測定する。プローブ配列は固体表面に固定化され、蛍光標識された「標的」mRNAとハイブリダイズする。スポットの蛍光強度は、そのスポットにハイブリダイズした標的配列の量、ひいてはサンプル中のそのmRNA配列の存在量に比例する。マイクロアレイを用いることで、異なる条件下での転写産物レベルの変動や、既知の機能を持つ遺伝子との共通の発現パターンに基づいて、特定のプロセスに関与する候補遺伝子を特定することができる。
遺伝子発現の連続解析(SAGE)は、ハイブリダイゼーションではなくRNAシーケンスに基づく代替解析法です。SAGEは、各遺伝子に固有の10~17塩基対のタグのシーケンスに依存しています。これらのタグはポリA mRNAから生成され、シーケンス前に末端同士が連結されます。SAGEは、マイクロアレイのように研究対象となる転写産物を事前に知る必要がないため、細胞あたりの転写産物数を偏りなく測定できます。
2016年に指摘されたように、近年、RNAシーケンスはマイクロアレイやSAGE技術に取って代わり、転写や遺伝子発現を研究する最も効率的な方法となっている。これは通常、次世代シーケンスによって行われる。[ 5 ]
配列決定されたRNAの一部は、低分子RNAと呼ばれる非コードRNA分子の一種であり、転写および転写後遺伝子サイレンシング(RNAサイレンシング)の重要な調節因子である。次世代シーケンシングは、非コードRNAの発見、プロファイリング、および発現解析における標準的なツールである。
大規模並列レポーターアッセイは、多数のDNA配列のシス調節活性を同時にテストするために使用される技術です。[ 6 ] [ 7 ] [ 8 ]典型的なMPRAでは、候補シス調節エレメントの数万個のDNA構築物のライブラリーが生成され、これらのエレメントのそれぞれが固有のバーコード配列にリンクされ、最小プロモーターとレポーター遺伝子(ルシフェラーゼや緑色蛍光タンパク質(GFP)など)を含むプラスミドにクローニングされます[ 7 ] 。これらのプラスミドは細胞にトランスフェクションされ、遺伝物質が回収され、次世代シーケンシングによって配列決定される前に一定期間インキュベートされます。最初のプラスミドDNAライブラリーは入力コントロールとして使用され、プールのRNA存在量と比較され、下流のレポーター遺伝子に対する各エレメントの調節活性が定量化されます[ 8 ]。活性の高いエレメントは大量のバーコード付きRNAを生成し、不活性なエレメントはほとんどまたは全く生成しません。
ほとんどの MPRA は、組み込み配列ではなくエピソーム プラスミドを使用するため、3 次元 DNA 相互作用やエピジェネティック修飾などの内因性ゲノムコンテキストを再現しません。この問題を解決するために、lentiMPRA と呼ばれる代替方法を使用して、レンチウイルスシステムを使用してレポーター構築物を宿主ゲノムに直接安定的に組み込み、よりネイティブなゲノムコンテキストを提供できます[ 8 ] [ 9 ]。MPRA の制限の 1 つは、従来のオリゴヌクレオチド合成では候補 DNA 要素が数百塩基対に制限されることです。[ 8 ]
STARR-seqは、ランダムに切断されたゲノム断片のエンハンサー活性を測定するMPRAに類似した技術です。最初の論文[ 10 ]では、ショウジョウバエゲノムのランダムに切断された断片が最小プロモーターの下流に配置されました。ランダムに切断された断片の中の候補エンハンサーは、最小プロモーターを使用して自己転写します。シーケンスを読み出しとして使用し、各シーケンスの入力量を制御することで、この方法によって推定エンハンサーの強度が測定されます。

Perturb-seqは、CRISPRを用いた遺伝子ノックダウンと単一細胞遺伝子発現解析を組み合わせた手法です。線形モデルを用いて、単一遺伝子のノックダウンが複数の遺伝子の発現に及ぼす影響を計算します。
酵母ツーハイブリッドスクリーニング(Y2H)は、「ベイト」タンパク質を多くの潜在的な相互作用タンパク質(「プレイ」)に対してテストし、タンパク質間の物理的な相互作用を特定します。このシステムは、もともとGAL4 [ 11 ]と呼ばれる転写因子に基づいており、このタンパク質がレポーター遺伝子の転写を引き起こすには、DNA結合ドメインと転写活性化ドメインの両方が必要です。Y2Hスクリーニングでは、「ベイト」タンパク質をGAL4の結合ドメインに融合し、潜在的な「プレイ」(相互作用)タンパク質のライブラリーを活性化ドメインを持つベクターで組換え発現させます。酵母細胞内でベイトタンパク質とプレイタンパク質がin vivoで相互作用すると、GAL4の活性化ドメインと結合ドメインが十分に近づき、レポーター遺伝子の発現が起こります。また、ベイトタンパク質のライブラリーをプレイタンパク質のライブラリーに対して系統的にテストして、細胞内での考えられるすべての相互作用を特定することも可能です。
質量分析法(MS)はタンパク質とその相対的な量を同定できるため、タンパク質発現の研究に利用できます。アフィニティー精製と組み合わせて使用すると、質量分析法(AP/MS)はタンパク質複合体の研究、つまり複合体内でどのタンパク質がどのような比率で相互作用しているかを調べるために使用できます。タンパク質複合体を精製するには、通常、「ベイト」タンパク質に特定のタンパク質またはペプチドをタグ付けし、複合体混合物から複合体を分離するために使用します。精製は通常、融合部分に結合する抗体または化合物を使用して行われます。次に、タンパク質は短いペプチド断片に消化され、質量分析法を使用して、これらの断片の質量電荷比に基づいてタンパク質を同定します。
ディープ変異スキャンでは、まず特定のタンパク質のあらゆる可能なアミノ酸変化を合成します。[ 12 ]これらのタンパク質変異体の活性は、各変異体のバーコードを使用して並行して測定されます。[ 13 ]活性を野生型タンパク質と比較することにより、各変異の影響が特定されます。組み合わせ論により、あらゆる可能な単一アミノ酸変化を測定することは可能ですが、2つ以上の同時変異をテストすることは困難です。ディープ変異スキャン実験は、タンパク質の構造やタンパク質間相互作用を推測するためにも使用されています。[ 14 ]ディープ変異スキャンは、変異効果の多重アッセイ(MAVE)の一例です。MAVEは、DNAコードタンパク質または調節要素の変異誘発に続いて、機能の何らかの側面に対する多重アッセイを行う方法のファミリーです。MAVEにより、関心のある遺伝子または機能要素のあらゆる可能な単一ヌクレオチド変化の機能の側面を特徴付ける「変異効果マップ」を作成できます。[ 15 ] [ 16 ]
遺伝子の重要な機能的特徴の一つは、突然変異によって引き起こされる表現型である。突然変異体は、ランダムな突然変異、あるいは部位特異的突然変異誘発、遺伝子全体の欠失、その他の手法を含む、標的特異的突然変異誘発によって生み出される。
遺伝子の機能は、遺伝子を一つずつ系統的に「ノックアウト」することによって調べることができます。これは、遺伝子の欠失または機能の破壊(挿入変異誘発など)によって行われ、得られた生物の表現型をスクリーニングすることで、破壊された遺伝子の機能の手がかりが得られます。ゲノム全体のノックアウト、つまりゲノム内のすべての遺伝子を削除することによっても、ノックアウトが実現されています。必須遺伝子の場合、これは不可能なので、他の技術が用いられます。例えば、誘導性プロモーターを用いてプラスミドから遺伝子を発現させながら遺伝子を削除する方法などです。これにより、遺伝子産物のレベルを自由に変化させることができ、(機能的な)欠失を実現できます。
部位特異的変異誘発は、特定の塩基(ひいてはアミノ酸)に変異を導入するために用いられる。これは、タンパク質中の特定のアミノ酸の機能、例えば酵素の活性部位における機能などを研究する上で非常に重要である。
RNA干渉(RNAi)法は、約20塩基対の二本鎖RNAを用いて遺伝子発現を一時的に抑制またはノックダウンするために使用できます。このRNAは通常、合成された約20merの短鎖干渉RNA(siRNA)分子のトランスフェクション、またはウイルス由来の短鎖ヘアピンRNA(shRNA)によって導入されます。RNAiスクリーニングは、通常、細胞培養ベースのアッセイまたは実験生物(C. elegansなど)で実施され、ゲノム内のほぼすべての遺伝子、または遺伝子のサブセット(サブゲノム)を系統的に破壊するために使用できます。破壊された遺伝子の機能は、観察された表現型に基づいて割り当てることができます。

CRISPR-Cas9は、細胞株で多重的に遺伝子を削除するために使用されてきました。実験の前後で各遺伝子のガイドRNAの量を定量化することで、必須遺伝子を特定できます。ガイドRNAが必須遺伝子を破壊すると、その細胞が失われるため、スクリーニング後にその特定のガイドRNAが枯渇します。最近の哺乳類細胞株でのCRISPR-cas9実験では、複数の細胞株で約2000個の遺伝子が必須であることがわかりました。[ 18 ] [ 19 ]これらの遺伝子の中には、1つの細胞株でのみ必須であるものもありました。ほとんどの遺伝子は、多タンパク質複合体の一部です。このアプローチは、適切な遺伝的背景を使用することで、合成致死性を特定するために使用できます。CRISPRiとCRISPRaは、同様の方法で機能喪失および機能獲得スクリーニングを可能にします。CRISPRiは、K562細胞株で約2100個の必須遺伝子を特定しました。[ 20 ] [ 21 ] CRISPR 欠失スクリーニングは、遺伝子の潜在的な制御要素を特定するためにも使用されています。たとえば、ScanDel と呼ばれる技術が発表され、このアプローチを試みました。著者らは、この遺伝子の制御要素を特定するために、関心のある遺伝子 (メンデル遺伝病に関与する HPRT1) の外側の領域を削除しました。[ 22 ] Gassperini らは、このアプローチを使用して HPRT1 の遠位制御要素を特定しませんでしたが、このようなアプローチは他の関心のある遺伝子にも拡張できます。
推定遺伝子は、長いオープンリーディングフレーム、転写開始配列、ポリアデニル化部位などの特徴に基づいて、タンパク質をコードする可能性のある領域をゲノムからスキャンすることによって特定できます。推定遺伝子として特定された配列は、同じ生物のcDNAまたはEST配列との類似性、予測されるタンパク質配列と既知のタンパク質との類似性、プロモーター配列との関連性、または配列の変異によって観察可能な表現型が生じるという証拠など、さらなる証拠によって確認されなければなりません。
ロゼッタストーン法は、新規タンパク質機能予測のための計算手法である。この手法は、特定の生理学的プロセスに関与するタンパク質が、ある生物では2つの別々の遺伝子として存在し、別の生物では1つの遺伝子として存在する可能性があるという仮説に基づいている。ゲノムをスキャンし、ある生物では独立しており、別の生物では単一のオープンリーディングフレームに存在する配列を探す。2つの遺伝子が融合している場合、それらは類似した生物学的機能を有し、そのような共調節が有利であると予測される。
これらの技術によって生成されるデータ量が膨大であること、および生物学的に意味のあるパターンを見つけたいという要望から、バイオインフォマティクスは機能ゲノミクスデータの解析に不可欠です。このクラスの技術の例としては、教師なし機械学習(クラス検出)のためのデータクラスタリングや主成分分析、および教師あり機械学習(クラス予測、分類)のための人工ニューラルネットワークやサポートベクターマシンなどがあります。機能エンリッチメント分析は、背景セットに対する機能カテゴリの過剰発現または低発現(RNAi スクリーニングの場合は正または負の調節因子)の程度を決定するために使用されます。遺伝子オントロジーに基づくエンリッチメント分析はDAVIDおよび遺伝子セットエンリッチメント分析(GSEA)[ 23 ]によって提供され、パスウェイに基づく分析は Ingenuity [ 24 ]および Pathway studio [ 25 ]によって提供され、タンパク質複合体に基づく分析は COMPLEAT [ 26 ]によって提供されます。

深層変異スキャン実験の結果を理解するための新しい計算手法が開発されました。「phydms」は、深層変異スキャン実験の結果を系統樹と比較します。[ 27 ]これにより、ユーザーは、自然界の選択プロセスが深層変異スキャンの結果が示すのと同様の制約をタンパク質に適用しているかどうかを推測できます。これにより、実験者は、自然界をどれだけよく反映しているかに基づいて、異なる実験条件を選択できるようになります。深層変異スキャンは、タンパク質間相互作用の推測にも使用されています。[ 28 ]著者らは、熱力学モデルを使用して、二量体の異なる部分における変異の影響を予測しました。深層変異構造は、タンパク質構造の推測にも使用できます。深層変異スキャンにおける2つの変異間の強い正のエピスタシスは、3次元空間で互いに近い2つのタンパク質部分を示す可能性があります。この情報は、タンパク質構造の推測に使用できます。このアプローチの原理実証は、2つのグループがタンパク質GB1を使用して示しました。[ 29 ] [ 30 ]
MPRA実験の結果から、データの解釈には機械学習アプローチが必要となった。ギャップ付きk-mer SVMモデルは、活性の低い配列と比較して活性の高いシス調節配列内に豊富に存在するk-merを推測するために使用された。[ 31 ]これらのモデルは高い予測力を提供する。ディープラーニングとランダムフォレストアプローチも、これらの高次元実験の結果を解釈するために使用された。[ 32 ]これらのモデルは、遺伝子調節に対する非コードDNA機能の理解を深めるのに役立ち始めている。
ENCODE (Encyclopedia of DNA elements)プロジェクトは、ヒトゲノムの詳細な解析であり、コーディング領域と非コーディング領域の両方において、ゲノムDNAのすべての機能要素を特定することを目的としています。重要な成果としては、ゲノムタイリングアレイによる、ほとんどのヌクレオチドがコーディング転写産物、非コーディングRNA、またはランダム転写産物として転写されるという証拠、追加の転写調節部位の発見、クロマチン修飾機構のさらなる解明などが挙げられます。

GTExプロジェクトは、組織全体にわたるトランスクリプトームの変動を形成する上での遺伝的変異の役割を理解することを目的としたヒト遺伝学プロジェクトです。このプロジェクトでは、700人以上の死後ドナーからさまざまな組織サンプル(50種類以上の組織)を収集しました。その結果、11,000以上のサンプルが収集されました。GTExは、eQTLの組織共有と組織特異性の理解に役立っています。[ 33 ]このゲノムリソースは、「DNA配列の違いが健康と病気にどのように寄与するかについての理解を深める」ために開発されました。[ 34 ]
2020 年に設立されたAtlas of Variant Effects Alliance (AVE) [ 35 ]は、遺伝子または調節要素におけるあらゆる単一ヌクレオチド変化の機能を明らかにするバリアント効果マップを作成することにより、疾患関連機能ゲノミクスにおけるあらゆる遺伝子変異の影響をカタログ化することを目的とした国際コンソーシアムです。AVE は、ワシントン大学の Brotman Baty Institute および国立ヒトゲノム研究所から、ゲノム科学センターの卓越性助成金 (NHGRI RM1HG010461) による資金提供を受けています。[ 36 ]