バイオインフォマティクスにおける機械学習とは、バイオインフォマティクスへの機械学習アルゴリズムの応用であり、[1]ゲノミクス、プロテオミクス、マイクロアレイ、システム生物学、進化、テキストマイニングなどが含まれます。[2] [3]
機械学習が登場する前は、バイオインフォマティクスのアルゴリズムは手作業でプログラムする必要がありましたが、タンパク質構造予測などの問題では、これは困難でした。[4]ディープラーニングなどの機械学習技術では、プログラマがデータ セットの特徴を個別に定義する必要はなく、データ セットの特徴を学習できます。アルゴリズムはさらに、低レベルの特徴をより抽象的な特徴に結合する方法などを学習できます。この多層アプローチにより、適切なトレーニングを行うと、このようなシステムは高度な予測を行うことができます。これらの方法は、既存のデータ セットを活用しながら、予期しない方法でデータを解釈および分析できない 他の計算生物学アプローチとは対照的です。
タスク
バイオインフォマティクスにおける機械学習アルゴリズムは、予測、分類、特徴選択に使用できます。このタスクを実行する方法は多様で、多くの分野にまたがっています。その中で最もよく知られているのは機械学習と統計です。分類タスクと予測タスクは、将来の予測のためにクラスまたは概念を記述および区別するモデルを構築することを目的としています。これらの違いは次のとおりです。
- 分類/認識ではカテゴリクラスが出力され、予測では数値の特徴が出力されます。
- 類推、ルール、ニューラル ネットワーク、確率、統計などを使用してデータから予測モデルを構築するために使用されるアルゴリズムまたはプロセスのタイプ。
人工知能やデータマイニングなどの情報技術と適用可能なモデルの急激な成長、さらにこれまで以上に包括的なデータセットへのアクセスにより、学習能力に基づいた新しいより優れた情報分析手法が生み出されました。このようなモデルは、説明を超えた範囲を可能にし、テスト可能なモデルの形で洞察を提供します。
機械学習のアプローチ
人工ニューラルネットワーク
バイオインフォマティクスにおける人工ニューラルネットワークは、次のような用途に使用されています。[5]
- RNA、タンパク質、DNA 配列を比較および整列します。
- プロモーターの識別と DNA に関連する配列からの遺伝子の発見。
- 発現遺伝子とマイクロアレイデータの解釈。
- 遺伝子のネットワーク(制御)を特定する。
- 系統樹を構築することで進化関係を学ぶ。
- タンパク質構造の分類と予測。
- 分子設計とドッキング
特徴エンジニアリング
ドメインデータから特徴(多くの場合、多次元空間のベクトル)を抽出する方法は、学習システムの重要な要素です。[6]ゲノミクスでは、シーケンスの典型的な表現はk-mer頻度のベクトルです。これは、長さの各サブシーケンスが特定のシーケンスに出現する回数をカウントする次元のベクトルです。値が小さいと、これらのベクトルの次元が非常に大きくなるため(たとえば、この場合、次元は)、主成分分析などの手法を使用してデータをより低い次元の空間に投影し、シーケンスからより小さな特徴セットを選択します。[6] [追加の引用が必要]
分類
このタイプの機械学習タスクでは、出力は離散変数です。バイオインフォマティクスにおけるこのタイプのタスクの一例としては、すでにラベル付けされたデータのモデルに基づいて、新しいゲノムデータ(培養できない細菌のゲノムなど)にラベルを付けることが挙げられます。[6]
隠れマルコフモデル
隠れマルコフモデル(HMM) は、時系列データ (多くの場合、時間の経過とともに進化するシステムに関連する) の統計モデルの一種です。HMM は、観測される状態依存プロセスと観測されない (隠れた) 状態プロセスという 2 つの数学的オブジェクトで構成されています。HMM では、状態プロセスは直接観測されません (「隠れた」(または「潜在的な」) 変数です)。しかし、基礎となる状態プロセスによって駆動される状態依存プロセス (または観測プロセス) の観測が行われます (したがって、対象のシステム状態のノイズの多い測定値と見なすことができます)。[7] HMM は連続時間で定式化できます。[8] [9]
HMMは、多重配列アライメントをプロファイリングし、遠隔地からデータベースで相同配列を検索するのに適した位置特異的スコアリングシステムに変換するために使用できます。[10]さらに、生態学的現象はHMMで記述できます。[11]
畳み込みニューラルネットワーク
畳み込みニューラルネットワーク(CNN)は、入力特徴に沿ってスライドする畳み込みカーネルまたはフィルターの共有重みに基づいたアーキテクチャを持つディープニューラルネットワークの一種であり、特徴マップと呼ばれる変換等価応答を提供します。 [12] [13] CNNはデータの階層パターンを活用し、フィルターを介して発見されたより小さく単純なパターンを使用して、複雑さが増すパターンを組み立てます。[14]
畳み込みネットワークは、ニューロン間の接続パターンが動物の視覚皮質の構成に似ているという点で、生物学的プロセス[15] [16] [17] [18]にヒントを得ています。個々の皮質ニューロンは、受容野と呼ばれる視野の限られた領域でのみ刺激に反応します。異なるニューロンの受容野は部分的に重なり合って、視野全体をカバーします。
CNNは他の画像分類アルゴリズムと比較して比較的少ない前処理を使用します。これは、ネットワークが自動学習を通じてフィルター(またはカーネル)を最適化することを学習することを意味しますが、従来のアルゴリズムではこれらのフィルターは手動で設計されます。分析者の事前知識への依存と手動の特徴抽出における人間の介入が少ないため、CNNは望ましいモデルです。[14]
系統学的畳み込みニューラルネットワーク(Ph-CNN)は、メタゲノミクスデータを分類するために2018年にFiorantiらによって提案された畳み込みニューラルネットワークアーキテクチャです。[19]このアプローチでは、系統学的データに家父長的距離(2つの操作的分類単位[OTU]を接続するすべての枝の長さの合計)が付与され、各OTUのk近傍が選択され、各OTUとその近傍が畳み込みフィルターで処理されます。
自己教師学習
教師あり学習法とは異なり、自己教師あり学習法は注釈付きデータに依存せずに表現を学習します。これは、高スループットシーケンシング技術によって大量のラベルなしデータを作成する可能性があるゲノミクスに適しています。ゲノミクスに適用された自己教師あり学習法の例としては、DNABERTやSelf-GenomeNetなどがあります。[20] [21]
ランダムフォレスト

ランダムフォレスト(RF)は、決定木のアンサンブルを構築し、個々の木の平均予測を出力することで分類します。[22]これは、ブートストラップ集約(決定木の大規模なコレクションを集約する)の修正版であり、分類や回帰に使用できます。[23] [24]
ランダムフォレストは一般化誤差の内部推定値を与えるため、クロスバリデーションは不要である。さらに、ランダムフォレストは欠損値を補完するために使用できる近接性を生成するため、新しいデータ視覚化が可能になる。[25]
計算的に、ランダムフォレストは、回帰と(多クラス)分類の両方を自然に処理し、トレーニングと予測が比較的速く、1つまたは2つのチューニングパラメータのみに依存し、一般化誤差の推定値が組み込まれており、高次元の問題に直接使用でき、簡単に並列実装できるため魅力的です。統計的には、ランダムフォレストは、変数の重要性の測定、差分クラス重み付け、欠損値の補完、視覚化、外れ値検出、教師なし学習などの追加機能にも魅力的です。[25]
クラスタリング
クラスタリングは、定義された距離または類似性関数に従って、各サブセットのデータが互いに可能な限り近くなり、他のサブセットのデータから可能な限り離れるように、データ セットを互いに素なサブセットに分割するものであり、統計データ分析の一般的な手法です。
クラスタリングは、多くのデータ駆動型バイオインフォマティクス研究の中心であり、階層的、重心ベース、分布ベース、密度ベース、自己組織化マップ分類の手段が長い間研究され、古典的な機械学習の設定で使用されてきた強力な計算方法として機能します。特に、クラスタリングは、シーケンス、表現、テキスト、画像などの形式の非構造化データと高次元データを分析するのに役立ちます。クラスタリングは、遺伝子機能、細胞プロセス、細胞のサブタイプ、遺伝子調節、代謝プロセスなど、ゲノムレベルでの生物学的プロセスへの洞察を得るためにも使用されます。 [26]
バイオインフォマティクスで使用されるクラスタリングアルゴリズム
データ クラスタリング アルゴリズムは、階層型またはパーティション型です。階層型アルゴリズムは、以前に確立されたクラスターを使用して連続するクラスターを見つけますが、パーティション型アルゴリズムはすべてのクラスターを一度に決定します。階層型アルゴリズムは、凝集型 (ボトムアップ) または分割型 (トップダウン) です。
凝集型アルゴリズムは、各要素を個別のクラスターとして開始し、それらを連続的に大きなクラスターにマージします。分割型アルゴリズムは、セット全体から開始し、それを連続的に小さなクラスターに分割します。階層的クラスタリングは、ユークリッド空間上のメトリックを使用して計算されます。最も一般的に使用されるのは、各変数間の差の2乗を見つけ、すべての2乗を加算し、その合計の平方根を見つけることによって計算されるユークリッド距離です。階層的クラスタリングアルゴリズムの例はBIRCHであり、一般に大規模なデータセットを与えられた場合の時間計算量がほぼ線形であるため、バイオインフォマティクスに特に適しています。 [27]分割アルゴリズムは、初期のグループ数を指定し、グループ間でオブジェクトを反復的に再割り当てして収束することに基づいています。このアルゴリズムは通常、すべてのクラスターを一度に決定します。ほとんどのアプリケーションでは、k平均法アルゴリズムまたはkメドイドという2つの一般的なヒューリスティック手法のいずれかが採用されています。アフィニティ伝播などの他のアルゴリズムでは、初期のグループ数は必要ありません。ゲノム設定では、このアルゴリズムは遺伝子クラスターファミリー(GCF)内の生合成遺伝子クラスターをクラスター化するためと、そのGCFをクラスター化するために使用されています。[28]
ワークフロー
通常、機械学習を生物学的データに適用するワークフローは4つのステップを経る:[2]
- キャプチャと保存を含む記録。このステップでは、さまざまな情報ソースが 1 つのセットに結合される場合があります。
- 前処理には、分析可能な形式へのクリーニングと再構築が含まれます。このステップでは、未修正のデータが削除または修正され、欠損データが補完され、関連する変数が選択されます。
- 分析、教師ありまたは教師なしアルゴリズムを使用してデータを評価します。アルゴリズムは通常、データのサブセットでトレーニングされ、パラメータが最適化され、別のテスト サブセットで評価されます。
- 視覚化と解釈では、さまざまな方法を使用して知識を効果的に表現し、発見の重要性と意義を評価します。
データエラー
- 重複データはバイオインフォマティクスにおける重大な問題である。公開されているデータは品質が不確かな場合がある。[29]
- 実験中のエラー。[29]
- 誤った解釈。[29]
- タイプミス。[29]
- 実験では非標準化された方法(複数のソースからのPDBの3D構造、X線回折、理論モデリング、核磁気共鳴など)が使用されています。[29]
アプリケーション
一般的に、機械学習システムは、十分なサンプルがあれば、特定のクラスの要素を認識するように訓練することができます。[30]たとえば、機械学習手法は、スプライスサイトなどの特定の視覚的特徴を識別するように訓練することができます。[31]
サポートベクターマシンは、がんゲノム研究で広く使用されています。[32]さらに、ディープラーニングはバイオインフォマティクスアルゴリズムに組み込まれています。ディープラーニングのアプリケーションは、制御ゲノミクスや細胞イメージングに使用されています。[33]その他のアプリケーションには、医療画像分類、ゲノム配列解析、タンパク質構造の分類と予測などがあります。[34]ディープラーニングは、制御ゲノミクス、変異呼び出し、病原性スコアに適用されています。[35] 自然言語処理とテキストマイニングは、タンパク質間相互作用、遺伝子と疾患の関係などの現象の理解や、生体分子の構造と機能の予測に役立っています。[36]
精密医療/個別化医療
自然言語処理アルゴリズムは、患者から得られる臨床情報とゲノムデータの抽出を組み合わせることで、遺伝性疾患に苦しむ患者にパーソナライズされた医療を提供します。Health-funded Pharmacogenomics Research Networkなどの研究所は、乳がんの治療法を見つけることに重点を置いています。[37]
精密医療は、大規模な生物学的データベースによって可能になった個々のゲノムの変動性を考慮します。機械学習を適用して、(患者グループ)と特定の治療法とのマッチング機能を実行することができます。[38]
計算技術は、PCRのための効率的なプライマー設計、生物学的画像解析、タンパク質の逆翻訳(遺伝暗号の退化を考えると、複雑な組み合わせ問題である)などの他の問題を解決するためにも使用されている。[2]
ゲノミクス

ゲノム配列データは、DNAの配列を決定する技術的な難しさから歴史的にまばらでしたが、利用可能な配列の数は増加しています。平均すると、GenBankパブリックリポジトリで利用可能な塩基の数は、 1982年以来18か月ごとに倍増しています。[39] しかし、生のデータがますます利用可能になり、アクセスしやすくなった一方で、2002年の時点では、このデータの生物学的解釈ははるかに遅いペースで行われていました。[40]このため、特定のDNA配列内でタンパク質をコードする遺伝子の位置を自動的に決定できる(つまり、遺伝子予測)機械学習システムなどの計算ゲノムツールの開発の必要性が高まっています。[40][update]
遺伝子予測は、一般的に外在的検索と内在的検索の両方を通じて行われる。[40]外在的検索では、入力DNA配列を、遺伝子が以前に発見され、その位置が注釈付けされた配列の大規模なデータベースに通し、配列内のどの塩基の文字列が既知の遺伝子配列と相同であるかを判断することで、ターゲット配列の遺伝子を特定する。しかし、既知および注釈付き遺伝子配列のデータベースのサイズには制限があるため、特定の入力配列内のすべての遺伝子を相同性だけで特定できるわけではない。したがって、遺伝子予測プログラムがDNA配列のみから残りの遺伝子を特定しようとする内在的検索が必要となる。[40]
機械学習は、多数のDNAまたはアミノ酸配列を整列させて、共通の進化の歴史を示唆する類似領域を決定する多重配列アライメントの問題にも使用されています。 [2]また、ゲノムの再編成を検出して視覚化するためにも使用できます。[41]
プロテオミクス

アミノ酸の鎖であるタンパク質は、タンパク質の折り畳みによって、一次構造、二次構造(アルファヘリックスおよびベータシート)、三次構造、および四次構造を含む三次元構造を形成することで、その機能の多くを獲得します。
タンパク質の二次構造予測は、このサブフィールドの主な焦点です。三次構造と四次構造は二次構造に基づいて決定されるためです。[4]タンパク質の真の構造を解くことは高価で時間もかかるため、アミノ酸配列を直接分析することでタンパク質の構造を正確に予測できるシステムの必要性が高まっています。[4] [2]機械学習以前は、研究者はこの予測を手動で行う必要がありました。この傾向は、1951年にポーリングとコーリーがポリペプチド鎖からタンパク質の水素結合構成を予測する研究を発表したときに始まりました。[42]自動特徴学習の精度は82〜84%に達します。[4] [43]二次構造予測の現在の最先端技術は、人工ニューラルネットワークの機械学習モデルに依存するDeepCNF(ディープ畳み込みニューラルフィールド)と呼ばれるシステムを使用しており、タンパク質配列のアミノ酸を3つの構造クラス(ヘリックス、シート、コイル)のいずれかに分類するというタスクで約84%の精度を達成しています。[43] [更新が必要]タンパク質の3状態二次構造の理論的限界は88~90%である。[4]
機械学習は、タンパク質側鎖予測、タンパク質ループモデリング、タンパク質接触マップ予測などのプロテオミクス問題にも応用されている。[2]
メタゲノミクス
メタゲノミクスは、環境DNAサンプルから微生物群集を研究する学問です。[44]現在、環境サンプルに含まれるデータ量が多いため、機械学習ツールの実装には限界と課題がつきものです。[45]スーパーコンピュータとウェブサーバーのおかげで、これらのツールへのアクセスが容易になりました。[46]マイクロバイオームデータセットの高次元性は、マイクロバイオームの研究における大きな課題です。これにより、現在のアプローチでは真の違いを識別する力が大幅に制限され、誤った発見の可能性が高まります。[47] [より良い情報源が必要]
メタゲノミクスに関連する機械学習ツールは、その重要性にもかかわらず、腸内細菌叢と、炎症性腸疾患(IBD)、クロストリディオイデス・ディフィシル感染症(CDI)、大腸がん、糖尿病などの消化器疾患との関係の研究に重点を置いており、より優れた診断と治療法が模索されている。[46]最小絶対収縮および選択演算子分類器、ランダムフォレスト、教師あり分類モデル、勾配ブースティングツリーモデルなどの方法を使用して、 16S rRNAまたは全ゲノムシーケンス(WGS)などのシーケンスデータの種類に関係なく、宿主の健康状態に応じて微生物群集を分類する多くのアルゴリズムが開発されました。リカレントニューラルネットワーク(RNN)、畳み込みニューラルネットワーク(CNN)、ホップフィールドニューラルネットワークなどのニューラルネットワークが追加されました。[46]例えば、2018年にFioravantiらは、腸内細菌叢の研究で、腸内細菌叢の分類に新しい手法を提案しました。系統樹と畳み込みニューラルネットワークを用いて、健康な患者とIBD症状のある患者のデータサンプルを分類する(健康な患者と病気の患者を区別する)Ph-CNNと呼ばれるアルゴリズムを開発した。[48]
さらに、ランダムフォレスト(RF)法と実装された重要度測定は、病気のサンプルと病気でないサンプルを区別するために使用できるマイクロバイオーム種の識別に役立ちます。ただし、決定木のパフォーマンスとアンサンブル内の決定木の多様性は、RFアルゴリズムのパフォーマンスに大きく影響します。RFの一般化誤差は、個々の分類器の精度とそれらの相互依存性を測定します。したがって、マイクロバイオームデータセットの高次元問題は課題となります。効果的なアプローチには多くの可能な変数の組み合わせが必要であり、特徴の数が増えるにつれて計算負荷が指数関数的に増加します。[47]
2020年のマイクロバイオーム解析のために、Dang & Kishino [47]は新しい解析パイプラインを開発した。パイプラインの中核は、RF分類器とフォワーディング変数選択(RF-FVS)を組み合わせたもので、予測分類器のパフォーマンスを最大化する微生物種または機能シグネチャの最小サイズのコアセットを選択する。このフレームワークは以下を組み合わせている。
- 大規模並列前向き変数選択手順によっていくつかの重要な特徴を特定する
- 選択した種を系統樹上にマッピングし、
- メタゲノム16S rRNAデータから機能遺伝子エンリッチメント解析によって機能プロファイルを予測します。
彼らは、大規模な症例対照研究から公開された 2 つのデータセットを分析することでパフォーマンスを実証しました。
- C. difficile感染症(CDI)の16S rRNA遺伝子増幅データおよび
- ヒト大腸がん(CRC)のショットガンメタゲノミクスデータ。
提案されたアプローチにより、CDI の精度は 81% から 99.01% に、CRC の精度は 75.14% から 90.17% に向上しました。
環境サンプルにおける機械学習の使用は、特にWGSからのデータの複雑さのためか、あまり研究されていません。いくつかの研究では、これらのツールを環境サンプルに適用できることが示されています。2021年にDhungelら[49]はMegaRと呼ばれるRパッケージを設計しました。このパッケージでは、16S rRNAとメタゲノム配列全体を操作して、機械学習モデルによる分類プロファイルと分類モデルを作成できます。MegaRには、ユーザーエクスペリエンスを向上させる快適な視覚化環境が含まれています。環境メタゲノミクスにおける機械学習は、微生物群集と生態系の相互作用に関連する質問に答えるのに役立ちます。たとえば、2021年のXunらの研究[50]では、さまざまな機械学習手法の使用により、土壌、マイクロバイオームの生物多様性、および生態系の安定性の関係についての洞察が提供されました。
マイクロアレイ
マイクロアレイはラボオンチップの一種で、大量の生物学的材料に関するデータを自動的に収集するために使用されます。機械学習は分析に役立ち、発現パターンの識別、分類、遺伝子ネットワークの誘導に応用されています。[2]

この技術は遺伝子発現のモニタリングに特に有用であり、どの遺伝子が発現しているかを調べることで癌の診断に役立っている。[51]主なタスクの1つは、収集されたデータに基づいてどの遺伝子が発現しているかを特定することである。[2]さらに、マイクロアレイによってデータが収集される遺伝子の数は膨大であるため、発現遺伝子の識別タスクに無関係な大量のデータを選別することは困難である。機械学習は、さまざまな分類方法を使用してこの識別を実行できるため、潜在的な解決策を提示します。最も一般的に使用される方法は、ラジアル基底関数ネットワーク、ディープラーニング、ベイズ分類、決定木、ランダムフォレストです。[51]
システム生物学
システム生物学は、システム内の単純な生物学的構成要素の複雑な相互作用から生じる創発的な行動の研究に焦点を当てています。このような構成要素には、DNA、RNA、タンパク質、代謝物が含まれます。[52]
機械学習は、遺伝子ネットワーク、シグナル伝達ネットワーク、代謝経路などの領域でこれらの相互作用をモデル化するために使用されてきました。[2]異なる変数間の関係を決定する機械学習技術で ある確率的グラフィカルモデルは、遺伝子ネットワークをモデル化するために最も一般的に使用される方法の1つです。[2]さらに、機械学習は、マルコフ連鎖最適化を使用して転写因子結合部位を特定するなど、システム生物学の問題に適用されています。[2]遺伝的アルゴリズム、つまり自然な進化のプロセスに基づく機械学習技術は、遺伝子ネットワークと制御構造をモデル化するために使用されてきました。[2]
機械学習の他のシステム生物学への応用としては、酵素機能予測、ハイスループットマイクロアレイデータ分析、疾患マーカーの理解を深めるためのゲノムワイド関連研究の分析、タンパク質機能予測などがある。[53]
進化
この分野、特に系統樹の再構築では、機械学習技術の特徴が利用されています。系統樹は生物の進化を図式的に表現したものです。当初は形態学的特徴や代謝的特徴などの特徴を利用して構築されていました。その後、ゲノム配列が利用可能になったため、系統樹アルゴリズムの構築にはゲノム比較に基づく概念が利用されました。最適化技術の助けを借りて、多重配列アライメントによる比較が行われました。[54]
脳卒中の診断
脳画像データの解析のための機械学習法は、脳卒中の診断に役立てられています。歴史的に、この問題に対する複数のアプローチにはニューラルネットワークが関与していました。[55] [56]
脳卒中を検出する複数のアプローチでは機械学習が使用されました。Mirtskhulavaによって提案されたように[57] 、フィードフォワードネットワークは神経画像を使用して脳卒中を検出するためにテストされました。Titanoによって提案されたように[58]、 3D-CNN技術は急性神経学的イベントの頭部CT画像をスクリーニングするために教師あり分類でテストされました。3次元CNNとSVM法がよく使用されます。[56]
テキストマイニング
生物学関連の出版物の増加により、特定のトピックに関する入手可能な関連情報の検索と編集が困難になっています。このタスクは知識抽出と呼ばれています。これは、生物学的なデータ収集に必要であり、その後、機械学習アルゴリズムに入力して新しい生物学的知識を生成することができます。[2] [59]機械学習は、自然言語処理などの技術を使用して、データベース内の人間が作成したレポートから有用な情報を抽出することにより、この知識抽出タスクに使用できます。機械学習の代替アプローチであるText Nailing は、臨床物語メモから特徴を抽出でき、2017年に導入されました。
この技術は、生物学データベースやジャーナルに保存されている情報の調査を必要とするため、新規薬物ターゲットの探索に応用されている。[59]タンパク質データベース内のタンパク質の注釈は、各タンパク質の既知の知識の完全なセットを反映していないことが多いため、生物医学文献から追加情報を抽出する必要がある。機械学習は、遺伝子とタンパク質の機能の自動注釈、タンパク質の細胞内局在の決定、DNA発現アレイ解析、大規模タンパク質相互作用解析、分子相互作用解析に応用されている。[59]
テキストマイニングのもう一つの応用は、十分な参照データが与えられた場合に異なるDNA領域を検出し視覚化することです。[60]
生合成遺伝子クラスターのクラスタリングと存在量プロファイリング
微生物群集は多様な微生物の複雑な集合体であり[61]、共生パートナーは一次代謝と二次代謝(特殊化)に由来する多様な代謝産物を絶えず生産し、その代謝は微生物の相互作用において重要な役割を果たしている。[62]メタゲノムおよびメタトランスクリプトミクスのデータは、コミュニケーションシグナルを解読するための重要な情報源である。
分子メカニズムは、様々な方法で特殊な代謝物を生成します。生合成遺伝子クラスター(BGC)は、非リボソームペプチド合成酵素(NRPS)やポリケチド合成酵素(PKS)などの多酵素、多ドメイン遺伝子クラスターのモジュール作用によって生成される、臨床的に価値のある抗菌、抗真菌、抗寄生虫、抗腫瘍、免疫抑制剤である代謝物が多いため、注目を集めています。[63]さまざまな研究[64] [65] [66] [67] [68] [69] [70] [71]によると、相同コア遺伝子を共有するBGCを遺伝子クラスターファミリー(GCF)にグループ化すると、分析した株の化学的多様性に関する有用な洞察が得られ、BGCをその二次代謝物に関連付けることができることが示されています。[65] [67] GCFは、ヒトの健康に関する研究[72] [73]や土壌の真菌病原体抑制能力の研究において機能マーカーとして使用されてきました。[74]触媒酵素やそのコード化された経路から生成される化合物との直接的な関係を考えると、BGC/GCFは微生物二次代謝の化学空間を探索するためのプロキシとして機能します。 配列決定された微生物ゲノム内のGCFをカタログ化すると、既存の化学的多様性の概要が得られ、将来の優先事項に関する洞察が得られます。[64] [66] BiG-SLiCEやBIG-MAP [75]などのツールは、自然環境におけるBGCの重要性を明らかにすることを唯一の目的として登場しました。
RiPPの化学構造の解読
実験的に特徴付けられたリボソーム合成ペプチドおよび翻訳後修飾ペプチド(RiPP)の増加と、BAGEL、BACTIBASE、MIBIG、THIOBASE などのデータベースから選択されたそれらの配列と化学構造に関する情報の利用可能性により、化学構造を解読して分類するための機械学習ツールを開発する機会が生まれます。
2017年、インドのニューデリーにある国立免疫学研究所の研究者らは、ゲノムマイニングによってRiPPの化学構造を解読するためのバイオインフォマティクスリソースであるRiPPMiner [76]ソフトウェアを開発しました。RiPPMinerウェブサーバーは、クエリインターフェイスとRiPPDBデータベースで構成されています。RiPPMinerは、RiPPの12のサブクラスを定義し、リーダーペプチドの切断部位とRiPPの化学構造の最終的な架橋を予測します。
質量スペクトル類似性スコアリング
ライブラリマッチングや分子ネットワークなど、タンデム質量分析( MS/MS )に基づく多くのメタボロミクス研究では、構造類似性の代理としてスペクトル類似性を使用しています。Spec2vec [77]アルゴリズムは、 Word2Vecに基づいたスペクトル類似性スコアの新しい方法を提供します。Spec2Vecは、分子間のスペクトル類似性を評価し、これらの比較を通じて未知の分子を分類するために、大量のスペクトルデータ内の断片的な関係を学習します。
体系的な注釈付けのために、いくつかのメタボロミクス研究では、測定されたフラグメンテーション質量スペクトルをライブラリスペクトルまたはネットワーク分析による対照スペクトルに適合させることに依存しています。スコアリング関数は、これらのプロセスの一環として、フラグメントスペクトルのペア間の類似性を決定するために使用されます。これまでのところ、一般的に使用されているコサインベースの類似性と大幅に異なるスコアを示唆した研究はありません。[78]
データベース
バイオインフォマティクスの重要な部分は、参照データベースと呼ばれる大規模なデータセットの管理です。生合成遺伝子クラスターやメタゲノムなど、生物学的データの種類ごとにデータベースが存在します。
バイオインフォマティクスによる一般データベース
国立バイオテクノロジー情報センター
国立生物工学情報センター(NCBI)[79]は、 GenBank核酸配列データベースや、出版された生命科学ジャーナルの引用と抄録のPubMedデータベースなど、生物学的情報とデータのオンラインリソースを多数提供しています。多くのWebアプリケーションを補完するのは、専門的なデータセットの検索に最適化されたBLASTプログラムのカスタム実装です。リソースには、PubMedデータ管理、RefSeq機能要素、ゲノムデータダウンロード、変異サービスAPI、Magic-BLAST、QuickBLASTp、およびIdentical Protein Groupsが含まれます。これらのリソースはすべてNCBIを通じてアクセスできます。[80]
生合成遺伝子クラスターのバイオインフォマティクス解析
アンチスマッシュ
antiSMASHは、細菌や真菌のゲノムにおける二次代謝産物生合成遺伝子クラスターのゲノムワイドな迅速な同定、注釈付け、解析を可能にする。このツールは、多数のin silico二次代謝産物解析ツールと統合および相互リンクしている。[81]
ガッツスマッシュ
gutSMASH は、腸内微生物叢から既知および新規の嫌気性代謝遺伝子クラスター (MGC)を予測することにより、細菌の代謝能力を体系的に評価するツールです。
ミビッグ
MIBiG [82]は、生合成遺伝子クラスターの仕様に関する最小限の情報であり、生合成遺伝子クラスターとその分子産物に関する注釈とメタデータの標準を提供します。MIBiGは、あらゆる配列に関する最小限の情報(MIxS)フレームワークに基づいて構築されたゲノム標準コンソーシアムプロジェクトです。[83]
MIBiGは、生合成遺伝子クラスターデータの標準化された保管と検索、および包括的な比較分析ツールの開発を促進します。堅牢な実験的証拠と豊富なメタデータコンポーネントに基づいて、社会的に重要な生理活性二次代謝物の広範なクラスの生合成、化学、生態学に関する次世代の研究を促進します。 [84]
シルバ
SILVA [85]は、細菌、古細菌、真核生物のドメインに属する遺伝子のRNAリボソーム(rRNA)配列の完全なデータベースを構築する生物学者とコンピュータ科学者の学際的なプロジェクトです。これらのサブユニットには、小サブユニット(16S、18S 、SSU)と大サブユニット( 23S、28S、LSU)の両方が含まれます。これらのデータは、学術的および商業的な目的で自由に利用できます。[86]
グリーンジーンズ
Greengenes [87]は、キメラスクリーニング、標準アライメント、およびde novoツリー推論に基づくキュレーションされた分類を提供する全長16S rRNA遺伝子データベースです。 [88] [89]概要:
- RNAcentral には、92,684 の生物からの 1,012,863 の RNA 配列が投稿されました。
- 最短の配列は 1,253 ヌクレオチド、最長の配列は 2,368 ヌクレオチドです。
- 平均長さは1,402ヌクレオチドです。
- データベースバージョン: 13.5。
生命の樹分類を開く
オープンツリーオブライフタクソノミー(OTT)[90]は、公開されている系統樹と分類データを統合することで、完全で動的、デジタルで利用可能なツリーオブライフを構築することを目指しています。系統樹は分類、整列、統合されています。分類は、系統樹によって残された疎な領域やギャップを埋めるために使用されています。OTTは、16S領域の配列解析にはあまり使用されていないベースですが、SILVAやGreengenesと比較して、属レベルまで分類された配列の数が多いです。ただし、エッジレベルでの分類に関しては、含まれる情報量が少ないです[91]
リボソームデータベースプロジェクト
リボソームデータベースプロジェクト(RDP)[92]は、細菌および古細菌ドメインの小サブユニットのRNAリボソーム(rRNA)配列( 16S)と、真菌の大サブユニットのrRNA配列(28S )を提供するデータベースです。[93]
参考文献
- ^ Chicco D (2017年12月). 「計算生物学における機械学習の10の簡単なヒント」. BioData Mining . 10 (35): 35. doi : 10.1186 /s13040-017-0155-3 . PMC 5721660. PMID 29234465.
- ^ abcdefghijklm ララニャガ P、カルボ B、サンタナ R、ビエルザ C、ガルディアーノ J、インザ I、他。 (2006 年 3 月)。 「バイオインフォマティクスにおける機械学習」。バイオインフォマティクスに関する説明会。7 (1): 86-112。土井:10.1093/bib/bbk007。PMID 16761367。
- ^ Pérez-Wohlfeil E、Torrenoa O、Bellis LJ、Fernandes PL、Leskosek B、Trellesa O (2018年12月)。「高性能コンピューティングにおけるバイオインフォマティクスのトレーニング」。Heliyon。4 ( 12 ) : e01057。Bibcode : 2018Heliy ... 401057P。doi : 10.1016 /j.heliyon.2018.e01057。PMC 6299036。PMID 30582061。
- ^ abcde Yang Y、Gao J、Wang J、Heffernan R、Hanson J、Paliwal K、Zhou Y (2018年5月)。「タンパク質二次構造予測における65年間の長い道のり:最終段階?」Briefings in Bioinformatics . 19 (3): 482–494. doi :10.1093/bib/bbw129. PMC 5952956 . PMID 28040746.
- ^ Shastry KA、Sanjay HA (2020)。「バイオインフォマティクスのための機械学習」。Srinivasa K、Siddesh G、Manisekhar S (編)。バイオインフォマティクスの技術、ツール、アプリケーションのための統計モデル化と機械学習の原則。インテリジェントシステムのためのアルゴリズム。シンガポール:Springer。pp. 25–39。doi :10.1007/978-981-15-2445-5_3。ISBN 978-981-15-2445-5. S2CID 214350490 . 2021年6月28日閲覧。
- ^ abc Soueidan H 、Nikolski M (2019)。 「メタゲノミクスのための機械学習:方法とツール」。メタゲノミクス。1。arXiv:1510.06621。doi : 10.1515/metgen-2016-0001。ISSN 2449-7657。S2CID 17418188 。
- ^ Rabiner L, Juang B (1986年1月). 「隠れマルコフモデル入門」. IEEE ASSP Magazine . 3 (1): 4–16. doi :10.1109/MASSP.1986.1165342. ISSN 1558-1284. S2CID 11358505.
- ^ Jackson CH、Sharples LD、Thompson SG 、 Duffy SW、Couto E (2003 年 7 月)。「分類エラーを伴う疾患進行のマルチステート マルコフ モデル」。Journal of the Royal Statistical Society、シリーズ D (The Statistician)。52 (2) : 193–209。doi : 10.1111 /1467-9884.00351。S2CID 9824404。
- ^ Amoros R、King R、Toyoda H、Kumada T、Johnson PJ、Bird TG(2019年5月30日)。「血清バイオマーカーを用いた癌監視のための連続時間隠れマルコフモデルと肝細胞癌への応用」。Metron。77 ( 2 ):67–86。doi:10.1007 /s40300-019-00151-8。PMC 6820468。PMID 31708595。
- ^ Eddy SR (1998年10月1日). 「プロファイル隠れマルコフモデル」.バイオインフォマティクス. 14 (9): 755–63. doi : 10.1093/bioinformatics/14.9.755 . PMID 9918945.
- ^ McClintock BT、Langrock R、Gimenez O、Cam E、Borchers DL、Glennie R、Patterson TA (2020年12月)。「隠れマルコフモデルによる生態学的状態ダイナミクスの解明」。Ecology Letters。23 ( 12 ) : 1878–1903。arXiv : 2002.10497。Bibcode : 2020EcolL..23.1878M。doi : 10.1111 / ele.13610。PMC 7702077。PMID 33073921。
- ^ Zhang W (1988). 「シフト不変パターン認識ニューラルネットワークとその光学アーキテクチャ」。応用物理学会年次大会講演論文集。
- ^ Zhang W, Itoh K, Tanida J, Ichioka Y (1990 年 11 月). 「局所的な空間不変相互接続とその光学アーキテクチャを備えた並列分散処理モデル」.応用光学. 29 (32): 4790–7. Bibcode :1990ApOpt..29.4790Z. doi :10.1364/AO.29.004790. PMID 20577468.
- ^ ab ビショップ、クリストファー M. (2006 年 8 月 17 日)。パターン認識と機械学習。ニューヨーク: シュプリンガー。ISBN 978-0-387-31073-2。
- ^ 福島K (2007). 「ネオコグニトロン」. Scholarpedia . 2 (1): 1717. Bibcode :2007SchpJ...2.1717F. doi : 10.4249/scholarpedia.1717 .
- ^ Hubel DH、 Wiesel TN (1968 年 3 月)。「サルの線条 体皮質の受容野と機能的構造」。The Journal of Physiology。195 ( 1): 215–43。doi :10.1113 / jphysiol.1968.sp008455。PMC 1557912。PMID 4966457。
- ^ 福島 K (1980). 「ネオコグニトロン: 位置の変化に影響されないパターン認識メカニズムのための自己組織化ニューラルネットワークモデル」.生物サイバネティクス. 36 (4): 193–202. doi :10.1007/BF00344251. PMID 7370364. S2CID 206775608.
- ^ Matsugu M, Mori K, Mitari Y, Kaneda Y (2003). 「畳み込みニューラルネットワークを使用した堅牢な顔検出による被験者に依存しない表情認識」ニューラルネットワーク. 16 (5–6): 555–9. doi :10.1016/S0893-6080(03)00115-1. PMID 12850007.
- ^ フィオラヴァンティ D、ジャッラーターノ Y、マッジョ V、アゴスティネッリ C、キエリチ M、ジャーマン G、フルラネッロ C (2018 年 3 月)。 「メタゲノミクスにおける系統発生畳み込みニューラル ネットワーク」。BMCバイオインフォマティクス。19 (補足 2): 49.土井: 10.1186/s12859-018-2033-5。PMC 5850953。PMID 29536822。
- ^ Ji, Yanrong; Zhou, Zhihan; Liu, Han; Davuluri, Ramana V (2021年8月9日). Kelso, Janet (編). 「DNABERT: ゲノム内のDNA言語のためのTransformersモデルからの事前トレーニング済み双方向エンコーダー表現」.バイオインフォマティクス. 37 (15): 2112–2120. doi :10.1093/bioinformatics/btab083. ISSN 1367-4803. PMC 11025658 . PMID 33538820.
- ^ Gündüz, Hüseyin Anil; Binder, Martin; To, Xiao-Yin; Mreches, René; Bischl, Bernd; McHardy, Alice C.; Münch, Philipp C.; Rezaei, Mina (2023年9月11日). 「ゲノミクスにおけるデータ効率の高いトレーニングのための自己教師ありディープラーニング手法」. Communications Biology . 6 (1): 928. doi : 10.1038/s42003-023-05310-2 . ISSN 2399-3642. PMC 10495322. PMID 37696966 .
- ^ Ho TK (1995).ランダム決定フォレスト. 第3回国際文書分析認識会議議事録、モントリオール、ケベック、1995年8月14~16日。pp. 278~282。
- ^ Dietterich T (2000)。決定木のアンサンブルを構築するための3つの方法の実験的比較:バギング、ブースティング、ランダム化。Kluwer Academic Publishers。pp. 139–157。
- ^ Breiman, Leo (2001). 「Radom Forests」.機械学習. 45 (1): 5–32. Bibcode :2001MachL..45....5B. doi : 10.1023/A:1010933404324 . S2CID 89141.
- ^ ab Zhang C, Ma Y (2012).アンサンブル機械学習:方法と応用. ニューヨーク:Springer New York Dordrecht Heidelberg London. pp. 157–175. ISBN 978-1-4419-9325-0。
- ^ Karim MR、Beyan O、Zappa A、Costa IG、Rebholz - Schuhmann D、Cochez M、Decker S (2021年1月)。「バイオインフォマティクスのためのディープラーニングベースのクラスタリングアプローチ」。Briefings in Bioinformatics 。22 ( 1 ): 393–415。doi :10.1093/bib/bbz170。PMC 7820885。PMID 32008043。
- ^ ロルビール B、コサレヴァ A、デーヴァ B、ソフティッチ D、ルッペル P、キュッパー A (2018 年 3 月 1 日)。 「クラスタリング アルゴリズム BIRCH のバリエーション」。ビッグデータ研究。11:44~53。土井:10.1016/j.bdr.2017.09.002。
- ^ Navarro-Muñoz JC、Selem-Mojica N、Mullowney MW、Kautsar SA、Tryon JH、Parkinson EI、他 (2020年1月)。「大規模な生合成多様性を探索するための計算フレームワーク」。Nature Chemical Biology。16 ( 1 ) : 60–68。doi : 10.1038 /s41589-019-0400-9。PMC 6917865。PMID 31768033 。
- ^ abcde Shastry KA、Sanjay HA (2020)。「バイオインフォマティクスのための機械学習」。バイオインフォマティクスの技術、ツール、アプリケーションのための統計モデルと機械学習の原則。インテリジェントシステムのためのアルゴリズム。Springer Singapore。pp. 25–39。doi :10.1007 / 978-981-15-2445-5_3。ISBN 978-981-15-2444-8. S2CID 214350490。
- ^ Libbrecht MW、Noble WS (2015 年 6 月)。「遺伝学と ゲノミクスにおける機械学習の応用」。Nature Reviews。遺伝学。16 ( 6): 321–32。doi : 10.1038/nrg3920。PMC 5204302。PMID 25948244。
- ^ Degroeve S, De Baets B, Van de Peer Y, Rouzé P (2002). 「スプライス部位予測のための特徴サブセット選択」.バイオインフォマティクス. 18 (Suppl 2): S75-83. doi : 10.1093/bioinformatics/18.suppl_2.s75 . PMID 12385987.
- ^ Huang S、Cai N、Pacheco PP、Narrandes S、Wang Y、Xu W(2018年1月)。「がんゲノム科学におけるサポートベクターマシン(SVM)学習の応用」。Cancer Genomics & Proteomics。15(1):41–51。doi : 10.21873 /cgp.20063。PMC 5822181。PMID 29275361。
- ^ Angermueller C, Pärnamaa T, Parts L, Stegle O (2016年7月). 「計算生物学のためのディープラーニング」.分子システム生物学. 12 (7): 878. doi :10.15252/msb.20156651. PMC 4965871. PMID 27474269 .
- ^ Cao C, Liu F, Tan H, Song D, Shu W, Li W, et al. (2018年2月). 「ディープラーニングとバイオメディカルへの応用」.ゲノミクス、プロテオミクス、バイオインフォマティクス. 16 (1): 17–32. doi :10.1016/j.gpb.2017.07.003. PMC 6000200. PMID 29522900 .
- ^ ゾウ J、ハス M、アビッド A、モハマディ P、トルカマニ A、テレンティ A (2019 年 1 月)。 「ゲノミクスにおけるディープラーニングの入門書」。自然遺伝学。51 (1): 12-18。土井:10.1038/s41588-018-0295-5。PMC 11180539。PMID 30478442。S2CID 205572042 。
- ^ Zeng Z 、Shi H、Wu Y 、 Hong Z (2015)。「バイオインフォマティクスにおける自然言語処理技術の調査」。医学における計算および数学 的手法。2015 (D1): 674296。doi : 10.1155/2015/ 674296。PMC 4615216。PMID 26525745。
- ^ Zeng Z、Shi H、Wu Y、Hong Z (2012)。「 バイオインフォマティクスにおける自然言語処理技術の調査」。医学における計算および数学 的手法。2015 (D1): 674296。doi : 10.1016 /B978-0-12-385467-4.00006-3。PMC 4615216。PMID 26525745。
- ^ Zeng Z 、Shi H、Wu Y 、 Hong Z (2017)。「バイオインフォマティクスにおける自然言語処理技術の調査」。医学における計算および数学 的手法。2015 (D1): 674296。doi : 10.1155/2015/ 674296。PMC 4615216。PMID 26525745。
- ^ 「GenBank と WGS の統計」www.ncbi.nlm.nih.gov 。2023年11 月 25 日閲覧。
- ^ abcd Mathé C, Sagot MF, Schiex T, Rouzé P (2002年10月). 「現在の遺伝子予測方法、その長所と短所」. Nucleic Acids Research . 30 (19): 4103–17. doi :10.1093/nar/gkf543. PMC 140543. PMID 12364589 .
- ^ Pratas D、Silva RM、Pinho AJ 、 Ferreira PJ (2015 年 5 月)。「DNA 配列のペア間の再配置を検出して視覚化するアラインメントフリー手法」。Scientific Reports。5 ( 10203): 10203。Bibcode : 2015NatSR ...510203P。doi :10.1038/srep10203。PMC 4434998。PMID 25984837。
- ^ Pauling L、Corey RB、Branson HR (1951 年 4 月)。「タンパク質の構造、ポリペプチド鎖の 2 つの水素結合らせん構造」。米国 科学アカデミー紀要。37 ( 4 ): 205–11。Bibcode :1951PNAS... 37..205P。doi : 10.1073 / pnas.37.4.205。PMC 1063337。PMID 14816373。
- ^ ab Wang S、Peng J、Ma J、Xu J (2016 年 1 月)。「ディープ畳み込みニューラル フィールドを使用したタンパク質二次構造予測」。Scientific Reports。6 : 18962。arXiv : 1512.00843。Bibcode : 2016NatSR ... 618962W。doi : 10.1038 / srep18962。PMC 4707437。PMID 26752681。
- ^ Riesenfeld CS、Schloss PD、Handelsman J (2004)。「メタゲノミクス:微生物群集のゲノム解析」。Annual Review of Genetics。38 (1): 525–52。doi : 10.1146 /annurev.genet.38.072902.091216。PMID 15568985 。
- ^ Soueidan, Hayssam; Nikolski, Macha (2017年1月1日). 「メタゲノミクスのための機械学習:方法とツール」.メタゲノミクス. 1 (1). arXiv : 1510.06621 . doi : 10.1515/metgen-2016-0001 . ISSN 2449-7657. S2CID 17418188.
- ^ abc Lin Y、Wang G、Yu J、 Sung JJ(2021年4月)。「腸疾患における人工知能とメタゲノミクス」。消化器病学および肝臓学ジャーナル。36 (4) : 841–847。doi :10.1111/ jgh.15501。PMID 33880764。S2CID 233312307 。
- ^ abc Dang T、Kishino H(2020年1月)。 「順方向変数選択と系統学を用いたランダムフォレストによるマイクロバイオームの重要な構成要素の検出」。bioRxiv 10.1101/2020.10.29.361360。
- ^ フィオラヴァンティ D、ジャッラーターノ Y、マッジョ V、アゴスティネッリ C、キエリチ M、ジャーマン G、フルラネッロ C (2018 年 3 月)。 「メタゲノミクスにおける系統発生畳み込みニューラル ネットワーク」。BMCバイオインフォマティクス。19 (補足 2): 49.土井: 10.1186/s12859-018-2033-5。PMC 5850953。PMID 29536822。
- ^ Dhungel E、Mreyoud Y、Gwak HJ、Rajeh A、Rho M、Ahn TH(2021年1月)。「MegaR:メタゲノムプロファイルと機械学習を使用した迅速なサンプル分類と表現型予測のためのインタラクティブRパッケージ」。BMCバイオインフォマティクス。22 (1):25。doi :10.1186/ s12859-020-03933-4。PMC 7814621。PMID 33461494。
- ^ Xun W, Liu Y, Li W, Ren Y, Xiong W, Xu Z, et al. (2021年1月). 「キーストーン分類群の特殊な代謝機能が土壌微生物叢の安定性を維持する」. Microbiome . 9 (1): 35. doi : 10.1186/s40168-020-00985-9 . PMC 7849160 . PMID 33517892.
- ^ ab Pirooznia M、Yang JY、Yang MQ、Deng Y (2008)。「マイクロアレイ遺伝子発現データに対するさまざまな機械学習手法の比較研究」。BMC Genomics。9 Suppl 1 (1): S13。doi : 10.1186 / 1471-2164-9 -S1- S13。PMC 2386055。PMID 18366602。
- ^ 「分子システム生物学における機械学習」。Frontiers 。2017年6月9日閲覧。
- ^ d'Alché-Buc F, Wehenkel L (2008年12月). 「システム生物学における機械学習」. BMC Proceedings . 2 Suppl 4 (4): S1. doi : 10.1186/1753-6561-2-S4-S1 . PMC 2654969. PMID 19091048 .
- ^ Bhattacharya M (2020). 「ゲノミクスにおける教師なし手法」。Srinivasa MG、Siddesh GM、MAnisekhar SR(編)「バイオインフォマティクスの手法、ツール、アプリケーションのための統計モデリングと機械学習の原則」。Springer Singapore。pp. 164–188。ISBN 978-981-15-2445-5。
- ^ Topol EJ (2019年1月). 「高性能医療:人間と人工知能の融合」. Nature Medicine . 25 (1): 44–56. doi :10.1038/s41591-018-0300-7. PMID 30617339. S2CID 57574615.
- ^ ab Jiang F, Jiang Y, Zhi H, Dong Y, Li H, Ma S, et al. (2017年12月). 「ヘルスケアにおける人工知能:過去、現在、そして未来」.脳卒中および血管神経学. 2 (4): 230–243. doi :10.1136/svn-2017-000101. PMC 5829945. PMID 29507784 .
- ^ Mirtskhulava L、Wong J、Al-Majeed S、Pearce G (2015 年 3 月)。「脳卒中診断における人工ニューラル ネットワーク モデル」(PDF)。2015年 17 回 UKSim-AMSS 国際モデリングおよびシミュレーション会議 (UKSim)。pp. 50–53。doi : 10.1109/ UKSim.2015.33。ISBN 978-1-4799-8713-9. S2CID 6391733。
- ^ Titano JJ、Badgeley M、Schefflein J、Pain M、Su A、Cai M、et al. (2018年9月)。「急性神経学的イベントに対する頭蓋画像の自動ディープニューラルネットワーク監視」。Nature Medicine。24 ( 9 ) : 1337–1341。doi : 10.1038 /s41591-018-0147-y。PMID 30104767。S2CID 51976344。
- ^ abc Krallinger M、Erhardt RA、Valencia A (2005 年 3 月) 。「分子生物学とバイオメディカルにおけるテキストマイニングアプローチ」。Drug Discovery Today。10 ( 6): 439–45。doi : 10.1016 /S1359-6446(05)03376-3。PMID 15808823。
- ^ Pratas D、Hosseini M、Silva R、Pinho A、Ferreira P (2017 年 6 月 20 ~ 23 日)。「現代人の DNA 領域をネアンデルタール人のゲノムと比較した視覚化」。パターン認識と画像分析。コンピュータサイエンスの講義ノート。第 10255 巻。pp . 235 ~ 242。doi :10.1007/978-3-319-58838-4_26。ISBN 978-3-319-58837-7。
- ^ Bardgett RD、Caruso T(2020年3月)。「土壌微生物群集の気候極端現象への反応:耐性、回復力、代替状態への移行」。ロンドン王立協会哲学論文集。シリーズB、生物科学。375( 1794 ):20190112。doi : 10.1098/rstb.2019.0112。PMC 7017770。PMID 31983338。
- ^ Deveau A, Bonito G, Uehling J, Paoletti M, Becker M, Bindschedler S, et al. (2018年5月). 「細菌と真菌の相互作用:生態、メカニズム、課題」. FEMS Microbiology Reviews . 42 (3): 335–352. doi : 10.1093/femsre/fuy008 . hdl : 21.11116/0000-0002-C1E7-F . PMID 29471481.
- ^ Ansari MZ、Yadav G、 Gokhale RS、Mohanty D (2004 年 7 月)。「NRPS-PKS: NRPS/PKS メガシンターゼの分析のための知識ベース リソース」。核酸研究。32 ( Webサーバー版) : W405-13。doi :10.1093/nar/gkh359。PMC 441497。PMID 15215420。
- ^ ab Navarro-Muñoz JC、Selem-Mojica N、Mullowney MW、Kautsar SA、Tryon JH、Parkinson EI、et al. (2020年1月)。「大規模な生合成多様性を探索するための計算フレームワーク」。Nature Chemical Biology。16 ( 1 ): 60–68。doi : 10.1038 /s41589-019-0400-9。PMC 6917865。PMID 31768033 。
- ^ ab Doroghazi JR、Albright JC、Goering AW、Ju KS、Haines RR、Tchalukov KA、他 (2014 年 11 月)。「大規模ゲノミクスとメタボロミクスに基づく天然物発見のロードマップ」。Nature Chemical Biology。10 ( 11 ) : 963–8。doi :10.1038/nchembio.1659。PMC 4201863。PMID 25262415。
- ^ ab Cimermancic P、Medema MH、Claesen J、Kurita K、Wieland Brown LC、Mavrommatis K、他。 (2014年7月)。 「原核生物の生合成遺伝子クラスターの包括的分析からの二次代謝への洞察」。セル。158 (2): 412–421。土井:10.1016/j.cell.2014.06.034。PMC 4123684。PMID 25036635。
- ^ ab Goering AW、McClure RA、Doroghazi JR、Albright JC、Haverland NA、Zhang Y、他 (2016 年 2 月)。「メタボロゲノミクス: 微生物遺伝子クラスターと代謝物の相関関係が、異常なアミノ酸モノマーを含む非リボソームペプチドの発見につながる」ACS Central Science。2 ( 2 ): 99–108。doi : 10.1021 /acscentsci.5b00331。PMC 4827660。PMID 27163034。
- ^ Amiri Moghaddam J, Crüsemann M, Alanjary M, Harms H, Dávila-Céspedes A, Blom J, et al. (2018年11月). 「海洋粘液細菌のゲノムとメタボロームの解析により、新規特殊代謝物の生合成の高い可能性が明らかに」. Scientific Reports . 8 (1): 16600. Bibcode :2018NatSR...816600A. doi :10.1038/s41598-018-34954-y. PMC 6226438. PMID 30413766 .
- ^ Duncan KR, Crüsemann M, Lechner A, Sarkar A, Li J, Ziemert N, et al. (2015年4月). 「分子ネットワークとパターンベースのゲノムマイニングにより、Salinispora種の生合成遺伝子クラスターとその産物の発見が向上」. Chemistry & Biology . 22 (4): 460–471. doi :10.1016/j.chembiol.2015.03.010. PMC 4409930. PMID 25865308 .
- ^ Nielsen JC、Grijseels S、Prigent S、Ji B、Dainat J、Nielsen KF、他 (2017 年 4 月)。「生合成遺伝子クラスターの包括的分析により、ペニシリウム属の二次代謝産物生産の大きな可能性が明らかになった」。Nature Microbiology。2 ( 6 ) : 17044。doi : 10.1038 /nmicrobiol.2017.44。PMID 28368369。S2CID 22699928。
- ^ McClure RA、Goering AW、Ju KS、Baccile JA、Schroeder FC、Metcalf WW、他 (2016 年 12 月)。「代謝物/遺伝子クラスター相関を用いたリモサミド解毒天然物ファミリーとその生合成の解明」ACS Chemical Biology . 11 (12): 3452–3460. doi :10.1021/acschembio.6b00779. PMC 5295535 . PMID 27809474.
- ^ Cao L、Shcherbin E、Mohimani H (2019年8月) 。「メタボロームおよびメタゲノムワイド関連ネットワークがヒト微生物叢からの微生物天然物および微生物生体内変換産物を明らかにする」。mSystems。4 ( 4): e00387–19、/msystems/4/4/msys.00387–19.atom。doi : 10.1128 / mSystems.00387-19。PMC 6712304。PMID 31455639。
- ^ Olm MR、Bhattacharya N、Crits-Christoph A、Firek BA、Baker R、Song YS、et al. (2019年12月)。「壊死性腸炎の前には、腸内細菌の複製、クレブシエラ、線毛をコードする細菌の増加がみられる」。Science Advances。5 ( 12 ) : eaax5727。Bibcode : 2019SciA .... 5.5727O。doi :10.1126/sciadv.aax5727。PMC 6905865。PMID 31844663 。
- ^ Carrión VJ、Perez-Jaramillo J、Cordovez V、Tracanna V、de Hollander M、Ruiz-Buck D、et al. (2019年11月)。「内生根マイクロバイオームにおける病原体誘導性疾患抑制機能の活性化」。Science。366 ( 6465 ) : 606–612。Bibcode : 2019Sci ...366..606C。doi : 10.1126 / science.aaw9285。hdl : 1887 / 3188901。PMID 31672892。S2CID 207814746。
- ^ パスカル・アンドリュー、ビクトリア州;アウグスティン、ハンナ E.ヴァン・デン・ベルク、公園。ファン・デル・ホーフト、ジャスティン・JJ。フィッシュバッハ、マイケル A. Medema、Marnix H. (2021 年 10 月 26 日)。シャンク、エリザベス・アン (編著)。 「BiG-MAP: マイクロバイオームにおける代謝遺伝子クラスターの量と発現をプロファイリングする自動パイプライン」。mシステム。6 (5): e0093721。土井:10.1128/mSystems.00937-21。ISSN 2379-5077。PMC 8547482。PMID 34581602。
- ^ Agrawal P、Khater S、Gupta M、Sain N、Mohanty D (2017 年 7 月)。「RiPPMiner: 切断と架橋の予測に基づいて RiPP の化学構造を解読するためのバイオインフォマティクス リソース」。核酸研究。45 ( W1 ): W80 – W88。doi :10.1093/ nar /gkx408。PMC 5570163。PMID 28499008。
- ^ Huber F, Ridder L, Verhoeven S, Spaaks JH, Diblen F, Rogers S, van der Hooft JJ (2021年2月). 「Spec2Vec: 構造関係の学習による質量スペクトル類似性スコアリングの改善」. PLOS Computational Biology . 17 (2): e1008724. Bibcode :2021PLSCB..17E8724H. doi : 10.1371/journal.pcbi.1008724 . PMC 7909622. PMID 33591968 .
- ^ Huber F, Ridder L, Verhoeven S, Spaaks JH, Diblen F, Rogers S, van der Hooft JJ (2021年2月). 「Spec2Vec: 構造関係の学習による質量スペクトル類似性スコアリングの改善」. PLOS Computational Biology . 17 (2): e1008724. Bibcode :2021PLSCB..17E8724H. doi : 10.1371/journal.pcbi.1008724 . PMC 7909622. PMID 33591968 .
- ^ 国立生物工学情報センター、米国国立医学図書館。「国立生物工学情報センター」ncbi.nlm.nih.gov 。 2021年7月30日閲覧。
- ^ Agarwala R、Barrett T、Beck J、Benson DA、Bollin C、Bolton E、他 (NCBI リソースコーディネーター) (2018 年 1 月)。「国立バイオテクノロジー情報センターのデータベースリソース」。 核酸研究。46 ( D1 ): D8–D13。doi : 10.1093/ nar /gkx1095。PMC 5753372。PMID 29140470。
- ^ 「antiSMASH データベース」。antismash -db.secondarymetabolites.org。
- ^ 「MIBiG: 生合成遺伝子クラスターに関する最小限の情報」mibig.secondarymetabolites.org . 2021年7月30日閲覧。
- ^ ミビッグ
- ^ Kautsar SA、Blin K、Shaw S、Navarro-Muñoz JC、Terlouw BR、van der Hooft JJ、et al. (2020年1月)。「MIBiG 2.0:既知の機能を持つ生合成遺伝子クラスターのリポジトリ」。核酸 研究。48 (D1 ):D454 – D458。doi :10.1093/nar/gkz882。PMC 7145714。PMID 31612915。
- ^ “Silva”. arb-silva.de . 2021年7月30日閲覧。
- ^ Quast C、Pruesse E、Yilmaz P、Gerken J、Schweer T、Yarza P、他 (2013 年 1 月)。「SILVA リボソーム RNA 遺伝子データベース プロジェクト: 改良されたデータ処理と Web ベース ツール」。Nucleic Acids Research。41 (データベース号): D590-6。doi : 10.1093/nar/gks1219。PMC 3531112。PMID 23193283 。
- ^ “greengenes.secondgenome.com”. greengenes.secondgenome.com . 2021年7月30日閲覧。
- ^ DeSantis TZ、Hugenholtz P、Larsen N、Rojas M、Brodie EL、Keller K、他 (2006 年 7 月)。「Greengenes、キメラチェック済み 16S rRNA 遺伝子データベースおよび ARB 対応ワークベンチ」。 応用環境微生物学。72 ( 7): 5069–72。Bibcode :2006ApEnM..72.5069D。doi : 10.1128 / AEM.03006-05。PMC 1489311。PMID 16820507。
- ^ McDonald D, Price MN, Goodrich J, Nawrocki EP, DeSantis TZ, Probst A, et al. (2012年3月). 「細菌と古細菌の生態学的および進化学的分析のための明示的なランクを備えた改良されたGreengenes分類法」. The ISME Journal . 6 (3): 610–8. Bibcode :2012ISMEJ...6..610M. doi : 10.1038/ismej.2011.139. PMC 3280142. PMID 22134646.
- ^ “オープンツリー”.ツリー.opentreeoflife.org 。2021 年7 月 30 日に取得。
- ^ Hinchliff CE、Smith SA、Allman JF、Burleigh JG、Chaudhary R、Coghill LM、他 (2015年10月)。「系統学と分類学を統合した包括的な生命樹」。米国科学アカデミー紀要。112 (41): 12764–9。Bibcode : 2015PNAS..11212764H。doi : 10.1073 / pnas.1423041112。PMC 4611642。PMID 26385966。
- ^ 「RDP リリース 11 -- シーケンス解析ツール」。rdp.cme.msu.edu。2020年8月19日時点のオリジナルよりアーカイブ。2021年7月30日閲覧。
- ^ Cole JR、Wang Q、Fish JA、Chai B 、 McGarrell DM、Sun Y、他 (2014 年 1 月)。「リボソーム データベース プロジェクト: ハイスループット rRNA 分析のためのデータとツール」。核酸研究。42 (データベース号) : D633-42。doi :10.1093 / nar/gkt1244。PMC 3965039。PMID 24288368 。
