
計算生物学とは、コンピュータ科学、データ分析、数理モデリング、計算シミュレーションの技術を用いて生物システムとその関係性を理解することを指します。 [ 1 ]コンピュータ科学、生物学、データ科学の交差点であるこの分野は、応用数学、分子生物学、細胞生物学、化学、遺伝学にも基礎を置いています。[ 2 ]
生物情報学、すなわち生物システムの情報処理を分析する学問は、1970年代初頭に始まった。当時、人工知能の研究では、新しいアルゴリズムを生成するために人間の脳のネットワークモデルが使用されていた。この生物学的データの使用により、生物学研究者はコンピュータを使用して、自身の分野の大規模なデータセットを評価および比較するようになった。[ 3 ]
1982年までに、研究者たちはパンチカードを使って情報を共有していた。1980年代末までにデータ量は指数関数的に増加し、関連情報を迅速に解釈するための新しい計算方法が必要となった。[ 3 ]
計算生物学の最もよく知られた例であるヒトゲノムプロジェクトは、1990年に正式に開始されました。[ 4 ] 2003年までに、このプロジェクトはヒトゲノムの約85%をマッピングし、当初の目標を達成しました。[ 5 ]しかし、作業は継続され、2021年までに「完全なゲノム」のレベルに達し、潜在的な問題によってカバーされる残りの塩基はわずか0.3%になりました。[ 6 ] [ 7 ]欠落していたY染色体は2022年1月に加わりました。
1990年代後半以降、計算生物学は生物学の重要な一部となり、数多くの下位分野を生み出しました。[ 8 ]現在、国際計算生物学会は、より大きな分野の一部を代表する21の異なる「特別関心コミュニティ」を認めています。[ 9 ]計算生物学は、ヒトゲノムの配列決定を支援するだけでなく、ヒトの脳の正確なモデルの作成、ゲノムの3D構造のマッピング、および生物システムのモデル化にも役立っています。[ 3 ] 計算生物学の初期の進歩の多くは、大規模な計算インフラストラクチャのおかげで、米国と西ヨーロッパから生まれました。しかし、ここ数十年で、より貧しい国々からの貢献が増えています。たとえば、コロンビアは1998年から国際的な計算生物学の取り組みを行っており、コーヒーやジャガイモなどの国にとって重要な作物のゲノムと病気に焦点を当てています。[ 10 ]同様に、ポーランドは近年、生体分子シミュレーションと高分子配列解析の分野で主導的な役割を果たしている。 [ 11 ]
計算解剖学とは、目に見える解剖学的または肉眼的な解剖学的構造における解剖学的形状と形態の研究である。形態学のスケール。これは、生物学的構造をモデル化およびシミュレーションするための計算数学およびデータ解析手法の開発を伴います。医療画像装置ではなく、画像化される解剖学的構造に焦点を当てています。磁気共鳴画像法などの技術による高密度3D計測が可能になったため、計算解剖学は、3Dで形態素スケールでの解剖学的座標系を抽出するための医療画像処理およびバイオエンジニアリングのサブ分野として出現しました。
計算解剖学の本来の定式化は、変換によって作用する例から形状と形態を生成するモデルとしてである。[ 12 ]微分同相群は、 1 つの解剖学的構成からのラグランジュおよびオイラーの流れの速度によって生成される座標変換を介して異なる座標系を研究するために使用される。これは、形状統計学や形態計測学と関連していますが、微分同相写像は座標系のマッピングに使用され、その研究は微分形態計測学として知られています。
数理生物学は、生物の数理モデルを用いて、生物システムの構造、発達、行動を支配するシステムを研究する学問である。これは、実験生物学のような経験主義的なアプローチとは異なり、問題に対してより理論的なアプローチをとることを意味する。[ 13 ]数理生物学は、離散数学、トポロジー(計算モデリングにも有用)、ベイズ統計学、線形代数、ブール代数に基づいている。[ 14 ]
これらの数学的手法により、生物学的データを保存、検索、分析するためのデータベースやその他の手法が開発され、バイオインフォマティクスと呼ばれる分野が確立されました。通常、このプロセスには遺伝学と遺伝子解析が含まれます。
大規模なデータセットの収集と分析により、データマイニング[ 14 ]や計算バイオモデリング(生物システムのコンピュータモデルと視覚シミュレーションの構築を指す)などの研究分野が拡大しています。これにより、研究者は、そのようなシステムがさまざまな環境にどのように反応するかを予測することができ、システムが「外部および内部の摂動に対して状態と機能を維持できるかどうか」を判断するのに役立ちます。[ 15 ]現在の技術は小規模な生物システムに焦点を当てていますが、研究者は、より大規模なネットワークを分析およびモデル化できるアプローチに取り組んでいます。大多数の研究者は、これが新しい薬や遺伝子治療を作成するための現代的な医療アプローチの開発に不可欠になると考えています。[ 15 ]有用なモデリングアプローチは、 esyNなどのツールを使用してペトリネットを使用することです。[ 16 ]
近年まで、理論生態学は主に、経験的生態学者が用いる統計モデルとは切り離された分析モデルを扱ってきた。近年では、計算手法が生態系のシミュレーションを通して理論の発展に貢献するとともに、生態学的分析における計算統計学の手法の応用も増加している。
システム生物学は、細胞レベルから集団全体に至るまで、さまざまな生物システム間の相互作用を計算し、創発特性を発見することを目的としています。このプロセスには通常、細胞シグナル伝達と代謝経路のネットワーク化が含まれます。システム生物学では、細胞レベルでのこれらの複雑な相互作用を研究するために、生物学的モデリングとグラフ理論の計算技術がよく使用されます。[ 14 ]
計算生物学は、以下の方法で進化生物学を支援してきた。

計算ゲノミクスは、細胞や生物のゲノムを研究する学問です。ヒトゲノムプロジェクトは、計算ゲノミクスの一例です。このプロジェクトは、ヒトゲノム全体を配列決定してデータセットにすることを目指しています。完全に実装されれば、医師は個々の患者のゲノムを分析できるようになります。[ 19 ]これにより、個人の既存の遺伝的パターンに基づいて治療法を処方する、個別化医療の可能性が開かれます。研究者たちは、動物、植物、細菌、その他すべての種類の生命 体のゲノムを配列決定しようとしています。 [ 20 ]
ゲノムを比較する主な方法の1つは、配列相同性によるものです。相同性とは、共通の祖先から派生した異なる生物の生物学的構造とヌクレオチド配列の研究です。研究によると、新たに配列決定された原核生物ゲノムの遺伝子の80~90%はこの方法で特定できることが示唆されています。[ 20 ]
配列アライメントは、生物学的配列や遺伝子間の類似性を比較・検出するためのもう一つの手法です。配列アライメントは、 2つの遺伝子の最長共通部分配列の計算や、特定の疾患の変異体の比較など、多くのバイオインフォマティクス応用において有用です。
計算ゲノミクスにおける未開拓のプロジェクトの一つは、ヒトゲノムの約97%を占める遺伝子間領域の解析である。[ 20 ]研究者たちは、計算および統計的手法の開発や、 ENCODEやロードマップエピゲノミクスプロジェクトなどの大規模コンソーシアムプロジェクトを通じて、ヒトゲノムの非コード領域の機能を理解しようと取り組んでいる。
個々の遺伝子が分子レベル、細胞レベル、個体レベルで生物の生物学にどのように貢献するかを理解することは、遺伝子オントロジーとして知られています。遺伝子オントロジーコンソーシアムの使命は、分子レベルからより大きな経路、細胞レベル、個体レベルのシステムに至るまで、生物システムの最新の包括的な計算モデルを開発することです。遺伝子オントロジーリソースは、ヒトから細菌まで、さまざまな生物の遺伝子(より正確には、遺伝子によって生成されるタンパク質および非コードRNA分子)の機能に関する現在の科学的知識の計算表現を提供します。[ 21 ]
3D ゲノミクスは、計算生物学の一分野で、真核細胞内の遺伝子の組織化と相互作用に焦点を当てています。3D ゲノムデータを収集するために使用される方法の 1 つは、ゲノム構造マッピング(GAM) です。GAM は、核から帯状の断片を切り出して DNA を調べるプロセスである凍結切片法とレーザーマイクロダイセクションを組み合わせることにより、ゲノム内のクロマチンと DNA の 3D 距離を測定します。核プロファイルとは、核から採取されたこの帯状またはスライスのことです。各核プロファイルには、 DNA の基本単位であるヌクレオチドの特定の配列であるゲノムウィンドウが含まれています。GAM は、細胞全体にわたる複雑なマルチエンハンサークロマチン接触のゲノムネットワークを捉えます。[ 22 ]
計算生物学は、心血管疾患などの疾患のバイオマーカーの特定にも役割を果たしており、ゲノミクス、プロテオミクス、メタボロミクスなどのさまざまな「オミクス」データを統合することで、研究者は疾患の診断、予後、治療戦略に役立つ潜在的なバイオマーカーを発見することができます。たとえば、メタボロミクス分析では、冠動脈疾患と心筋梗塞を区別できる特定の代謝物が特定されています。[ 23 ]
計算神経科学は、神経系の情報処理特性の観点から脳機能を研究する学問である。神経科学の一分野であり、脳をモデル化することで神経系の特定の側面を検証しようとする。[ 24 ]脳のモデルには以下のようなものがある。
計算神経科学者の仕事は、こうした計算の速度を向上させるために現在使用されているアルゴリズムとデータ構造を改良することである。
計算神経精神医学は、精神障害に関与する脳のメカニズムを数学的およびコンピュータ支援モデリングによってモデル化する新興分野です。いくつかの取り組みにより、計算モデリングは精神機能や機能障害を生み出す可能性のある神経回路を理解する上で重要な貢献であることが実証されています。[ 26 ] [ 27 ] [ 28 ]
計算生物学は、これまで知られていなかった新しい生物の兆候を発見したり、がん研究において重要な役割を果たしています。この分野では、RNA、DNA、タンパク質などの細胞プロセスの大規模な測定が行われ、計算上の大きな課題が生じます。これらの課題を克服するために、生物学者は計算ツールに頼って生物学的データを正確に測定および分析しています。[ 29 ]がん研究では、計算生物学は腫瘍サンプルの複雑な分析を支援し、研究者が腫瘍を特徴付け、さまざまな細胞特性を理解するための新しい方法を開発するのに役立ちます。DNA、RNA、およびその他の生物学的構造からの数百万のデータポイントを含むハイスループット測定の使用は、がんを早期に診断し、がんの発生に寄与する主要な要因を理解するのに役立ちます。重点分野には、がんを引き起こす決定的な分子の分析や、ヒトゲノムが腫瘍の発生にどのように関連しているかの理解が含まれます。[ 29 ] [ 30 ]
計算毒性学は学際的な研究分野であり、医薬品の発見および開発の初期段階で、候補薬の安全性と潜在的な毒性を予測するために用いられる。
計算薬理学とは、「ゲノムデータの影響を研究して特定の遺伝子型と疾患との関連性を見つけ、その後、薬剤データをスクリーニングする」ことである。[ 31 ]
計算生物学の応用分野として、創薬がますます広がりを見せている。例えば、プロテオミクスやメタボロミクス実験のデータを用いた細胞内および細胞間シグナル伝達イベントのシミュレーションは、生体内における薬剤候補の薬物動態や薬力学を解明する際の実験への依存度を低減する可能性がある。 [ 32 ]
人工知能は、創薬プロセスにおいてますます中心的な役割を担うようになっている。既知の医薬品の化学構造を入力として使用することで、AIモデルはリード化合物の構造を提案したり、薬物とタンパク質の結合の新たな様式を予測したりすることができる。AIはまた、候補分子の仮想スクリーニングにも使用され、スクリーニングのために多数の分子を合成する必要性を回避している。[ 33 ] [ 34 ]
計算生物学者は、研究を行うために幅広いソフトウェアとアルゴリズムを使用する。
教師なし学習は、ラベル付けされていないデータからパターンを見つけるアルゴリズムの一種です。一例として、k平均クラスタリングがあります。これは、 n個のデータポイントをk個のクラスターに分割し、各データポイントが最も近い平均値を持つクラスターに属するようにするものです。別の例として、 kメドイドアルゴリズムがあります。これは、クラスターの中心またはクラスターセントロイドを選択する際に、クラスターの平均値だけでなく、そのデータポイントの中から1つを選択します。

アルゴリズムは以下の手順に従います。
生物学におけるこの例の1つは、ゲノムの3Dマッピングに使用されます。マウスの13番染色体のHIST1領域の情報は、Gene Expression Omnibusから収集されます。[ 35 ]この情報には、特定のゲノム領域にどの核プロファイルが現れるかに関するデータが含まれています。この情報を使用して、ジャッカード距離を使用して、すべての遺伝子座間の正規化された距離を見つけることができます。
グラフ分析、またはネットワーク分析とは、異なるオブジェクト間のつながりを表すグラフの研究です。グラフは、タンパク質間相互作用ネットワーク、制御ネットワーク、代謝ネットワーク、生化学ネットワークなど、生物学におけるあらゆる種類のネットワークを表すことができます。これらのネットワークを分析する方法は数多くありますが、その一つがグラフの中心性を調べることです。グラフの中心性を調べると、ノードの人気度やグラフ内での中心性に応じてノードの順位が付けられます。これは、どのノードが最も重要かを判断するのに役立ちます。例えば、一定期間における遺伝子の活性に関するデータが与えられた場合、次数中心性を用いることで、ネットワーク全体でどの遺伝子が最も活性が高いか、あるいはどの遺伝子がネットワーク全体で他の遺伝子と最も多く相互作用しているかを知ることができます。これは、特定の遺伝子がネットワーク内で果たす役割の理解に貢献します。
グラフの中心性を計算する方法は数多くあり、それぞれ中心性に関する異なる種類の情報が得られます。生物学における中心性の発見は、遺伝子制御、タンパク質相互作用、代謝ネットワークなど、さまざまな状況に適用できます。[ 36 ]
教師あり学習とは、ラベル付きデータから学習し、ラベルのない将来のデータにラベルを割り当てる方法を学習するアルゴリズムの一種です。生物学においては、分類方法がわかっているデータがあり、さらに多くのデータをその分類カテゴリに分類したい場合に、教師あり学習が役立ちます。

一般的な教師あり学習アルゴリズムとしてランダムフォレストがあります。これは、多数の決定木を使用してモデルを訓練し、データセットを分類します。ランダムフォレストの基礎となる決定木は、データの特定の既知の特徴を使用して、あるデータセットを分類またはラベル付けすることを目的とした構造です。生物学的な実例としては、個人の遺伝子データを使用して、その個人が特定の病気や癌を発症しやすいかどうかを予測することが挙げられます。各内部ノードで、アルゴリズムはデータセットに対して正確に1つの特徴(前の例では特定の遺伝子)をチェックし、結果に基づいて左右に分岐します。次に、各葉ノードで、決定木はデータセットにクラスラベルを割り当てます。つまり、実際には、アルゴリズムは入力データセットに基づいて決定木を介して特定のルートから葉へのパスをたどり、その結果としてデータセットが分類されます。一般的に、決定木のターゲット変数は、はい/いいえなどの離散値を取ります。この場合、分類木と呼ばれますが、ターゲット変数が連続値の場合は回帰木と呼ばれます。決定木を構築するには、まず訓練データセットを用いて、目的変数を最もよく予測する特徴量を特定するための訓練を行う必要があります。
これらは、計算生物学において高速行列乗算アルゴリズムを利用しようとする試みである。この種の研究の例としては、[ 37 ]および[ 38 ]が挙げられる。
オープンソースソフトウェアは、誰もが研究で開発されたソフトウェアにアクセスし、その恩恵を受けることができる計算生物学のためのプラットフォームを提供する。[ 39 ] PLOSは、オープンソースソフトウェアを使用する主な理由として4つを挙げている。
計算生物学に関する大規模な学会はいくつか存在する。代表的な例としては、Intelligent Systems for Molecular Biology、European Conference on Computational Biology、Research in Computational Molecular Biologyなどが挙げられる。
計算生物学に特化した学術誌も数多く存在します。代表的な例としては、Journal of Computational BiologyやPLOS Computational Biologyなどが挙げられます。PLOS Computational Biologyは査読付きのオープンアクセス誌で、計算生物学分野における数々の注目すべき研究プロジェクトを掲載しています。これらの学術誌は、ソフトウェアのレビュー、オープンソースソフトウェアのチュートリアル、そして今後開催される計算生物学関連の学会情報などを提供しています。この分野に関連するその他の学術誌としては、 Bioinformatics、Computers in Biology and Medicine、BMC Bioinformatics、Nature Methods、Nature Communications、Scientific Reports、PLOS Oneなどがあります。
計算生物学、バイオインフォマティクス、数理生物学はすべて、数学や情報科学などの定量的分野から着想を得た生命科学への学際的なアプローチです。NIHは、計算生物学/数理生物学を、生物学における理論的および実験的な問題に取り組むための計算/数学的アプローチの使用と定義し、対照的に、バイオインフォマティクスを、複雑な生命科学データを理解するための情報科学の応用と定義しています。[ 1 ]
具体的には、NIHは次のように定義しています。
計算生物学:生物学的、行動的、社会的なシステムの研究へのデータ分析および理論的手法、数理モデル、計算シミュレーション技術の開発と応用。[ 1 ]
バイオインフォマティクス:生物学的、医学的、行動的、または健康データの使用を拡大するための計算ツールおよびアプローチの研究、開発、または応用。これには、そのようなデータの取得、保存、整理、アーカイブ、分析、または視覚化を行うツールおよびアプローチが含まれる。[ 1 ]
それぞれの分野は異なっているものの、その境界ではかなりの重複が見られる場合があり、[ 1 ]そのため多くの人にとって、バイオインフォマティクスと計算生物学は同じ意味で使われている。
計算生物学と進化計算という用語は似ているように見えるが、同一ではない。進化計算は、生物学における進化に触発されたアルゴリズムを含むコンピュータ科学の分野である。進化計算の分野のアルゴリズムは、計算生物学に適用することができる。[ 41 ]