バイオインフォマティクスの分野では、配列データベースは、コンピュータに保存された多数のコンピュータ化された(「デジタル」)核酸配列、タンパク質配列、またはその他のポリマー配列で構成される生物学的データベースの一種です。UniProtデータベースは、タンパク質配列データベースの一例です。2013 年時点で 4,000 万を超える配列が含まれており、指数関数的に増加しています。[ 1 ]従来、配列は紙の形で公開されていましたが、配列の数が増えるにつれて、この保存方法は持続不可能になりました。
配列データベースでの検索では、ゲノム/タンパク質配列とクエリ文字列との類似性を探し、データベース内でターゲット配列に「最も」一致する配列を見つけます(検索方法によって異なる基準に基づきます)。一致/ヒットの数は、配列クエリと配列データベース内の配列との類似性を決定するスコアを作成するために使用されます。[ 2 ]主な目標は、2 つの基準のバランスをうまく取ることです。
配列データベースの必要性は、1950年にフレデリック・サンガーがインスリンの一次構造を報告したことに端を発する。彼は核酸の配列決定法を開発したことで2度目のノーベル賞を受賞し、彼の比較アプローチが他のタンパク質生化学者たちがアミノ酸配列の収集を始めるきっかけとなった。こうして分子データベースの始まりが始まった。[ 3 ]
1965年、マーガレット・デイホフと国立生物医学研究財団(NBRF)のチームは「タンパク質配列と構造のアトラス」を出版した。彼らは、未発表のものも含め、既知のすべてのタンパク質配列をアトラスに収録した。これは、分子データベースを作成する最初の試みと見なすことができる。彼らは、国立衛生研究所(NIH)の新たにコンピュータ化された(1964年)医学文献分析検索システム(MEDLARS)を利用した。チームはコンピュータを使用してデータを保存したが、各配列を手作業で入力して校正する必要があり、時間と費用がかさんだ。[ 3 ]
1966年、チームは第2版のアトラスをリリースした。これは第1版の2倍の規模で、約1000の配列が含まれており、この時期は情報爆発と呼ばれた。当時、NBRFは医学と生物学にコンピュータを活用する最先端を行っていた。デイホフと彼女のチームは、メインフレームコンピュータでタンパク質分子のアミノ酸配列を決定するために施設を利用した。発見された配列の数は増え続け、これまで以上にタンパク質のより詳細な比較分析が可能になった。これにより、アミノ酸置換の確率モデル、配列アライメント、タンパク質の進化関係の系統樹など、多くの発展がもたらされた。[ 3 ]
シーケンス解析プロセス全体が完全に自動化された。[ 3 ]
最初のヌクレオチド配列データベースが作成されました。以前は欧州分子生物学研究所(EMBL)ヌクレオチド配列データライブラリ(現在は欧州ヌクレオチドアーカイブとして知られています)として知られていました。ヒトゲノムプロジェクトは1988年に始まりました。このプロジェクトの目標は、ヒトのすべての遺伝子の配列を決定してマッピングすることであり、そのためには大規模な配列データベースを作成して利用する能力が必要でした。[ 4 ]
現在では、多くの配列データベース、それらを利用するためのツール、そしてそれらへの容易なアクセスが利用可能です。その中でも最大規模のものの1つがGenBankで、20億を超える配列が含まれています。[ 3 ]

配列データベースの記録は、個々の研究者から大規模なゲノムシーケンスセンターまで、幅広い情報源から登録されています。そのため、配列自体、特にこれらの配列に付随する生物学的注釈の品質は異なる場合があります。複数の研究室がデータベース内の他の配列と同一またはほぼ同一の配列を多数提出する可能性があるため、重複が多くなります。[ 5 ]
多くの配列アノテーションは、実験室での実験ではなく、以前にアノテーションされた配列の配列類似性検索の結果に基づいています。配列が他の配列との類似性に基づいてアノテーションされ、データベースに登録されると、将来のアノテーションの基礎となることもあります。特定のデータベースレコードと実際のウェットラボ実験情報との間で、配列類似性によるアノテーションの転送が複数回発生する可能性があるため、これは推移的なアノテーション問題につながる可能性があります。 [ 6 ]したがって、配列データベースからのアノテーションデータを解釈する際には注意が必要です。
現在のデータベース検索アルゴリズムのほとんどは、特定のスコアリングシステムによってアライメントをランク付けします。 [ 7 ]この問題を解決するための解決策は、特定の問題に合わせてさまざまなスコアリングシステムを利用できるようにすることです。