バイオインフォマティクスにおける配列プロファイリングツールとは、遺伝子配列、遺伝子名、またはキーワード入力に関連する情報を提供するソフトウェアの一種です。このようなツールは通常、 DNA、RNA、タンパク質配列、または「キーワード」などのクエリを受け取り、その配列に関連する情報を1つ以上のデータベースから検索します。要約と集計結果は標準化された形式で提供され、そうでなければ多数の小規模サイトを訪問したり、文献を直接検索したりして収集する必要があった情報を記述します。多くの配列プロファイリングツールは、膨大かつ増加し続けるバイオインフォマティクスデータベースからクエリに関する情報を見つけるプロセスを簡素化するソフトウェアポータルまたはゲートウェイです。これらのツールへのアクセスは、Webベースまたはローカルにダウンロード可能な実行ファイルのいずれかです。
「ポストゲノム」時代は、大量の一次配列情報、タンパク質構造、遺伝子アノテーション、配列アライメント、その他の一般的なバイオインフォマティクス作業などを収集、整理、提供するための、さまざまなウェブベースのツールやソフトウェアを生み出した。
一般的に、データベースとサービスプロバイダーには3つのタイプがあります。1つ目は、 NCBI、ExPASy、Ensembl、PDBなどの資金援助や助成金によって運営されている、広く普及しているパブリックドメインまたはオープンアクセスデータベースです。2つ目は、個々の研究グループによって組織化および編集された、より小規模または特定のデータベースです。例としては、Yeast Genome Database、RNA database (2002年9月15日米国議会図書館ウェブアーカイブにアーカイブ)などがあります。3つ目は、アクセスに料金の支払いまたは所属機関との契約が必要な、企業または機関のプライベートデータベースです。パブリックデータベースのグローバル化が進む現在、このような例は稀ですが、サービスが「開発中」である場合や、分析の最終結果が商業的価値のあるものである場合は例外です。
プロファイリング手法の典型的なシナリオは、特に最初の2つのグループの場合に重要になります。これらのグループでは、研究者は単一のクエリまたはターゲット配列に関する複数の情報源から得られた情報を組み合わせたいと考えるのが一般的です。たとえば、ユーザーは配列アライメントおよび検索ツールであるBLASTを使用して、関心のある遺伝子の他の種における相同遺伝子を特定し、その結果を使用して相同遺伝子の1つについて既知のタンパク質構造を見つけるかもしれません。同様に、関心のある遺伝子をコードするmRNAの二次構造の可能性や、企業がその遺伝子を含むDNA構築物を販売しているかどうかを知りたい場合もあるでしょう。配列プロファイリングツールは、複数の異なる外部データベースを検索するプロセスをユーザーにとって透過的にすることで、このような多様な情報を探すプロセスを自動化および統合する役割を果たします。
多くの公開データベースは既に広範囲にリンクされており、他のデータベースの補完的な情報に容易にアクセスできます。例えば、GenBankとPDBは密接に連携しています。しかし、特定の研究グループが組織しホストする専門ツールは、対象範囲が狭かったり、頻繁に変更されたり、一般的なファイル形式のカスタムバージョンを使用したりするため、このリンクの取り組みに統合するのが難しい場合があります。シーケンスプロファイリングツールの利点としては、これらの専門ツールを複数、単一のクエリで使用し、共通のインターフェースで出力を表示できること、あるツールセットまたはデータベース検索の出力を別のツールセットまたはデータベース検索の入力として使用できること、そして単一の中央リポジトリではなく、研究グループや機関のネットワークにホスティングとコンパイルの義務を分散できることが挙げられます。
現在ウェブ上で利用できるプロファイリングツールのほとんどはこのカテゴリに属します。ユーザーはサイト/ツールにアクセスし、ジストロフィー、糖尿病などのキーワード、GenBankアクセッション番号、PDB IDなどの関連情報を入力します。検索結果はすべて、各ツールの主な焦点に合わせた形式で表示されます。キーワード検索に基づくプロファイリングツールは、基本的にバイオインフォマティクス作業に特化した検索エンジンであり、 Googleのような従来の検索エンジンで発生する可能性のある、無関係または非学術的な検索結果の混乱を排除します。ほとんどのキーワードベースのプロファイリングツールは、インデックス付きデータベースからのアクセッション番号や従来のキーワード記述子など、柔軟なタイプのキーワード入力を可能にします。
各プロファイリングツールにはそれぞれ独自の焦点と関心領域があります。たとえば、NCBIの検索エンジンEntrezは検索結果をカテゴリ別に分類しているため、タンパク質構造情報を探しているユーザーは対応する構造のない配列を除外できます。また、あるテーマに関する文献を閲覧したいユーザーは、遺伝子や配列の結果に気を取られることなく、学術誌に掲載された論文の要約を閲覧できます。PubMedバイオサイエンス文献データベースは文献検索に人気のツールですが、このサービスはより汎用的なGoogle Scholarとほぼ同等の機能を持っています。
バイオインフォマティクス・ハーベスター のようなキーワードベースのデータ集約サービスは、さまざまなサードパーティサーバーからレポートをそのままの形式で提供するため、ユーザーは個々のコンポーネントサービスごとにウェブサイトにアクセスしたり、ソフトウェアをインストールしたりする必要がありません。これは、さまざまな配列解析および操作ツールを提供するサイトが急速に出現していることを考えると、特に貴重です。別の集約型ウェブポータルであるヒトタンパク質参照データベース(Hprd)には、手動で注釈付けされ、キュレーションされたヒトタンパク質のエントリが含まれています。そのため、提供される情報は選択的かつ包括的であり、クエリ形式は柔軟で直感的です。手動でキュレーションされたデータベースを開発する利点としては、校正済みの資料を提示できることや、特定のタンパク質の責任を負う「分子権威」の概念があることが挙げられます。しかし、欠点としては、更新が一般的に遅く、非常に新しいデータや議論のあるデータが含まれていない可能性があることです。
一般的な配列プロファイリングツールは、実際のDNA、RNA、またはタンパク質配列を入力として使用することで、この機能をさらに拡張し、ユーザーがさまざまなWebベースの解析ツールにアクセスして必要な情報を取得できるようにします。このようなツールは、遺伝子シーケンサーなどの市販の実験機器に付属している場合や、分子生物学用のソフトウェアアプリケーションとして販売されている場合もあります。別の公開データベースの例として、NCBIのBLAST配列検索レポートは、アライメントレポートから、特定の情報が存在する場合、そのデータベース内の他の関連情報へのリンクを提供します。
例えば、ヒト配列を含む取得レコードには、ヒトゲノムマップ上のその位置に接続する個別のリンクが付きます。3D構造が解明された配列を含むレコードには、その構造データベースに接続するリンクが付きます。パブリックサービスツールであるSequeromeは、BLASTレポート全体を、制限酵素マップ、ヌクレオチド配列のオープンリーディングフレーム解析、二次構造予測など、配列操作において非常に特化したサービスを提供する多くのサードパーティサーバー/サイトにリンクします。このツールには、ユーザーが行った操作の研究ログを保持できるという利点があり、それを「メール」、「印刷」、「保存」機能を使用して簡単にアーカイブできます。このように、さまざまな研究ツールを使用して配列を研究し、プロジェクトを完了させるという一連の操作を、1つのブラウザインターフェース内で完了できます。したがって、将来の世代のシーケンスプロファイリングツールには、研究者とオンラインで協力してプロジェクトログや研究ツールを共有したり、シーケンス解析や実験結果に注釈を付けたり、シーケンスデータセットの処理をカスタマイズおよび自動化したりする機能が含まれるでしょう。InstaSeqは、ユーザーがシーケンスを直接入力してワールドワイドウェブ全体を検索できるGoogle搭載の検索ツールです。この独自の検索エンジンは、GenBankなどの特定のデータベースを検索するのとは対照的です。
その結果、ユーザーは世界中のほぼどこからでも、プライベートにホストされたドキュメントやあまり知られていないデータベースのページにアクセスしてしまう可能性があります。現状ではシーケンスベースのプロファイラはほとんど存在しませんが、膨大な量のシーケンスデータをポータルやドメイン間で相互処理する必要が生じた際には、その重要な役割が明らかになるでしょう。
遺伝子解析のためのバイオインフォマティクスツールの普及は、研究者が研究対象とする遺伝子や遺伝子セットを特定し分類する上で役立っています。しかし、実質的に類似した集計機能や解析機能を持つツールが多種多様であるため、新規ユーザーを混乱させ、使いこなすのを困難にさせる可能性もあります。集計ツールによって促進される分散化により、個々の研究グループは特定の種類のデータ解析専用のサーバーを維持し、その出力が他の研究者にとって関心のある遺伝子やタンパク質に関するより大規模なレポートに集約されることを期待できます。
マイクロアレイ実験、ツーハイブリッドスクリーニング、その他のハイスループット生物学的実験によって生成されるデータは膨大であり、手作業による解析は困難です。多様なタンパク質構造を迅速に解明することを目的とした構造ゲノミクス研究の取り組みは、配列データベースと構造データベースおよびポータルの統合の必要性を高めています。より包括的で使いやすい配列プロファイリング手法の開発に向けたこうした動きは、現在のゲノミクス研究者の間で活発な研究分野となっています。