ハイスループットシーケンス技術の発展により、ゲノムシーケンスのコストは劇的に低下し、ゲノムデータは驚異的な速さで蓄積されるようになりました。これらの技術は、1000ゲノムプロジェクトや1001ゲノムプロジェクト(シロイヌナズナ)といった野心的なゲノムシーケンスプロジェクトを可能にしています。膨大な量のゲノムデータの保存と転送は主要な課題となり、ゲノムデータ専用の高性能圧縮ツールの開発を促しています。ゲノム再シーケンスデータの保存と管理のための新しいアルゴリズムとツールの開発に対する最近の関心の高まりは、ゲノムデータ圧縮のための効率的な手法に対する需要の高まりを浮き彫りにしています。
標準的なデータ圧縮ツール(zipやrarなど)は、配列データ(GenBankフラットファイルデータベースなど)の圧縮に使用されていますが、ゲノム配列には反復コンテンツ(マイクロサテライト配列など)が含まれていることが多く、また多くの配列が高いレベルの類似性を示す(同じ種の複数のゲノム配列など)ため、この方法は過剰であると批判されています。さらに、ゲノム配列の統計的および情報理論的特性は、シーケンスデータの圧縮に利用できる可能性があります。[ 1 ] [ 2 ] [ 3 ]

参照テンプレートが利用可能であれば、差異(例えば、一塩基置換や挿入/欠失)のみを記録すればよく、保存する情報量を大幅に削減できます。相対圧縮の概念は、個々のゲノムの変異を発見することを目的とするゲノム再シーケンスプロジェクトでは特に明らかです。dbSNPなどの参照一塩基多型( SNP )マップを使用することで、保存する変異の数をさらに改善できます。[ 4 ]
もう1つの便利なアイデアは、絶対座標の代わりに相対ゲノム座標を保存することです。[ 4 ]例えば、配列バリアント塩基を「Position1Base1Position2Base2…」の形式で表すと、「123C125T130G」は「0C2T5G」に短縮できます。ここで、整数はバリアント間の間隔を表します。コストは、絶対座標を復元するために必要なわずかな算術計算と、補正係数(この例では「123」)の保存です。
ゲノム配列のプールにおける置換の可能なすべての位置が事前にわかっている場合は、さらに削減できます。[ 4 ]例えば、ヒト集団におけるSNPのすべての位置がわかっている場合、変異座標情報を記録する必要がありません(例:「123C125T130G」は「CTG」に短縮できます)。ただし、このような情報は通常不完全または入手できないため、このアプローチはめったに適切ではありません。
エンコーディング方式は、座標整数をバイナリ形式に変換して圧縮率を向上させるために使用されます。ゴロム符号やハフマン符号などのエンコーディング設計は、ゲノムデータ圧縮ツールに組み込まれています。[ 5 ] [ 6 ] [ 7 ] [ 8 ] [ 9 ] [ 10 ]もちろん、エンコーディング方式には、それに伴う復号アルゴリズムが必要です。復号方式の選択は、配列情報の検索効率に影響を与える可能性があります。
ゲノムデータの圧縮において、普遍的なアプローチが必ずしも最適とは限らない。特定の目的や目標には、より適した方法が存在する可能性があるからだ。したがって、圧縮性能に影響を与える可能性のあるいくつかの設計上の選択肢を検討することが重要となる。
相対圧縮のための参照配列の選択は、圧縮性能に影響を与える可能性があります。より具体的な参照配列(例えば、改訂版ケンブリッジ参照配列)よりもコンセンサス参照配列を選択すると、コンセンサス参照にはデータにバイアスが少ない可能性があるため、圧縮率が高くなる可能性があります。[ 4 ]ただし、圧縮される配列のソースに関する知識は、より大きな圧縮利得を達成するために活用できます。複数の参照配列を使用するというアイデアが提案されています。[ 4 ] Brandon ら (2009) [ 4 ] は、ミトコンドリア DNA変異データの圧縮を例として、民族グループ固有の参照配列テンプレートを使用する可能性を示唆しました(図 2 を参照)。著者らは、改訂版ケンブリッジ参照配列と比較して、アフリカ人、アジア人、ユーラシア人のミトコンドリア DNA配列に偏ったハプロタイプ分布があることを発見しました。彼らの結果は、民族的に遠い個人のデータに対して使用する場合、より多くの変異を保存する必要があるため、改訂版ケンブリッジ参照配列が常に最適とは限らないことを示唆しています。さらに、参照シーケンスは統計的特性に基づいて設計することも[ 1 ] [ 4 ] 、圧縮率を向上させるために設計することもできる[ 11 ] [ 12 ] 。
変異塩基とゲノム座標を符号化するために、さまざまな種類の符号化方式の適用が検討されてきた。[ 4 ]ゴロム符号やライス符号などの固定符号は、変異または座標(整数として表現される)の分布が明確に定義されている場合に適している。ハフマン符号などの可変符号は、基となる変異および/または座標の分布が明確に定義されていない場合(これは通常、ゲノム配列データの場合である)、より一般的なエントロピー符号化方式を提供する。
現在利用可能なゲノムデータ圧縮ツールの圧縮率は、ヒトゲノムの場合、65 倍から 1,200 倍の範囲です。[ 4 ] [ 5 ] [ 6 ] [ 7 ] [ 8 ] [ 9 ] [ 10 ] [ 13 ]同じゲノムの非常に近いバリアントまたは改訂版は非常に効率的に圧縮できます (たとえば、99.999% 同一である同じ A. thaliana ゲノムの 2 つの改訂版で 18,133 の圧縮率が報告されています[ 6 ] )。ただし、このような圧縮は、同じ生物の異なるゲノム (個体) の典型的な圧縮率を示すものではありません。これらのツールの中で最も一般的なエンコーディング方式は、ロスレスデータ圧縮に使用されるハフマン符号化です。