バイオインフォマティクス では、分子配列 および構造データに対するアライメントフリーの配列解析 アプローチは、アライメントベースのアプローチに代わる選択肢を提供する。[ 1 ]
生物学的研究を通じて生成されるさまざまな種類のデータの分析の必要性が出現したことで、バイオインフォマティクス の分野が生まれました。[ 2 ] DNA 、RNA 、タンパク質 の分子配列と構造データ、遺伝子発現 プロファイルまたはマイクロアレイ データ、代謝経路 データは、バイオインフォマティクスで分析されている主要なタイプのデータの一部です。その中でも、次世代シーケンシング技術の出現により、配列データは指数関数的に増加しています。バイオインフォマティクスの起源以来、配列分析は、データベース検索、 ゲノム注釈 、比較ゲノミクス 、分子系統発生 、遺伝子予測 など幅広い用途を持つ主要な研究分野であり続けています。配列分析の先駆的なアプローチは、グローバルまたはローカル、ペアワイズまたは多重配列アライメントのいずれかの 配列アライメント に基づいていました。[ 3 ] [ 4 ] アライメントベースのアプローチは、研究対象の配列が密接に関連していて確実にアライメントできる場合には一般的に優れた結果をもたらしますが、配列が分岐している場合は、信頼できるアライメントが得られないため、配列アライメントの適用範囲は限られます。アライメントベースのアプローチのもう 1 つの制限は、計算が複雑で時間がかかるため、大規模な配列データを扱う場合には制限されることです。[ 5 ] 次世代シーケンス 技術の出現により、膨大なシーケンスデータが生成されました。このシーケンスデータのサイズは、アセンブリ、アノテーション、および比較研究において、アライメントベースのアルゴリズムに課題をもたらします。
アライメントフリー法 アライメントフリー法は、大きく5つのカテゴリに分類できます。a) k -mer /単語頻度に基づく方法、b) 共通部分文字列の長さに基づく方法、c) (スペース付き) 単語一致の数に基づく方法、d)マイクロアライメントに基づく方法、e) 情報理論 に基づく方法、f) グラフィカル表現に基づく方法。アライメントフリー法は、配列類似性検索[ 6 ] 、配列のクラスタリングと分類[ 7 ] 、そして最近では系統発生学[ 8 ] [ 9 ] (図1 )で使用されています。
アライメントフリーのアプローチを用いたこのような分子系統解析は、次世代系統ゲノミクス の一部であると言われています。[ 9 ] いくつかのレビュー記事では、配列解析におけるアライメントフリーの方法について詳細なレビューが提供されています。[ 1 ] [ 10 ] [ 11 ] [ 12 ] [ 13 ] [ 14 ] [ 15 ]
AFprojectは 、アライメントフリーの配列比較のためのソフトウェアツールをベンチマークおよび比較するための国際的な共同プロジェクトです。[ 16 ]
k -mer/単語頻度に基づく手法k -mer/単語頻度に基づく一般的な手法には、特徴頻度プロファイル(FFP) [ 17 ] [ 18 ] 、構成ベクトル(CV)[ 19 ] [ 20 ] 、リターン時間分布(RTD)[ 21 ] 、および周波数カオスゲーム表現(FCGR)[ 22 ]などがあります。
帰還時間分布(RTD)RTD ベースの手法では、配列中の k mer の数を計算するのではなく、 k mer が再び出現するのに必要な時間を計算します。この時間は、特定の k merが連続して出現する際の残基数を指します。したがって、配列中の各k merの出現はRTD の形式で計算され、平均 (μ) と標準偏差 (σ) という 2 つの統計パラメータを使用して要約されます。したがって、各配列は、 4 k 個 の RTD のμ とσ を含む2 ⋅ 4 k サイズの数値ベクトルの形式で表されます。配列間のペアワイズ距離は、ユークリッド距離尺度を使用して計算されます。このようにして得られた距離行列は、 近隣結合 法、UPGMA などのクラスタリングアルゴリズムを使用して系統樹を構築するために使用できます。最近のアプローチであるパターン抽出エントロピー取得 (PEER) は、k mer の長さを直接検出し、エントロピーを使用して出現間隔を要約します。
周波数カオスゲーム表現(FCGR)FCGR法は、ゲノム配列のスケールに依存しない表現を提供するカオスゲーム表現(CGR)技術から発展したものです。[ 25 ] CGRはグリッド線で分割でき、各グリッドの正方形は配列中の特定の長さのオリゴヌクレオチドの出現を示します。このようなCGRの表現は、周波数カオスゲーム表現(FCGR)と呼ばれます。これにより、各配列がFCGRで表現されます。配列のFCGR間のペアワイズ距離は、ピアソン距離、ハミング距離 、またはユークリッド距離を使用して計算できます。[ 26 ]
間隔を空けた単語の出現頻度 ほとんどのアライメントフリーアルゴリズムはシーケンスの単語構成を比較しますが、Spaced Words は、考慮位置と考慮しない位置のパターンを使用します。シーケンス内のスペース入りの単語の出現は、一致位置の文字のみによって定義され、考慮しない位置の文字は無視されます。このアプローチでは、入力シーケンス内の連続する単語の頻度を比較する代わりに、事前に定義されたパターンに従ってスペース入りの単語の頻度を比較します。事前定義されたパターンは、一致数の分散の分析 [ 27 ] 、複数のモデルでの最初の出現の確率[ 28 ] 、または期待される単語頻度と実際のアライメント距離の間のピアソン相関係数 [ 29 ]によって選択できることに注意してください。
共通部分文字列の長さに基づく手法 このカテゴリの手法は、2 つのシーケンス内の部分文字列の類似点と相違点を利用します。これらのアルゴリズムは、 コンピュータサイエンス における文字列処理に主に使用されていました。[ 30 ]
平均共通部分文字列 (ACS)このアプローチでは、選択された2つのシーケンス(長さがそれぞれn とm のシーケンスAとB )について、一方のシーケンス(A)のある位置から始まり、もう一方のシーケンス(B)の任意の位置で完全に一致する最長部分文字列 を特定します。このようにして、シーケンスAの異なる位置から始まり、シーケンスBのいくつかの位置に完全に一致する最長部分文字列の長さを計算します。これらの長さをすべて平均して、尺度を導き出します。L ( A 、 B ) {\displaystyle L(A,B)} 直感的に、L ( A 、 B ) {\displaystyle L(A,B)} 2 つの配列が似ているほど、L ( A 、 B ) {\displaystyle L(A,B)} 正規化されている[つまり]L ( A 、 B ) / ログ ( m ) {\displaystyle L(A,B)/\log(m)} ]。これは、配列間の類似度を示します。
距離尺度を導出するために、類似度尺度 の逆数を取り、そこから補正項 を差し引いて、d ( A 、 A ) {\displaystyle d(A,A)} ゼロになります。したがって
d ( A 、 B ) = [ ログ m L ( A 、 B ) ] − [ ログ n L ( A 、 A ) ] 。 {\displaystyle d(A,B)=\left[{\frac {\log m}{L(A,B)}}\right]-\left[{\frac {\log n}{L(A,A)}}\right].} この措置d ( A 、 B ) {\displaystyle d(A,B)} 対称ではないので、計算する必要があるd s ( A 、 B ) = d s ( B 、 A ) = ( d ( A 、 B ) + d ( B 、 A ) ) / 2 {\displaystyle d_{s}(A,B)=d_{s}(B,A)=(d(A,B)+d(B,A))/2} これにより、2 つの文字列 (A と B) 間の最終的な ACS 尺度が得られます。[ 31 ] 部分列/部分文字列の検索は、接尾辞木 を使用することで効率的に実行できます。[ 32 ] [ 33 ] [ 34 ]
突然変異距離(Kr)このアプローチはACSと密接に関連しており、ACSは最短の欠落部分文字列( shustring と呼ばれる)を使用して2つのDNA配列間のサイトあたりの置換数を計算する。[ 35 ]
(スペースを含む)単語の一致数に基づく方法
マッシュ これは、 MinHash ボトムスケッチ戦略を使用してマルチセットのJaccard インデックス を推定する非常に高速な方法です。k {\displaystyle k} 2 つの入力シーケンスの -mer。つまり、比率を推定します。 k {\displaystyle k} -mer は合計数に一致します k {\displaystyle k} 配列の-mer。これは、比較対象の配列間の進化距離を推定するために使用でき、配列が最後の共通祖先から進化して以来の配列位置あたりの置換数として測定されます。[ 37 ]
スロープツリー このアプローチでは、2 つのタンパク質配列間の距離値を、その数の減少に基づいて計算します。 k {\displaystyle k} -mer が一致する場合k {\displaystyle k} 増加する。[ 38 ]
スクマー Skmer は 、 未アセンブルのシーケンスリードから種間の距離を計算します。MASH と同様に、 Jaccard 指数を セットに使用します。k {\displaystyle k} 入力配列から-merを生成します。MASHとは対照的に、このプログラムはシーケンスカバレッジが低い場合でも正確であるため、 ゲノムスキミング に使用できます。[ 40 ]
マイクロアライメントに基づく手法 厳密に言えば、これらの方法はアライメントフリーで はありません。これらは、特定の定義済み位置で配列が一致することを要求する、単純なギャップフリーのマイクロアライメントを使用しています。ミスマッチが許容される マイクロアライメント の残りの位置でアライメントされた位置は、系統推定に使用されます。
共系統発生 この方法は、2 つの DNA 配列間で、両方の配列で 1 つの位置だけ離れたk -mer の一致のペアとして定義されるいわゆる構造を探索します。2 つの k -mer の一致は コンテキスト と呼ばれ、それらの間の位置はオブジェクトと呼ばれます。Co-phylog は、 オブジェクト の 2 つのヌクレオチドが異なる構造 の割合を、2 つの配列間の距離として定義します。このアプローチは、未アセンブルのシーケンス リードに適用できます。[ 41 ]
アンディ andi は、最大完全一致ワードによって挟まれたギャップのないローカルアライメントに基づいて、ゲノム配列間の系統発生距離を推定します。このようなワード一致は、サフィックス配列を使用して効率的に見つけることができます。完全一致ワード間のギャップのないアライメントは、ゲノム配列間の系統発生距離を推定するために使用されます。結果として得られる距離推定値は、位置あたり約 0.6 置換まで正確です。[ 42 ]
フィルタリングされたスペース入り単語一致(FSWM)FSWM は、いわゆるマッチ位置 とドントケア位置 を表す事前定義されたバイナリパターンP を使用します。入力 DNA 配列のペアに対して、P に関してスペースワードのマッチを検索します。つまり、 P のマッチ位置 で一致するヌクレオチドとドントケア位置 でのミスマッチの可能性のある、ギャップのない局所的なアライメントを検索します。偽の低スコアのスペースワードのマッチは破棄され、残りの相同なスペースワードのマッチのドントケア位置 で互いにアライメントされたヌクレオチドに基づいて、入力配列間の進化距離が推定されます。 [ 43 ] FSWM は、未アセンブルの NGS リードに基づいて距離を推定するように適応されており、このバージョンのプログラムはRead-SpaM と呼ばれています。[ 44 ]
プロトスパム Prot-SpaM(プロテオーム ベースのスペーシング ワードマッチ)は、部分的または全体の プロテオーム 配列に対するFSWMアルゴリズムの実装です。[ 45 ]
マルチスパ Multi-SpaM ( Multiple Spaced -word Matches ) は 、 FSWM のアイデアを複数の配列比較に拡張した、ゲノムベースの系統樹再構築のアプローチです。[ 46 ] 一致位置 と不注意位置 のバイナリパターンP が与えられると、プログラムはPブロック、つまり P の一致位置 で一致するヌクレオチドを持ち、不注意位置 でミスマッチの可能性がある、ギャップのないローカルな 4 方向アライメントを検索します。このような 4 方向アライメントは、入力ゲノム配列のセットからランダムにサンプリングされます。各 Pブロックについて、 RAxML を使用してルートなしツリートポロジが計算されます。[ 47 ] 次に、プログラムQuartet MaxCut を 使用して、これらのツリーからスーパーツリーを計算します。
情報理論は 、アライメント不要の配列解析および比較のための有効な手法を提供してきた。情報理論の既存の応用例としては、DNA、RNA、タンパク質の全体的および局所的な特性評価、ゲノムエントロピーの推定からモチーフおよび領域分類までが挙げられる。また、遺伝子マッピング 、次世代シーケンス 解析、メタゲノミクス においても有望視されている。[ 48 ]
塩基間相関(BBC)塩基対相関(BBC)は、以下の式を用いてゲノム配列を固有の16次元数値ベクトルに変換します。
T 私 j ( K ) = ∑ ℓ = 1 K P 私 j ( ℓ ) ⋅ ログ 2 ( P 私 j ( ℓ ) P 私 P j ) {\displaystyle T_{ij}(K)=\sum _{\ell =1}^{K}P_{ij}(\ell )\cdot \log _{2}\left({\frac {P_{ij}(\ell )}{P_{i}P_{j}}}\right)} のP 私 {\displaystyle P_{i}} そしてP j {\displaystyle P_{j}} は、ゲノム中の塩基i とj の確率を表します。P 私 j ( ℓ ) {\displaystyle P_{ij}(\ell )} は、ゲノム内で距離ℓにある塩基 i とj の確率を示します。パラメータK は 、塩基i とj 間の最大距離を示します。16 個のパラメータの値の変動は、ゲノムの内容と長さの変動を反映しています。[ 49 ] [ 50 ] [ 51 ]
IC-PIC(情報相関 と部分情報相関)に基づく方法は、DNA配列の基本相関特性を利用します。ICとPICは以下の式を用いて計算されます。
私 C ℓ = − 2 ∑ 私 P 私 ログ 2 P 私 + ∑ 私 j P 私 j ( ℓ ) ログ 2 P 私 j ( ℓ ) {\displaystyle IC_{\ell }=-2\sum _{i}P_{i}\log _{2}P_{i}+\sum _{ij}P_{ij}(\ell )\log _{2}P_{ij}(\ell )} P 私 C 私 j ( ℓ ) = ( P 私 j ( ℓ ) − P 私 P j ( ℓ ) ) 2 {\displaystyle PIC_{ij}(\ell )=(P_{ij}(\ell )-P_{i}P_{j}(\ell ))^{2}} 最終的なベクトルは次のようにして得られます。
V = 私 C ℓ P 私 C 私 j ( ℓ ) どこ ℓ ∈ { ℓ 0 、 ℓ 0 + 1 、 … 、 ℓ 0 + n } 、 {\displaystyle V={IC_{\ell } \over PIC_{ij}(\ell )}{\text{ where }}\ell \in \left\{\ell _{0},\ell _{0}+1,\ldots ,\ell _{0}+n\right\},} これは、ベース間の距離の範囲を定義する。[ 52 ]
配列間のペアワイズ距離は、ユークリッド距離 を用いて計算されます。このようにして得られた距離行列は、近隣結合法 やUPGMA 法などのクラスタリングアルゴリズムを用いて系統樹を構築するために使用できます。
コンテキストモデリング圧縮 複雑性のモデリングの文脈では、1 つ以上の統計モデルの次のシンボル予測が結合または競合して、過去に記録されたイベントに基づく予測が生成されます。各シンボル予測から得られるアルゴリズム情報コンテンツは、シーケンスの長さに比例する時間でアルゴリズム情報プロファイルを計算するために使用できます。このプロセスは、DNA 配列解析に適用されています。[ 58 ]
グラフィカル表現に基づく手法
反復マップ 反復マップを用いた配列解析は、1990年にHJ Jeffereyによって初めて導入されました[ 25 ]。 彼はゲノム配列を単位正方形 にマッピングするためにカオスゲーム を適用することを提案しました。このレポートでは、この手順をカオスゲーム表現(CGR)と名付けました。しかし、わずか3年後、このアプローチはN Goldmanによってマルコフ遷移表の投影として却下されました[ 59 ] 。この反論は、その10年の終わりまでに、CGRがマルコフ遷移をフラクタルで順序フリー(次数フリー)表現に一対一でマッピングすることが判明し、覆されました[ 60 ] 。反復マップが記号空間と数値空間の間の一対一マップを提供するという認識は、配列の比較と特徴付けのためのさまざまなアライメントフリーのアプローチの特定につながりました。これらの開発は、2013 年後半に JS Almeida によってレビューされました。[ 61 ] https://github.com/usm/usm.github.com/wiki、[ 62 ] のような多数の Web アプリケーションが利用可能で、クラウド コンピューティング 用に開発された最新のMapReduce 分散を最大限に活用する方法で任意の記号シーケンスをエンコードおよび比較する方法を示しています。
アライメントに基づく手法とアライメントを伴わない手法の比較
参考文献 1 2 Vinga S 、Almeida J (2003 年3 月 ) 。「アライメントフリーの配列比較 - レビュー」。Bioinformatics。19 (4): 513–523。doi : 10.1093/bioinformatics / btg005。PMID 12611807 。 ↑ Rothberg J、Merriman B、Higgs G (2012 年9 月 )。 「バイオインフォマティクス入門」 。 イェール 生物学・医学ジャーナル 。85 ( 3): 305–308。PMC 3447194。PMID 23189382 。 ↑ Batzoglou S (2005年3月) 「配列アライメントの多様な側面」 Briefings in Bioinformatics 6 ( 1): 6– 22. doi : 10.1093/bib/6.1.6 . PMID 15826353 . ↑ Mullan L (2006 年 3 月). 「ペアワイズ配列アライメント - それはすべて私たちのためのものです!」。 Briefings in Bioinformatics . 7 (1): 113–115 . doi : 10.1093/bib/bbk008 . PMID 16761368 . ↑ Kemena C 、Notredame C(2009 年10 月 )。 「ハイスループット時代における多重配列アライメント法の今後の課題」 。Bioinformatics。25 ( 19 ) : 2455–2465。doi : 10.1093 / bioinformatics/ btp452。PMC 2752613。PMID 19648142 。 ↑ Hide W、Burke J、Davison DB (1994)。「高性能配列比較アルゴリズムd2の生物学的評価」。Journal of Computational Biology。1 ( 3 ) : 199– 215。doi : 10.1089/cmb.1994.1.199。PMID 8790465 。 ↑ Miller RT、Christoffels AG、Gopalakrishnan C、Burke J、Ptitsyn AA、Broveak TR、Hide WA (1999 年 11 月)。 「 発現 ヒト 遺伝子 配列 のクラスタリングへの包括的なアプローチ:配列タグアライメントとコンセンサス知識ベース」 。Genome Research。9 ( 11 ): 1143–1155。doi : 10.1101 /gr.9.11.1143。PMC 310831。PMID 10568754 。 1 2 Domazet- Lošo M、Haubold B (2011 年 6 月 )。 「ウイルス および細菌ゲノム間 の局所 的 類似性のアライメントフリー検出」 。Bioinformatics。27 (11): 1466–1472。doi : 10.1093 /bioinformatics/ btr176。PMID 21471011 。 1 2 3 Chan CX、Ragan MA (2013 年 1 月)。 「 次世代 系統 ゲノミクス」 。Biology Direct。8 : 3。doi : 10.1186 / 1745-6150-8-3。PMC 3564786。PMID 23339707 。 ↑ Song K、Ren J、 Reinert G 、Deng M、Waterman MS、Sun F (2014 年 5 月)。 「 アライメントフリー配列比較 の 新たな展開: 測定、統計、次世代シーケンシング」 。Briefings in Bioinformatics。15 ( 3 ): 343–353。doi : 10.1093/ bib / bbt067。PMC 4017329。PMID 24064230 。 1 2 Haubold B (2014 年 5 月)。 「 アライメントフリーの系統発生学と集団遺伝学」 。Briefings in Bioinformatics。15 ( 3 ): 407–418。doi : 10.1093/bib / bbt083。PMID 24291823 。 ↑ Bonham-Carter O、Steele J、Bastola D (2014 年 11 月)。 「 アライメント不要の遺伝子配列比較:単語分析による最近 の アプローチ の レビュー」 。Briefings in Bioinformatics。15 ( 6): 890–905。doi : 10.1093/bib / bbt052。PMC 4296134。PMID 23904502 。 ↑ Zielezinski A、Vinga S 、 Almeida J、Karlowski WM (2017 年10 月 )。 「アライメントフリーの配列比較:利点、応用、およびツール」 。Genome Biology。18 ( 1 ) : 186。doi : 10.1186/ s13059-017-1319-7。PMC 5627421。PMID 28974235 。 1 2 Bernard G、Chan CX、Chan YB、Chua XY、Cong Y、Hogan JM、et al. (2019 年 3 月)。 「 階層的および網状 の系統ゲノム関係 の アライメントフリー推論」 。Briefings in Bioinformatics。20 ( 2 ): 426–435。doi : 10.1093/bib / bbx067。PMC 6433738。PMID 28673025 。 ↑ Ren J, Bai X, Lu YY, Tang K, Wang Y, Reinert G, Sun F (2018年7月). "アライメントフリー配列解析と応用" . Annual Review of Biomedical Data Science . 1 : 93– 114. arXiv : 1803.09727 . Bibcode : 2018arXiv180309727R . doi : 10.1146/annurev-biodatasci-080917-013431 . PMC 6905628 . PMID 31828235 . ↑ Zielezinski A、Girgis HZ、Bernard G、Leimeister CA、Tang K、Dencker T、et al . (2019年7月)。 「 アライメント フリー配列比較法のベンチマーク」 。Genome Biology。20 ( 1 ) : 144。doi : 10.1186/ s13059-019-1755-7。PMC 6659240。PMID 31345254 。 ↑ Sims GE、Jun SR、Wu GA、Kim SH (2009 年 10 月)。 「哺乳類の全ゲノム系統発生:遺伝子領域と非遺伝子領域の進化情報 」 。 米国 科学 アカデミー 紀要 。106 ( 40 ) : 17077–17082。Bibcode : 2009PNAS..10617077S。doi : 10.1073 / pnas.0909377106。PMC 2761373。PMID 19805074 。 ↑ Sims GE、Kim SH (2011 年 5 月)。 「 特徴頻度プロファイル (FFP) による大腸菌/赤痢菌群の全ゲノム系統発生」 。 米国 科学 アカデミー 紀要 。108 ( 20 ) : 8329–8334。Bibcode : 2011PNAS..108.8329S。doi : 10.1073 / pnas.1105168108。PMC 3100984。PMID 21536867 。 ↑ Gao L、Qi J(2007年3月) 「構成ベクター法を用いた大型dsDNAウイルスの全ゲノム分子系統解析」 BMC Evolutionary Biology 7 ( 1):41. Bibcode : 2007BMCEE...7...41G . doi : 10.1186/1471-2148-7-41 . PMC 1839080. PMID 17359548 . ↑ Wang H, Xu Z, Gao L, Hao B (2009年8月). "組成ベクトル法を用いた82 個 の完全ゲノムに基づく真菌の系統樹" . BMC Evolutionary Biology . 9 (1): 195. Bibcode : 2009BMCEE...9..195W . doi : 10.1186/1471-2148-9-195 . PMC 3087519. PMID 19664262 . 1 2 Kolekar P、Kale M、Kulkarni-Kale U (2012 年 11 月)。「配列解析のための戻り時間分布に基づくアライメントフリー距離尺度:クラスタリング、分子系統学、およびサブタイピングへの応用」。Molecular Phylogenetics and Evolution。65 ( 2 ) : 510–522。doi : 10.1016/ j.ympev.2012.07.003。PMID 22820020 。 ↑ Hatje K、Kollmar M (2012)。 「 アラインメントフリー配列比較法に基づくアブラナ目クレードの系統解析 」 。Frontiers in Plant Science。3 : 192。doi : 10.3389 / fpls.2012.00192。PMC 3429886。PMID 22952468 。 ↑ Apostolico A、Denas O (2008 年 10 月)。 「網羅的な部分文字列合成による 配列距離 を 計算 するための高速アルゴリズム」 。Algorithms for Molecular Biology。3 : 13。doi : 10.1186 / 1748-7188-3-13。PMC 2615014。PMID 18957094 。 ↑ Apostolico A、Denas O、Dress A ( 2010 年 9月)。「比較部分文字列解析のための効率的なツール」。Journal of Biotechnology。149 ( 3 ) : 120–126。doi : 10.1016/j.jbiotec.2010.05.006。PMID 20682467 。 1 2 Jeffrey HJ (1990 年 4 月) 「遺伝子構造のカオス ゲーム表現」 Nucleic Acids Research 18 ( 8): 2163– 2170. doi : 10.1093/nar/18.8.2163 . PMC 330698 . PMID 2336393 . ↑ Wang Y、 Hill K、 Singh S、Kari L ( 2005 年 2 月)。「ゲノムシグネチャ の スペクトル: ジヌクレオチドからカオスゲーム表現まで」 。Gene。346 : 173–185。doi : 10.1016 / j.gene.2004.10.021。PMID 15716010 。 ↑ Hahn L、Leimeister CA 、 Ounit R、Lonardi S、Morgenstern B (2016 年 10 月)。 「rasbhari: データベース検索、リードマッピング、アライメントフリーの配列比較のための間隔を空けたシード の 最適 化 」 。PLOS Computational Biology。12 ( 10 ) e1005107。arXiv : 1511.04001。Bibcode : 2016PLSCB..12E5107H。doi : 10.1371 / journal.pcbi.1005107。PMC 5070788。PMID 27760124 。 ↑ Noé L (Feb 14, 2017). "Best hits of 11110110111: model-free selection and parameter-free sensitivity calculation of spaced seeds". Algorithms for Molecular Biology . 12 (1): 1. doi :10.1186/s13015-017-0092-1 . PMC 5310094 . PMID 28289437. 1 2 Noé L, Martin DE (December 2014). "A coverage criterion for spaced seeds and its applications to support vector machine string kernels and k-mer distances". Journal of Computational Biology . 21 (12): 947– 963. arXiv :1412.2587 . Bibcode :2014arXiv1412.2587N. doi :10.1089/cmb.2014.0173. PMC 4253314 . PMID 25393923. ↑ Gusfield D (1997). Algorithms on strings, trees, and sequences: computer science and computational biology (Reprinted (with corr.) ed.). Cambridge [u.a.]: Cambridge Univ. Press. ISBN 978-0-521-58519-4 . ↑ Ulitsky I, Burstein D, Tuller T, Chor B (March 2006). "The average common substring approach to phylogenomic reconstruction". Journal of Computational Biology . 13 (2): 336– 350. CiteSeerX 10.1.1.106.5122 . doi :10.1089/cmb.2006.13.336. PMID 16597244. ↑ Weiner P (1973). "Linear pattern matching algorithms". 14th Annual Symposium on Switching and Automata Theory (swat 1973) . pp. 1– 11. CiteSeerX 10.1.1.474.9582 . doi :10.1109/SWAT.1973.13. ↑ He D (2006). "Using suffix tree to discover complex repetitive patterns in DNA sequences". 2006 International Conference of the IEEE Engineering in Medicine and Biology Society . Vol. 1. pp. 3474– 7. doi :10.1109/IEMBS.2006.260445. ISBN 978-1-4244-0032-4 . PMID 17945779. S2CID 5953866. ↑ Välimäki N、Gerlach W 、 Dixit K、Mäkinen V (2007 年 3 月)。 「圧縮サフィックスツリー - ゲノム規模 の 配列解析 の基礎」 。Bioinformatics。23 ( 5): 629–630。doi : 10.1093/bioinformatics/ btl681。PMID 17237063 。 ↑ Haubold B、Pfaffelhuber P、Domazet-Loso M、Wiehe T (2009 年 10 月)。「アラインメントされていないゲノムからの突然変異距離の推定」。Journal of Computational Biology。16 ( 10): 1487–1500。doi : 10.1089 / cmb.2009.0106。hdl : 11858 / 00-001M-0000-000F-D624- D。PMID 19803738 。 ↑ Reinert G、Chew D、Sun F 、Waterman MS (2009 年 12 月)。 「 アライメント フリー配列比較 (I): 統計と検出力」 。Journal of Computational Biology。16 ( 12): 1615–1634。doi : 10.1089 / cmb.2009.0198。PMC 2818754。PMID 20001252 。 ↑ Ondov BD、Treangen TJ 、 Melsted P、Mallonee AB、Bergman NH、Koren S、Phillippy AM (2016年6月)。 「 Mash : MinHashを使用した高速ゲノムおよびメタゲノム距離推定」 。Genome Biology。17 ( 1): 132。doi : 10.1186 /s13059-016-0997- x。PMC 4915045。PMID 27323842 。 ↑ Bromberg R、Grishin NV、Otwinowski Z (2016年6月)。 「 水平 遺伝子伝達を補正 する アライメントフリー法による系統樹再構築」 。PLOS Computational Biology。12 ( 6 ) e1004985。Bibcode : 2016PLSCB..12E4985B。doi : 10.1371/ journal.pcbi.1004985。PMC 4918981。PMID 27336403 。 ↑ Röhling S、Linne A、Schellhorn J、Hosseini M、Dencker T、Morgenstern B (2020)。 「k の関数としての 2 つ の DNA 配列間の k-mer 一致の数と系統距離の推定への応用」 。PLOS ONE。15 ( 2 ) e0228070。Bibcode : 2020PLoSO..1528070R。doi : 10.1371 / journal.pone.0228070。PMC 7010260。PMID 32040534 。 ↑ Sarmashghi S、 Bohmann K 、 P Gilbert MT、Bafna V、Mirarab S (2019年2月)。 「Skmer: ゲノムスキムを使用したアセンブリフリーおよびアライメントフリーのサンプル識別」 。Genome Biology。20 ( 1 ) : 34。doi : 10.1186 /s13059-019-1632-4。PMC 6374904。PMID 30760303 。 ↑ Yi H、Jin L(2013年4月)。 「Co - phylog:近縁生物 の ためのアセンブリ不要の系統ゲノムアプローチ」 。Nucleic Acids Research。41 ( 7 ):e75。doi : 10.1093/nar / gkt003。PMC 3627563。PMID 23335788 。 ↑ Haubold B 、 Klötzl F、Pfaffelhuber P (2015 年4 月 )。 「andi: 近縁ゲノム間の進化距離を高速かつ正確に推定する」 。Bioinformatics。31 ( 8 ): 1169–1175。doi : 10.1093/bioinformatics / btu815。PMID 25504847 。 ↑ Leimeister CA、Sohrabi - Jahromi S 、 Morgenstern B (2017年4月)。 「 フィルタリング されたスペース付き単語の一致を使用した高速かつ正確な系統樹再構築」 。Bioinformatics。33 ( 7 ) : 971–979。doi : 10.1093 /bioinformatics/ btw776。PMC 5409309。PMID 28073754 。 ↑ Lau AK 、 Dörrer S 、Leimeister CA、Bleidorn C、Morgenstern B (2019 年 12 月)。 「 Read-SpaM: 低シーケンス カバレッジの細菌 ゲノム の アセンブリフリーおよびアライメントフリー比較」 。BMC Bioinformatics。20 (Suppl 20): 638。doi : 10.1186 / s12859-019-3205-7。PMC 6916211。PMID 31842735 。 ↑ Leimeister CA、Schellhorn J、Dörrer S、Gerth M、Bleidorn C、Morgenstern B (2019年3月)。 「 Prot - SpaM:全プロテオーム配列に基づく高速アライメントフリー系統樹再構築」 。GigaScience。8 ( 3) giy148。doi : 10.1093 / gigascience / giy148。PMC 6436989。PMID 30535314 。 ↑ Dencker T、Leimeister CA、Gerth M、Bleidorn C、Snir S、Morgenstern B(2020年3月) 。 「Multi-SpaM」:複数のスペース付き単語 の一致とカルテット ツリーを使用した系統樹再構築への最尤法アプローチ。NAR Genomics and Bioinformatics。2 ( 1)lqz013。doi :10.1093 /nargab/ lqz013。PMC 7671388。PMID 33575565 。 ↑ Stamatakis A (2006年11月). "RAxML-VI-HPC: 数千の分類群と混合モデルを用いた最尤法に基づく系統解析" . Bioinformatics . 22 (21): 2688– 2690. doi : 10.1093/bioinformatics/btl446 . PMID 16928733 . ↑ Vinga S (2014 年 5 月) 「生物学的配列解析のための情報理論の応用」 Briefings in Bioinformatics 15 ( 3): 376–389 . doi : 10.1093/bib/bbt068 . PMC 7109941 . PMID 24058049 . ↑ Liu Z、Meng J、Sun X (2008 年 4 月)。「アライメントなしの全ゲノム系統解析のための新しい特徴ベースの方法: HEV の遺伝子型判定とサブタイプ判定への応用」。Biochemical and Biophysical Research Communications。368 ( 2 ): 223– 230。doi : 10.1016/j.bbrc.2008.01.070。PMID 18230342 。 ↑ Liu ZH 、Sun X (2008)。「塩基対相関に基づくコロナウイルスの系統発生」。International Journal of Bioinformatics Research and Applications。4 ( 2 ): 211– 220。doi : 10.1504/ijbra.2008.018347。PMID 18490264 。 ↑ Cheng J, Zeng X, Ren G, Liu Z (2013年3月). "CGAP: 葉緑体ゲノムの比較解析のための新しい包括的なプラットフォーム" . BMC Bioinformatics . 14 : 95. doi : 10.1186/1471-2105-14-95 . PMC 3636126 . PMID 23496817 . ↑ Gao Y、Luo L(2012年1 月 )。 「 新規アライメントフリー法によるdsDNAウイルスのゲノムベースの系統解析」。Gene。492 ( 1 ) : 309–314。doi : 10.1016 / j.gene.2011.11.004。PMID 22100880 。 ↑ Bennett, CH、Gacs, P.、Li, M.、Vitanyi, P.、Zurek, W.、「情報距離」、IEEE Trans. Inform. Theory、44、1407--1423 ↑ Li, M., Badger, JH, Chen, X., Kwong, S., Kearney, P. and Zhang, H., (2001) 情報に基づく配列距離とそのミトコンドリアゲノム全体の系統解析への応用。Bioinformatics, 17:(2001), 149--154 ↑ M. Li、X. Chen、X. Li、B. Ma、PMB Vitanyi。「類似度メトリック」、IEEE Trans. Inform. Th.、50:12(2004)、3250--3264 ↑ RL Cilibrasi および PMB Vitanyi、圧縮によるクラスタリング、IEEE Trans。情報を提供します。木曜日、51:4(2005)、1523--1545 ↑ Otu HH、Sayood K (2003 年11 月 )。 「系統樹構築 の ための新しい配列距離尺度」 。Bioinformatics。19 ( 16 ) : 2122–2130。doi : 10.1093 /bioinformatics/ btg295。PMID 14594718 。 ↑ ピニョ AJ、ガルシア SP、プラタス D、フェレイラ PJ (2013 年 11 月 21 日)。 「一目でわかる DNA 配列」 。 プロスワン 。 8 (11) e79922。 Bibcode : 2013PLoSO...879922P 。 土井 : 10.1371/journal.pone.0079922 。 PMC 3836782 。 PMID 24278218 。 ↑ Goldman N (1993 年 5 月) 「ヌクレオチド、ジヌクレオチド、トリヌクレオチドの頻度は、DNA 配列のカオス ゲーム表現で観察されるパターンを説明する」 . Nucleic Acids Research . 21 (10): 2487–2491 . doi : 10.1093/nar/ 21.10.2487 . PMC 309551. PMID 8506142 . ↑ Almeida JS、Carriço JA 、 Maretzek A、Noble PA、Fletcher M (2001 年5 月 )。 「 カオス ゲーム表現によるゲノム配列 の解析」 。Bioinformatics。17 ( 5 ): 429–437。doi : 10.1093/bioinformatics/17.5.429。PMID 11331237 。 ↑ Almeida JS (2014 年 5 月) 「反復マップによる配列解析、レビュー」 . Briefings in Bioinformatics . 15 (3): 369– 375. doi : 10.1093/bib/bbt072 . PMC 4017330 . PMID 24162172 . ↑ Almeida JS、 Grüneberg A 、 Maass W、Vinga S (2012 年 5 月)。 「 配列アライメントのフラクタル MapReduce 分解」 。Algorithms for Molecular Biology。7 ( 1 ): 12。doi : 10.1186/1748-7188-7-12。PMC 3394223。PMID 22551205 。 ↑ Vinga S 、 Carvalho AM、Francisco AP、Russo LM、Almeida JS (2012 年 5 月)。 「カオス ゲーム表現によるパターン マッチング: 生物学的配列解析のための数値データ構造と離散データ構造の橋渡し」 。Algorithms for Molecular Biology。7 ( 1 ) : 10。doi : 10.1186 /1748-7188-7-10。PMC 3402988。PMID 22551152 。 ↑ Bernard G、Greenfield P、Ragan MA、Chan CX (2018年11月20日)。 「 k - mer 類似 性、微生物 ゲノム のネットワーク、および分類学的ランク」 。mSystems。3 ( 6 ) : e00257–18。doi : 10.1128/mSystems.00257-18。PMC 6247013。PMID 30505941 。 1 2 Song K、Ren J、Reinert G、Deng M、Waterman MS、Sun F (2014 年 5 月)。 「 アライメントフリー配列比較 の 新たな展開: 測定、統計、次世代シーケンシング」 。Briefings in Bioinformatics。15 ( 3 ): 343–353。doi : 10.1093/ bib / bbt067。PMC 4017329。PMID 24064230 。 ↑ Břinda K 、Sykulski M 、Kucherov G (2015 年11 月 )。「間隔を空けたシードはk-merベースのメタゲノム分類を改善する 」 。Bioinformatics。31 ( 22 ) : 3584–3592。arXiv : 1502.06256。Bibcode : 2015Bioin..31.3584B。doi : 10.1093 / bioinformatics / btv419。PMID 26209798。S2CID 8626694 。 ↑ Ounit R、Lonardi S (2016 年 12 月)。 「 CLARK -S による短いメタゲノムリードの分類感度の向上」 。Bioinformatics。32 ( 24 ): 3823–3825。doi : 10.1093/bioinformatics / btw542。PMID 27540266 。 ↑ Pinello L、Lo Bosco G、Yuan GC (2014 年5 月 )。 「エピゲノミクスにおけるアライメントフリー法 の 応用」 。Briefings in Bioinformatics。15 ( 3): 419–430。doi : 10.1093/ bib / bbt078。PMC 4017331。PMID 24197932 。 ↑ La Rosa M、Fiannaca A、Rizzo R、Urso A (2013)。 「圧縮ベース の 手法によるバーコード配列のアライメントフリー解析」 。BMC Bioinformatics。14 ( Suppl 7): S4。doi : 10.1186 / 1471-2105-14-S7- S4。PMC 3633054。PMID 23815444 。 ↑ Kolekar P、Hake N、Kale M、Kulkarni-Kale U (2014 年 3 月)。 「WNV Typer : 戻り時間分布に基づくアライメントフリー法を用いたウエストナイルウイルスの遺伝子型判定用サーバー 」 。Journal of Virological Methods。198 : 41–55。doi : 10.1016 / j.jviromet.2013.12.012。PMID 24388930 。 ↑ Struck D、Lawyer G、Ternes AM、Schmit JC、Bercoff DP (2014 年 10 月)。 「 COMET : 超高速 HIV-1 サブタイプ識別 のための適応型コンテキストベースモデリング」 。Nucleic Acids Research。42 ( 18 ): e144。doi : 10.1093 /nar/ gku739。PMC 4191385。PMID 25120265 。 ↑ Dimitrov I、Naneva L 、 Doytchinova I 、 Bangov I (2014 年3 月 )。 「AllergenFP:記述子フィンガープリントによるアレルゲン性予測」 。Bioinformatics。30 (6): 846– 851。doi : 10.1093/bioinformatics/ btt619。PMID 24167156 。 ↑ Gardner SN、Hall BG (2013年12月9日) 「全ゲノムアライメントが機能しない場合:数百の微生物ゲノムのアライメント不要のSNP発見と系統解析のためのkSNP v2ソフトウェア」 PLOS ONE 8 ( 12) e81760. Bibcode : 2013PLoSO...881760G . doi : 10.1371/journal.pone.0081760 . PMC 3857212 . PMID 24349125 . ↑ Haubold B、 Krause L 、 Horn T、Pfaffelhuber P (2013 年12 月 ) 。 「 組換えのアライメントフリーテスト」 。Bioinformatics。29 ( 24 ): 3121–3127。doi : 10.1093/bioinformatics / btt550。PMC 5994939。PMID 24064419 。