Chloroplotを使用して作成したPorphyra umbilicalis 葉緑体 ゲノム注釈 ( GenBank アクセッション番号: MF385003.1 )の可視化。[ 1 ] 中央の黒い円には、遺伝子の数、ゲノムの長さ、およびGC 含量 が示されています。外側の灰色の円は、ゲノムの各セクションの GC 含量を示しています。すべての個々の遺伝子は、ゲノム内の位置、転写 方向、および長さに従って最も外側の円に配置され、それらが属する細胞機能または構成要素に基づいて色分けされています。矢印で表された内側の遺伝子と外側の遺伝子の転写方向は、それぞれ時計回りと反時計回りにリストされています。 分子生物学 および遺伝学 において、DNAアノテーション またはゲノムアノテーションとは、 ゲノム の構成要素の構造と機能を記述するプロセスであり、[ 2 ] それらを分析および解釈して生物学的意義を抽出し、それらが関与する生物学的プロセスを理解するものです。[ 3 ] 特に、ゲノム内の遺伝子 およびすべてのコード領域の位置を特定し、それらの遺伝子が何をするかを決定します。 [ 4 ]
アノテーションはゲノムの配列決定 とアセンブリの 後に行われ、配列がデータベース に登録され、論文で記述される前にゲノム解析において必要なステップです。個々の遺伝子とその産物または機能を記述することは、この記述をアノテーションとみなすのに十分ですが、文献で報告されているさまざまなゲノムの解析の深さは大きく異なり、単純なアノテーションを超える追加情報を含む報告もあります。[ 5 ] さらに、配列決定されたゲノムのサイズと複雑さのため、DNAアノテーションは手動では行われず、代わりに計算手段によって自動化されています。しかし、得られた結果から導き出される結論は、専門家による手動分析を必要とします。[ 6 ]
DNAアノテーションは、ゲノム内の要素を識別して区別する構造アノテーション と、これらの要素に機能を割り当てる機能アノテーションの2つのカテゴリに分類されます。 [ 7 ]これは分類方法の1つではなく、次元ベース [ 8 ] やレベルベース分類[ 3 ] など、いくつかの代替案も提案されています。
構造アノテーション 構造ゲノムアノテーションパイプラインの一般的なフローチャート。まず、反復配列ライブラリを使用して、アセンブルされた ゲノム の反復領域 をマスクします。次に、必要に応じて、マスクされた配列を、アノテーション対象生物の利用可能なすべての証拠( EST 、RNA 、タンパク質)とアラインメントします。 真核生物 ゲノムでは、スプライス部位を 特定する必要があります。最後に、既知のDNA、RNA、タンパク質配列のデータベース、およびその他の補助情報を使用して、ゲノムに含まれるコード配列 と非コード配列を予測します。 構造アノテーションは、オープンリーディングフレーム (ORF)、コーディング配列 (CDS)、エクソン 、イントロン 、反復 配列、スプライス部位 、調節モチーフ 、開始 コドンと終止 コドン 、プロモーター など、ゲノム内のさまざまな要素の正確な位置を記述します。[ 6 ] [ 23 ] 構造アノテーションの主な手順は次のとおりです。
識別とマスキングを繰り返す。 証拠の整合性(任意)。 スプライス部位の識別(真核生物のみ)。 特徴予測(コーディング配列および非コーディング配列)。
繰り返し識別とマスキング 構造アノテーションの最初のステップは、低複雑性配列(AGAGAGAG や TTTTTTTTT のようなモノポリマーセグメントなど)やトランスポゾン (ゲノム全体に複数のコピーを持つより大きな要素)を含む反復配列の識別とマスキングです。 [ 2 ] [ 24 ] 反復配列は、原核生物と真核生物のゲノムの両方の主要な構成要素です。たとえば、原核生物のゲノムの 0% から 42% 以上が反復配列で構成されており[ 25 ] 、ヒトゲノム の 4 分の 3 は反復要素で構成されています。[ 26 ]
反復配列の特定は、主に 2 つの理由から困難です。1 つは保存性が低く、境界が明確に定義されていないことです。このため、対象となるゲノムの反復配列ライブラリを構築する必要があり、これは次のいずれかの方法で実行できます。[ 24 ] [ 27 ]
デノボ 法。反復配列は、自己ゲノム比較において配列保存 の最小閾値を超える類似性を持つ異なる位置の配列ペアを検出してグループ化することによって特定されるため、反復構造や配列に関する事前情報は必要ありません。これらの方法の欠点は、トランスポゾンだけでなくあらゆる反復配列を特定でき、保存されたコーディング配列 (CDS)が含まれる可能性があるため、これらの配列を除去するために慎重な後処理が不可欠なステップとなることです。また、時間の経過とともに劣化してきた関連領域が除外されたり、進化の歴史において関連性のない要素がグループ化されたりする可能性もあります。 [ 28 ] 相同性に基づく方法 。反復配列は、厳選されたデータベースに保存されている既知の反復配列との類似性(相同性)に基づいて同定されます。これらの方法は、 de novo 法と比較して、たとえ少量であっても実際のトランスポゾンを発見できる可能性が高くなりますが、既に同定されているファミリーに偏りがあります。構造に基づく手法 。反復配列は、反復回数や類似性ではなく、その構造モデルに基づいて識別されます。相同性に基づく手法と同様に、実際のトランスポゾンを識別することが可能ですが、既知の要素によるバイアスを受けません。ただし、各反復配列の種類に非常に特異性が高いため、汎用性は低くなります。比較ゲノム解析法 。反復配列は、大きな挿入領域によって生成される 多重配列アライメント において、1つ以上の配列が分断された部分として同定される。この手法は、他の手法に存在する境界が不明確な問題を回避できるものの、アセンブリの品質と対象ゲノムにおけるトランスポゾンの活性レベルに大きく依存する。ゲノム内の反復領域が特定された後、それらはマスキングされます。マスキングとは、 ヌクレオチド の文字(A、C、G、またはT)を他の文字に置き換えることを意味します。そうすることで、これらの領域は反復領域としてマークされ、下流の解析ではそれに応じて処理されます。反復領域は、マスキングしないとパフォーマンスの問題を引き起こす可能性があり、遺伝子アノテーションの誤った証拠を生み出す可能性さえあります(たとえば、トランスポゾン内のオープンリーディングフレーム(ORF)を エクソン として扱うなど)[ 24 ]。 置換に使用される文字に応じて、マスキングはソフトマスキングまたはハードマスキングに分類できます。ソフトマスキング では、反復領域は小文字(a、c、g、またはt)で示されますが、ハードマスキングでは、これらの領域の文字はNに置き換えられます。このようにして、たとえば、ソフトマスキングは単語の一致を除外し、これらの領域での アライメントの 開始を回避するために使用でき、ハードマスキングは、これらすべてに加えて、マスキングされた領域をアライメントスコアから除外することもできます。[ 29 ] [ 30 ]
特徴予測 ゲノムはコーディング 領域と非コーディング 領域に分けられ、構造アノテーションの最終段階は、ゲノム内のこれらの特徴を識別することです。実際、ゲノムアノテーションの主なタスクは遺伝子予測 であり、そのため、この目的のために多数の方法が開発されてきました。[ 19 ] 遺伝子予測は誤解を招く用語です。ほとんどの遺伝子予測ツールはコーディング配列(CDS)のみを識別し、 非翻訳領域 (UTR)を報告しないためです。このため、CDS予測がより正確な用語として提案されています。[ 24 ] CDS予測ツールは、センサー と呼ばれる方法によってゲノムの特徴を検出します。センサーには、プロモーター やポリAサイト などの機能部位シグナルを識別するシグナルセンサー と、DNA配列をコーディングコンテンツと非コーディングコンテンツに分類するコンテンツセンサーが含まれます。 [ 37 ] 原核生物のCDS予測ツールは主に 開始 コドンと終止 コドン の間のDNAセグメントであるオープンリーディングフレーム (ORF)を扱いますが、真核生物の CDS予測ツールは、真核生物の遺伝子の複雑な構成のために、より困難な問題に直面しています。[ 3 ] CDS予測方法は大きく3つのカテゴリーに分類できます。[ 2 ] [ 31 ]
アブイニシオ 法 (統計的、内在的、またはデノボとも呼ばれる)。CDS予測は、DNA配列から抽出できる情報のみに基づいている。これらの方法は、隠れマルコフモデル (HMM)などの統計的手法に依存している。一部の手法では、2つ以上のゲノムを使用して、ゲノムに沿った局所的な突然変異率とパターンを推測する。 [ 38 ] 相同性に基づく手法(経験的、証拠駆動型、または外因的とも呼ばれる)。CDS予測は、既知の配列との類似性に基づいて行われます。具体的には、解析対象の配列を、 発現配列タグ (EST)、相補的DNA (cDNA)、またはタンパク質 配列とアライメントします。コンバイナー 。CDS予測は、上記2つの方法を組み合わせて行われます。
機能アノテーション 機能アノテーションは、構造アノテーションによって見つかったゲノム要素に、細胞周期 、細胞死 、発生 、代謝 などの生物学的プロセスと関連付けることで機能を割り当てます。 [ 7 ] また、誤ってアノテーションされた可能性のある要素を特定することで 、 追加の品質チェックとしても使用できます。[ 2 ]
コーディングシーケンス機能予測 QuickGOから取得した、有向非巡回グラフとして構成された Gene Ontology (GO) 祖先チャートの例。[ 39 ] これは、細胞外マトリックス の構成要素であるマトリリン複合 体が関与する分子機能、生物学的プロセス、および細胞構成要素を示しています。各ボックスは、3 つの GO カテゴリのいずれかに属するオントロジー用語であり、それぞれ色分けされています。オントロジー用語は、異なる種類の矢印で表される特定の修飾語 (「is a」、「part of」など) を介して互いに関連付けられています。 遺伝子の機能アノテーションには、予測される機能的特徴に名前を付けるための統制語彙(またはオントロジー)が必要です。しかし、遺伝子機能を定義する方法は多数あるため、異なる研究グループによってアノテーションプロセスが実行されると、プロセスが妨げられる可能性があります。そのため、標準化された統制語彙を使用する必要があり、その中で最も包括的なのがGene Ontology (GO)です。GOは、機能特性を3つのカテゴリ(分子機能、生物学的プロセス、細胞構成要素)のいずれかに分類し、それらを有向非巡回グラフ に整理します。このグラフでは、各ノードが特定の機能であり、2つのノード間の各エッジ(または矢印)は、親子関係またはサブカテゴリ-カテゴリ関係を示します。[ 40 ] [ 41 ] 2020年現在、GOは遺伝子の機能アノテーションで最も広く使用されている統制語彙であり、MIPS Functional Catalog(FunCat)がそれに続きます。[ 42 ]
機能アノテーションの従来の方法には、局所アラインメント 検索ツールに依存する相同性 に基づくものがあります。[ 40 ] その前提は、2 つのゲノム要素間の配列保存性が高いということは、その機能も保存されていることを意味するということです。パラロジー 、オルソロジー 、またはゼノロジー によって出現した相同配列のペアは、通常、同様の機能を果たします。ただし、オルソロジー配列は、次の 2 つの理由から慎重に扱う必要があります。(1) 最初にアノテーションされた時期によって名前が異なる可能性があること、(2) 2 つの異なる生物で同じ機能的役割を果たさない可能性があること。アノテーターは、パラロジー、オルソロジー、またはゼノロジーが見つからなかった場合、類似配列を参照することがよくあります。 [ 19 ] 相同性に基づく方法には、データベースのエラー、感度/特異性の低さ、パラロジーと相同性を区別できないこと、[ 43 ] 低複雑性領域の存在による人為的に高いスコア、およびタンパク質ファミリー内の大きな変動など、いくつかの欠点があります。[ 44 ]
機能アノテーションは確率的手法によって実行できます。親水性アミノ酸 と疎水性 アミノ酸 の分布は、タンパク質が溶液中にあるか膜中にあるかを示します。特定の配列モチーフは、 翻訳後修飾 と特定のタンパク質の最終的な位置に関する情報を提供します。 [ 19 ] 確率的手法は、GOなどの統制語彙と組み合わせることができます。たとえば、タンパク質間相互作用 (PPI)ネットワークでは、通常、類似の機能を持つタンパク質が互いに近くに配置されます。[ 45 ]
機械学習 法は、GO用語に基づいて新規タンパク質の機能アノテーションを生成するためにも使用されます。一般的に、各GO用語に対してバイナリ分類器 を構築し、それらを結合して個々のGO用語の予測を行い(多クラス分類器 を形成)、その後信頼度スコアを取得します。サポートベクターマシン (SVM)は、機能アノテーションで最も広く使用されているバイナリ分類器ですが、k近傍法 (kNN)や畳み込みニューラルネットワーク (CNN)などの他のアルゴリズムも使用されています。[ 40 ]
機能アノテーションのための二値分類法や多クラス分類法は、GO用語間の相互関係を考慮しないため、一般的に精度が低い結果をもたらします。これらの相互関係を考慮するより高度な方法は、フラットなアプローチまたは階層的なアプローチのいずれかによって行われますが、前者はオントロジー構造を考慮しないのに対し、後者は考慮するという点で区別されます。これらの方法の中には、行列分解 やハッシュ化 によってGO用語を圧縮し、パフォーマンスを向上させるものもあります。[ 42 ]
非コード配列の機能予測 非コード配列 (ncDNA)は、タンパク質をコードしない配列です。これには、偽遺伝子、セグメント重複、結合部位、RNA遺伝子などの要素が含まれます。[ 28 ]
偽遺伝子は、 オープンリーディングフレーム (ORF)の破壊によりコード機能を失い、翻訳不可能に なったタンパク質コード遺伝子の変異コピーである。[ 28 ] これらは、次の2つの方法のいずれかを使用して識別される可能性がある。[ 46 ]
相同性に基づく方法 。偽遺伝子は、機能遺伝子に類似しているが、ORFに破壊をもたらす変異を含む配列を検索することによって同定される。この方法では、偽遺伝子とその親遺伝子との進化的な関係や、その事象が発生してから経過した時間を特定できない。系統発生に基づく方法 。偽遺伝子は系統発生解析によって同定されます。まず、対象種の種系統樹と対象遺伝子(または遺伝子ファミリー)の系統樹を作成します。次に、この2つを比較して、遺伝子を失った種を特定します。続いて、遺伝子が見つからなかった種のゲノム内で、最も近縁な種で同定された遺伝子と相同な配列を検索します。最後に、この相同配列のORFに欠失があり(かつRNA-Seq データ解析、dN/dS比などの他の基準も満たす場合)、その配列は偽遺伝子であると判断されます。セグメント重複とは 、1000塩基対を超えるDNAセグメントで、ゲノム内で90%以上の配列同一性で繰り返されているものです。セグメント重複の識別に使用される2つの戦略は、WGACとWSSDです。[ 47 ]
全ゲノムアセンブリ比較 (WGAC)。これは、共通の反復配列を除外した後、ゲノム全体を自身にアラインメントして反復配列を特定する手法です。アセンブリに使用した元のリードは必要ありません。全ゲノムショットガンシーケンス検出 (WSSD)。これは、元のリードをアセンブルされたゲノムにアラインメントし、平均よりもリード深度が高い領域を検索します。これは通常、重複のシグナルです。この方法で特定されたがWGACでは特定されなかったセグメント重複は、おそらく重複が崩壊したものであり、誤って同じ領域にアラインメントされたことを意味します。[ 48 ] DNA結合部位は 、ゲノム配列の中で特定のタンパク質と結合して相互作用する領域です。DNA複製 と修復 、転写調節 、ウイルス感染 において重要な役割を果たします。結合部位の予測には、次の2つの方法のいずれかが使用されます。[ 49 ]
配列類似性に基づく手法 。これは、既知のDNA結合部位を持つ相同配列を特定するか、クエリタンパク質と配列をアラインメントすることによって行われます。DNA結合配列は保存性が 低いため、これらの手法の性能は通常低くなります。構造に基づく手法 。タンパク質の三次元構造情報を用いて、DNA結合部位の位置を予測する。RNA遺伝子によって生成される非コードRNA (ncRNA)は、タンパク質に翻訳されないRNAの一種です。これには、tRNA 、rRNA 、snoRNA 、マイクロRNA などの分子や、非コードmRNA 様転写産物が含まれます。単一ゲノムにおけるRNA遺伝子のab initio 予測は、多くの場合不正確な結果をもたらすため(miRNAは例外)、代わりにマルチゲノム比較法が使用されます。これらの方法は、ncRNAの二次構造に特に関心があり、配列が保存されていなくても、関連種間で保存されています。したがって、多重配列アライメントを実行することで、予測に役立つより有用な情報を得ることができます。相同性検索もRNA遺伝子の同定に使用できますが、この手順は、特に真核生物では、多数の反復配列や偽遺伝子の存在により複雑です。[ 50 ]
視覚化 Prokkaで作成された注釈付きGBKファイルのスナップショット。[ 51 ] これは、 Candidatus Carsonella ruddii の ゲノムのごく一部の構成要素(特徴)を示しており、それらの位置(構造注釈)と推定される機能(機能注釈)が含まれています。
ゲノムブラウザ での注釈の可視化には、各注釈のイントロン -エクソン 構造、開始コドンと終止コドン 、UTR、代替転写産物を記述し、理想的には各遺伝子モデルをサポートする配列アライメント と遺伝子予測 に関する情報を含む記述出力ファイルが必要です。注釈を記述するためによく使用される形式には、GenBank、GFF3 、GTF、BED 、EMBLなどがあります。[ 24 ] これらの形式の中には、記述用語を定義し、解析ツールと可視化ツール間の相互運用性を保証するために、統制語彙とオントロジーを使用するものがあります。[ 2 ]
ゲノムブラウザ ゲノムブラウザは、グラフィカルインターフェースを介して、大規模なゲノム配列および注釈データの分析と視覚化を簡素化し、生物学的洞察を得るためのソフトウェア製品です。[ 52 ] [ 31 ] [ 53 ]
ゲノムブラウザは、ウェブベースのゲノムブラウザ とスタンドアロンのゲノムブラウザ に分類できます。前者はデータベースの情報を使用し、複数種 (複数の生物の配列と注釈を統合し、種間比較分析を促進する)と種特異的 (1つの生物と特定の種の注釈に焦点を当てる)に分類できます。後者は必ずしも特定のゲノムデータベースにリンクされているわけではなく、ローカルコンピュータにアプリケーションとしてダウンロードしてインストールできる汎用ブラウザです。[ 54 ] [ 19 ]
ゲノムの比較可視化 系統発生的に関連するウイルス 科 および属の複数の 代表種 について、線形比較ゲノム可視化を行った。タンパク質の機能アノテーションは異なる色で、相同性は異なる色調で表示される。 比較ゲノミクスは、 ゲノムの特徴の類似点と相違点を特定するとともに、生物間の進化関係を調べることを目的としています。[ 55 ] 2つ以上のゲノム間の比較挙動を視覚化できるツールは、このアプローチに不可欠であり、比較対象のゲノム間の関係の表現に基づいて3つのカテゴリに分類できます。[ 19 ]
ドットプロット: この方式では、2つのゲノムのアライメントのみを表示できます。一方のゲノムは水平軸に沿って、もう一方のゲノムは垂直軸に沿って表示され、プロット内のドットは、これら2つのアノテーション間で類似しているゲノム要素を表します。線形表現: この表現では、複数の線形トラックを使用して複数のゲノムとその特徴を表します。ここで「トラック」とは、ゲノム上の特定の位置にある特定の種類のゲノム特徴を指す概念です。円形表示: この表示方法は、微生物またはウイルスのゲノム全体を比較するのに役立ちます。この表示モードでは、同心円と円弧を使用してゲノムの各部分を表します。
品質管理 配列アセンブリ の品質はアノテーションの品質に影響するため、後続のアノテーション手順を実行する前にアセンブリの品質を評価することが重要です。[ 31 ] ゲノムアノテーションの品質を定量化するために、再現率 、精度 、正確度の 3 つの指標が使用されています。ただし、これらの指標はアノテーション プロジェクトで明示的に使用されるのではなく、予測精度の議論で使用されます。[ 56 ]
コミュニティによるアノテーション手法は、ゲノムアノテーションの品質管理と標準化に優れた手法です。2002年に開催されたアノテーション・ジャンボリーでは、サンガー研究所のヒトおよび脊椎動物解析プロジェクト(HAVANA)で使用されるアノテーション標準が作成されました。[ 57 ] [ 20 ]
再注釈 アノテーションプロジェクトは、多くの場合、生物のゲノムの以前のアノテーションに依存していますが、これらの古いアノテーションには、新しいアノテーションに伝播する可能性のあるエラーが含まれている場合があります。新しいゲノム解析技術が開発され、より豊富なデータベースが利用可能になると、古いゲノムのアノテーションが更新されることがあります。再アノテーションとして知られるこのプロセスは、遺伝子やタンパク質の機能の詳細など、ゲノムに関する新しい情報をユーザーに提供できます。したがって、再アノテーションは品質管理において有用なアプローチです。[ 56 ] [ 58 ]
コミュニティアノテーションは、コミュニティ(科学コミュニティと非科学コミュニティの両方)がゲノムアノテーションプロジェクトに参加することを指します。これは、次の 6 つのカテゴリに分類できます。[ 59 ] [ 3 ]
ファクトリーモデル: アノテーションは完全に自動化されたパイプラインによって実行されます。博物館モデル: 注釈プロジェクトの結果を解釈するために、専門家による手作業でのキュレーションが行われます。 家内工業モデル: 注釈付けは分散型であり、様々なパートタイムのキュレーターの努力の成果である。パーティーまたはジャンボリーモデル: コミュニティの著名なキュレーターによる短時間の集中ワークショップで構成されます。これは、ショウジョウバエの ゲノム注釈プロジェクトで初めて使用されました。[ 60 ] 祝福された注釈者: ノックアウトマウスプロジェクト(KOMP)で採用されている、博物館モデルの変形版。学芸員は注釈を行う前に研修期間を経て、その後、注釈ツールへのアクセス権を与えられ、作業を継続する。ゲートキーパー方式: これは、大規模イベントと小規模産業モデルを組み合わせたものです。まず注釈ワークショップを開催し、その後、分散型の共同作業によって初期注釈を拡張・洗練していきます。複数の種のデータに適用されています。コミュニティ注釈は、特定の項目の注釈を特定の専門家に依頼することでプロジェクトを管理するコーディネーターがいる場合、監督付きであると言われます。一方、誰でもプロジェクトに参加でき、調整が分散的に行われる場合は、 監督なしの コミュニティ注釈と呼ばれます。監督付きコミュニティ注釈は短命で、イベントの期間に限定されますが、監督なしのコミュニティ注釈にはこの制限はありません。しかし、後者は、時間、動機、インセンティブ、および/またはコミュニケーションの不足が原因で、前者ほど成功していません。[ 61 ]
Wikipediaには、注釈の改善を目的とした複数のWikiProjectがあります。たとえば、Gene WikiProjectは、研究データベースから遺伝子データを収集し、それに基づいて 遺伝子スタブを作成するボットを運用しています。 [ 62 ] RNA WikiProjectは、個々のRNAとRNAファミリーを分かりやすく説明する記事を作成することを目指しています。[ 63 ]
アプリケーション
疾患診断 遺伝子オントロジーは、疾患と遺伝子の関係を確立するために研究者によって使用されています。GO は、病気と健康など、さまざまな条件下での新規遺伝子、その発現、分布、機能の変化の特定に役立ちます。[ 41 ] さまざまな生物のこの疾患と遺伝子の関係のデータベースが作成されており、例えば、植物病原体オントロジー[ 64 ] 、植物関連微生物遺伝子オントロジー[ 65 ] 、または DisGeNET [ 66 ] などがあります。また、ラットゲノムデータベースのラット疾患オントロジー[ 67 ] のように、既存のデータベースに実装されているものもあります。
ソフトウェア 真核生物 ゲノムの遺伝子は、 FINDER [ 74 ] などのさまざまな注釈ツールを使用して注釈付けできます[ 73 ] 。最新の注釈パイプラインは、MOSGA [ 75 ] [ 76 ] などのユーザーフレンドリーなウェブ インターフェースとソフトウェア コンテナ化をサポートできます。原核生物 ゲノムの最新の注釈パイプラインは、Bakta [ 77 ] 、Prokka [ 51 ] 、および PGAP [ 78 ]です。
国立生物医学オントロジーセンターは、データベースレコードのテキスト記述に基づいて、データベースレコードの自動注釈のためのツールを開発しています[ 79 ] 。
一般的な方法として、dcGO [ 80 ] は、既存の遺伝子/タンパク質レベルの注釈から、オントロジー用語とタンパク質ドメイン またはドメインの組み合わせとの関連性を統計的に推論する自動化された手順を備えています。
MAKERなど、科学者がゲノム注釈を閲覧・共有できるさまざまなソフトウェアツールが開発されている。
ゲノムアノテーションは活発な研究分野であり、生命科学コミュニティの様々な組織が関与し、その成果をウェブやその他の電子媒体でアクセス可能な公開生物学的データベース に公開しています。以下に、ゲノムアノテーションに関連する進行中のプロジェクトをアルファベット順にリストアップします。
参考文献 ↑ Zheng S, Poczai P, Hyvönen J, Tang J, Amiryousefi A (2020). "Chloroplot: An Online Program for the Versatile Plotting of Organelle Genomes" . Frontiers in Genetics . 11 576124. doi : 10.3389/fgene.2020.576124 . PMC 7545089 . PMID 33101394 . 1 2 3 4 5 6 ドミンゲス・デル・アンヘル V、イジェルデ・E、ステルク・L、カペラ=グティエレス・S、ノートルダム・C、ヴィネレ・ペッターソン・O、 他(2018年2月5日)。 「ゲノムアセンブリとアノテーションを始めるための 10 のステップ」 。 F1000リサーチ 。 7 (148): 148. 土井 : 10.12688/f1000research.13598.1 。 PMC 5850084 。 PMID 29568489 。 1 2 3 4 5 Stein L (2001 年 7 月)「ゲノム注釈: 配列から生物学へ」 Nature Reviews. Genetics . 2 (7): 493– 503. doi : 10.1038/35080529 . PMID 11433356 . S2CID 12044602 . ↑ Davis CP (2021年3月29日) 「ゲノム注釈の医学的定義」 MedicineNet 。 2023年2月9日の オリジナル からアーカイブ。 2023年 4月17日 取得 。 ↑ Koonin E 、 Galperin MY ( 2003)。 「 ゲノムアノテーションと解析」。 配列—進化—機能 ( 第1 版)。Springer US。pp. 193–226。doi : 10.1007/978-1-4757-3783-7_6。ISBN 978-1-4757-3783-7 。1 2 Mishra P、Maurya R、Avashthi H、Mittal S、Chandra M、Ramteke PW (2021)。「ゲノムアセンブリとアノテーション」。Singh DB、Pathak RK (編)『 バイオ インフォマティクス :方法と応用 (第1 版)』Elsevier Science、pp. 49–66。doi : 10.1016 / B978-0-323-89775-4.00013-4。ISBN 978-0-323-89775-4 。1 2 Bright LA、Burgess SC、Chowdhary B、Swiderski CE、McCarthy FM (2009 年 10 月)。 「 ウマ 全 ゲノム オリゴアレイの構造および機能アノテーション」 。BMC Bioinformatics。10 ( Suppl 11): S8。doi : 10.1186 /1471-2105-10-S11- S8。PMC 3226197。PMID 19811692 。 ↑ Reed JL、Famili I、Thiele I、Palsson BO (2006 年 2 月)。「多次元ゲノムアノテーションに向けて」。Nature Reviews. Genetics . 7 (2): 130– 141. doi : 10.1038/nrg1769 . PMID 16418748 . S2CID 13107786 . 1 2 3 4 Abril JF、Castellano S (2019)。「ゲノムアノテーション」。Ranganathan S、Nakai K、Schonbach C、Gribskov M (編)『 バイオ インフォマティクスと計算生物学の百科事典 (第1版) 』 Elsevier Science、 pp . 195–209。doi : 10.1016 /B978-0-12-809633-8.20226-4。ISBN 978-0-12-811432-2 . S2CID 226248103 . 1 2 3 4 Tatusova T、DiCuccio M、Badretdin A、Chetvernin V、Nawrocki EP、Zaslavsky L、et al . (2016 年 8 月)。 「 NCBI 原核生物ゲノム注釈パイプライン」 。Nucleic Acids Research。44 ( 14): 6614–6624。doi : 10.1093/ nar / gkw569。PMC 5001611。PMID 27342282 。 ↑ Staden R (1977 年 11月). 「コンピュータによる配列データ処理」 . Nucleic Acids Research . 4 (11): 4037–4051 . doi : 10.1093/nar/4.11.4037 . PMC 343220. PMID 593900 . ↑ Staden R、McLachlan AD (1982 年 1 月)。 「長い DNA 配列中のタンパク質コード領域の同定におけるコドン優先度とその使用」 。Nucleic Acids Research。10 ( 1 ) : 141–156。doi : 10.1093/ nar / 10.1.141。PMC 326122。PMID 7063399 。 1 2 Gribskov M、Devereux J 、 Burgess RR (1984 年 1 月)。 「コドン優先度プロット: タンパク質コード配列のグラフィック解析と遺伝子発現の予測」 。Nucleic Acids Research。12 ( 1 Pt 2 ) : 539–549。doi : 10.1093 / nar/12.1part2.539。PMC 321069。PMID 6694906 。 ↑ Fickett JW (1996 年 8 月) 「コンピュータによる遺伝子の探索: 最新技術」 Trends in Genetics . 12 (8): 316– 320. doi : 10.1016/0168-9525(96)10038-X . PMID 8783942 . ↑ Grosjean H、Fiers W (1982年6月)。「原核生物遺伝子における優先的なコドン使用:最適なコドン-アンチコドン相互作用エネルギーと効率的に発現する遺伝子における選択的なコドン使用」。Gene。18 ( 3 ) : 199–209。doi : 10.1016 / 0378-1119(82) 90157-3。PMID 6751939 。 ↑ Grantham R、Gautier C、Gouy M、Mercier R、Pavé A (1980 年 1 月)。 「 コドンカタログ の 使用とゲノム仮説」 。Nucleic Acids Research。8 ( 1 ): r49– r62。doi : 10.1093 / nar/8.1.197- c。PMC 327256。PMID 6986610 。 ↑ Lukashin AV、Borodovsky M (1998 年2 月 )。 「GeneMark.hmm: 遺伝子探索のための新しいソリューション」 。Nucleic Acids Research。26 ( 4 ): 1107–1115。doi : 10.1093/ nar / 26.4.1107。PMC 147337。PMID 9461475 。 ↑ Salzberg SL、 Delcher AL、Kasif S 、 White O (1998 年 1 月)。 「補間マルコフモデル を 用いた微生物遺伝子の同定」 。Nucleic Acids Research。26 ( 2 ): 544–548。doi : 10.1093/nar / 26.2.544。PMC 147303。PMID 9421513 。 1 2 3 4 5 6 7 8 Soh J 、 Gordon PM、Sensen CW (2012年9月4日)。 ゲノムアノテーション 。ニューヨーク:Chapman and Hall/CRC。doi : 10.1201 / b12682。ISBN 978-0-429-06401-2 2023年4月18日にオリジナルからアーカイブされました。2023年4月18日 に取得されました。1 2 Brent MR (2005 年 12 月) 「ゲノム注釈の過去、現在、未来: 各遺伝子座の ORF をどのように定義するか」 . Genome Research . 15 (12): 1777– 1786. doi : 10.1101/gr.3866105 . PMID 16339376 . ↑ ENCODEプロジェクトコンソーシアム(2011年4月)。Becker PB (編)。 「DNAエレメント百科事典 ( ENCODE) の ユーザーガイド」 。PLOS Biology。9 ( 4 ) e1001046。doi : 10.1371 / journal.pbio.1001046。PMC 3079585。PMID 21526222 。 ↑ Abecasis GR 、 Auton A 、 Brooks LD、DePristo MA、Durbin RM、Handsaker RE、et al. (2012年11月)。 「 1,092 個 の ヒトゲノムからの遺伝的変異の統合マップ」 。Nature。491 ( 7422): 56–65。Bibcode : 2012Natur.491 ...56T。doi : 10.1038 / nature11632。PMC 3498066。PMID 23128226 。 1 2 Kahl G (2015).ゲノミクス 、 トランスクリプトミクス、プロテオミクスの辞典 (第5 版)。ヴァインハイム:Wiley。doi : 10.1002 / 9783527678679。ISBN 978-3-527-67867-9 2022年8月4日にオリジナルからアーカイブされました。 2023年 4月24日 に取得 。1 2 3 4 5 Yandell M、Ence D (2012 年 4 月)。「真核生物ゲノム注釈の初心者向けガイド」。Nature Reviews. Genetics . 13 (5): 329–342 . doi : 10.1038 / nrg3174 . PMID 22510764. S2CID 3352427 . ↑ Treangen TJ、Abraham AL、Touchon M、Rocha EP (2009 年5 月 )。 「原核生物ゲノムにおける反復配列の発生、影響、および運命」 。FEMS Microbiology Reviews。33 ( 3 ) : 539–571。doi : 10.1111/j.1574-6976.2009.00169.x。PMID 19396957 。 ↑ Liehr T (2021年2月). 「ヒトにおける反復要素」 . International Journal of Molecular Sciences . 22 (4): 2072. doi : 10.3390/ijms22042072 . PMC 7922087 . PMID 33669810 . ↑ Bergman CM、Quesneville H (2007 年11 月 )。 「ゲノム配列中の転移因子 の 発見と検出」 。Briefings in Bioinformatics。8 ( 6): 382–392。doi : 10.1093/bib / bbm048。PMID 17932080 。 1 2 3 Alexander RP、Fang G、Rozowsky J、Snyder M、Gerstein MB (2010 年 8 月)。「ゲノムの非コード領域の注釈付け」。Nature Reviews . Genetics . 11 (8): 559–571 . doi : 10.1038/nrg2814 . PMID 20628352. S2CID 6617359 . ↑ Edgar RC (2010 年 10 月) 「BLAST より桁違いに高速な検索とクラスタリング」 . Bioinformatics . 26 (19): 2460– 2461. doi : 10.1093/bioinformatics/btq461 . PMID 20709691 . ↑ Edgar R. 「シーケンスマスキング」 . drive5.com . 2020年2月3日の オリジナルからアーカイブ済み。 2023年 4月25日 取得 。 1 2 3 4 5 Ejigu GF、Jung J (2020 年9 月 )。 「次世代シーケンシングによって得られた配列の計算ゲノムアノテーションに関するレビュー」 。Biology。9 ( 9 ) :295。doi : 10.3390/ biology9090295。PMC 7565776。PMID 32962098 。 ↑ Garber M、Grabherr MG、Guttman M、Trapnell C (2011年6月)。「RNA-seqを用いたトランスクリプトームのアノテーションと定量化のための計算 手法 」 。Nature Methods。8 ( 6 ) : 469–477。doi : 10.1038 / nmeth.1613。PMID 21623353。S2CID 205419756 。 ↑ Gupta N、Tanner S、Jaitly N、Adkins JN、Lipton M、Edwards R、et al. (2007 年 9 月)。 「 翻訳 後修飾の全プロテオーム解析:プロテオゲノム注釈のための質量分析法の応用 」 。Genome Research。17 ( 9 ) : 1362–1377。doi : 10.1101 / gr.6427907。PMC 1950905。PMID 17690205 。 ↑ De Bona F 、 Ossowski S 、Schneeberger K、Rätsch G (2008 年 8 月)。 「短い配列リードの最適なスプライスアライメント」 。Bioinformatics。24 ( 16 ): i174– i180。doi : 10.1093/bioinformatics/ btn300。PMID 18689821 。 ↑ Trapnell C 、 Pachter L、Salzberg SL ( 2009 年5 月 )。 「TopHat: RNA-Seq によるスプライス接合部の発見」 。Bioinformatics。25 ( 9 ) : 1105–1111。doi : 10.1093 /bioinformatics/ btp120。PMC 2672628。PMID 19289445 。 ↑ Križanovic K 、Echchiki A 、 Roux J、Šikic M (2018 年 3 月)。 「ロング リード RNA-seq スプライス認識アライメントのためのツールの評価」 。Bioinformatics。34 ( 5 ) : 748–754。doi : 10.1093 / bioinformatics / btx668。PMC 6192213。PMID 29069314 。 ↑ McHardy AC、Kloetgen A (2017)「ゲノム配列中の遺伝子の探索」Keith JM (編)『 バイオインフォマティクス』分子生物学 における 方法論第1525 巻 (第2 版)ニューヨーク:Springer、pp. 271–291。doi : 10.1007 / 978-1-4939-6622-6_11。ISBN 978-1-4939-6622-6 PMID 27896725 ↑ Brent MR、Guigó R ( 2004 年 6月)。「遺伝子構造予測における最近の進歩」。Current Opinion in Structural Biology。14 ( 3): 264–272。doi : 10.1016/ j.sbi.2004.05.007。PMID 15193305 。 ↑ Binns D、 Dimmer E 、 Huntley R 、 Barrell D 、O'Donovan C、Apweiler R (2009年11月)。 「 QuickGO : 遺伝子オントロジー検索のためのウェブベースツール」 。Bioinformatics。25 (22): 3045–3046。doi : 10.1093/bioinformatics / btp536。PMC 2773257。PMID 19744993 。 1 2 3 Vu TT、Jung J (2021)。 「遺伝子オントロジーによるタンパク質機能予測:従来型から 深層 学習 モデル へ 」 。PeerJ。9 e12019。doi : 10.7717 / peerj.12019。PMC 8395570。PMID 34513334 。 1 2 Saxena R、Bishnoi R、Singla D (2021)。「遺伝子オントロジー:ゲノムデータの機能アノテーションにおける応用と重要性」。Singh B、Pathak RK (編)『 バイオ インフォマティクス :方法と応用』 。ロンドン:Academic Press。pp. 145–157。doi : 10.1016 / B978-0-323-89775-4.00015-8。ISBN 978-0-323-89775-4 。1 2 Zhao Y, Wang J, Chen J, Zhang X, Guo M, Yu G (2020). "遺伝子オントロジーモデリングによる遺伝子機能予測に関する文献レビュー" . Frontiers in Genetics . 11 : 400. doi : 10.3389/fgene.2020.00400 . PMC 7193026 . PMID 32391061 . ↑ Sasson O、Kaplan N、Linial M (2006年6 月 )。 「機能アノテーション 予測 :一人は皆のために、皆は一人のために 」 。Protein Science。15 ( 6 ) : 1557–1562。doi : 10.1110 / ps.062185706。PMC 2242553。PMID 16672244 。 ↑ Sinha S、Lynn AM、Desai DK (2020 年 10 月)。 「オー ファン 酵素の同定と注釈のための相同性に基づく計算方法と相同性に基づかない計算方法の実装:Mycobacterium tuberculosis H37Rv を事例研究として使用」 。BMC Bioinformatics。21 ( 1 ) : 466。doi : 10.1186 / s12859-020-03794- x。PMC 574302。PMID 33076816 。 ↑ Letovsky S、Kasif S (2003)。 「タンパク質/ タンパク質相互作用データからの タンパク質機能 の 予測:確率的アプローチ」 。Bioinformatics。19 (Suppl 1): i197– i204。doi : 10.1093/bioinformatics / btg1026。PMID 12855458 。 ↑ Dainat J、Pontarotti P (2021) 「系統発生学的アプローチを用いた偽遺伝子の同定と進化の研究方法」 (PDF) 。Poliseno L ( 編) 『偽遺伝子 』 。分子生物学の方法。第 2324巻(第2版 ) 。ニューヨーク:Springer。pp. 21–34。doi : 10.1007 / 978-1-0716-1503-4_2。ISBN 978-1-0716-1503-4 . PMID 34165706 . S2CID 235625288 . ↑ Numanagic I、Gökkaya AS、Zhang L、Berger B、Alkan C、Hach F (2018 年 9 月)。 「 ゲノム アセンブリ における セグメント 重複の高速特性評価」 。Bioinformatics。34 ( 17 ): i706– i714。doi : 10.1093/bioinformatics / bty586。PMC 6129265。PMID 30423092 。 ↑ Hartasánchez DA、Brasó-Vives M、Heredia-Genestar JM、Pybus M、Navarro A (2018 年 11 月)。 「 重複の崩壊が多様 性 推定に及ぼす影響:何が期待できるか」 。Genome Biology and Evolution。10 ( 11): 2899–2905。doi : 10.1093/gbe / evy223。PMC 6239678。PMID 30364947 。 ↑ Si J、Zhao R、Wu R(2015 年3 月 )。 「タンパク質DNA結合部位 の予測 の 概要」 。International Journal of Molecular Sciences。16 ( 3): 5194–5215。doi : 10.3390 / ijms16035194。PMC 4394471。PMID 25756377 。 ↑ Griffiths-Jones S (2007). "非コードRNA遺伝子の注釈". Annual Review of Genomics and Human Genetics . 8 : 279–298 . doi : 10.1146/annurev.genom.8.080706.092419 . PMID 17506659 . 1 2 Seemann T (2014 年 7 月). "Prokka: 原核生物ゲノムの迅速なアノテーション" . Bioinformatics . 30 (14): 2068– 2069. doi : 10.1093/bioinformatics/btu153 . PMID 24642063 . ↑ Valeev T 、 Yevshin I 、Kolpakov F (2013)。 「BioUMLゲノムブラウザ」 。Virtual Biology。1 ( 1): 15。doi : 10.12704/vb/e8 。 ↑ Szot PS、Yang A、Wang X、Parsania C、Röhm U、Wong KH、Ho JW (2017 年 5 月)。 「 PBrowse : ゲノムデータのリアルタイム共同探索のためのウェブベースのプラットフォーム」 。Nucleic Acids Research。45 ( 9): e67。doi : 10.1093 /nar/ gkw1358。PMC 5605237。PMID 28100700 。 ↑ Wang J, Kong L, Gao G, Luo J (2013年3月). 「ウェブベースのゲノムブラウザの簡単な紹介」 . Briefings in Bioinformatics . 14 (2): 131– 143. doi : 10.1093/bib/bbs029 . PMID 22764121 . ↑ Jung J, Kim JI, Yi G (2019年12月). "geneCo: 複数のゲノム構造を解析するための視覚化された比較ゲノム法" . Bioinformatics . 35 (24): 5303– 5305. doi : 10.1093/bioinformatics/btz596 . PMC 6954651 . PMID 31350879 . 1 2 Ouzounis CA、Karp PD (2002)。 「ゲノムワイド再アノテーションの過去、現在、未来」 。Genome Biology。3 ( 2 ) COMMENT2001。doi : 10.1186 / gb -2002-3-2- comment2001。PMC 139008。PMID 11864365 。 ↑ 「手動注釈 - ウェルカム・サンガー研究所」 。www.sanger.ac.uk 。 2023年2月2日に オリジナル からアーカイブ済み 。 2023年 3月28日 に取得。 ↑ Siezen RJ、van Hijum SA (2010年7月)。 「 ゲノム ( 再)アノテーションとオープンソースのアノテーションパイプライン」 。 微生物 バイオ テクノロジー 。3 ( 4 ): 362–369。doi : 10.1111/j.1751-7915.2010.00191.x。PMC 3815804。PMID 21255336 。 ↑ Loveland JE、Gilbert JG 、 Griffiths E、Harrow JL (2012)。 「コミュニティ遺伝子アノテーション の 実践」 。Database。2012 (2012) bas009。doi : 10.1093 / database / bas009。PMC 3308165。PMID 22434843 。 ↑ Hartl DL (2000年4月)「ハエとショットガン:ショットガンの 勝利」 Nature Genetics . 24 (4): 327–328 . doi : 10.1038/74125 . PMID 10742085. S2CID 5354139 . ↑ Mazumder R、Natale DA 、 Julio JA、Yeh LS、Wu CH (2010 年2月 ) 。 「生物学におけるコミュニティ注釈」 。Biology Direct。5 ( 1 ) : 12。doi : 10.1186/1745-6150-5-12。PMC 2834641。PMID 20167071 。 ↑ Huss JW、Orozco C 、 Goodale J、Wu C、Batalov S、Vickers TJ、et al. (2008 年 7 月)。 「 遺伝子 機能 のコミュニティ注釈 の ための遺伝子 wiki」 。PLOS Biology。6 ( 7) e175。doi : 10.1371/journal.pbio.0060175。PMC 2443188。PMID 18613750 。 ↑ Daub J、Gardner PP、Tate J、Ramsköld D、Manske M、Scott WG、 他(2008年12月)。 「RNA WikiProject: RNA ファミリーのコミュニティ注釈」 。 RNA 。 14 (12): 2462–2464 。 土井 : 10.1261/rna.1200508 。 PMC 2590952 。 PMID 18945806 。 ↑ Cooper L、Jaiswal P (2016)「植物オントロジー:植物ゲノミクスのためのツール」Edwards D (編)『 植物バイオインフォマティクス 』Methods in Molecular Biology、第1374巻 ( 第2版 ) 、Totowa、NJ:Humana Press、pp. 89–114。doi : 10.1007 / 978-1-4939-3167-5_5。ISBN 978-1-4939-3167-5 PMID 26519402 ↑ Torto-Alalibo T、Collmer CW、Gwinn-Giglio M (2009 年 2 月)。 「植物関連微生物遺伝子オントロジー (PAMGO) コンソーシアム: 微生物と宿主の相互作用に関与する生物学的プロセスを記述する新しい遺伝子オントロジー用語のコミュニティ開発」 。BMC Microbiology。9 ( Suppl 1 ): S1。doi : 10.1186 / 1471-2180-9-S1 - S1。PMC 2654661。PMID 19278549 。 ↑ ピニェロ J、ラミレス=アンギータ JM、ザウフ=ピタルチ J、ロンツァーノ F、センテノ E、サンツ F、ファーロング LI (2020 年 1 月)。 「疾患ゲノミクスのための DisGeNET 知識プラットフォーム: 2019 年の最新情報」 。 核酸研究 。 48 (D1): D845 – D855。 土井 : 10.1093/nar/gkz1021 。 PMC 7145631 。 PMID 31680165 。 ↑ Hayman GT、Laulederkind SJ、Smith JR、Wang SJ、Petri V、Nigam R、et al. (2016). "ラットゲノムデータベースにおける疾患ポータル、疾患遺伝子アノテーション、およびRGD疾患オントロジー" . Database . 2016 baw034. doi : 10.1093/database/baw034 . PMC 4805243 . PMID 27009807 . ↑ Top EM、Springael D、Boon N (2002 年 11 月)。 「異化 作用 を持つ可動遺伝因子と、汚染された土壌や水のバイオオーグメンテーションにおけるそれらの潜在的な利用」 。FEMS Microbiology Ecology。42 ( 2 ) : 199–208。doi : 10.1111 / j.1574-6941.2002.tb01009.x。hdl : 1854 / LU - 348539。PMID 19709279。S2CID 15173391 。 ↑ Phale PS、Paliwal V、Raju SC、Modak A、Purohit HJ (2013 年 1 月)。 「 ナフタレン 分解性土壌細菌 Pseudomonas putida CSV86 のゲノム配列 」 。Genome Announcements。1 ( 1 ) : 234–235。doi : 10.1128 / genomeA.00234-12。PMC 3587945。PMID 23469351 。 ↑ Trivedi VD、Jangir PK、Sharma R、Phale PS (2016 年 12 月)。 「 Pseudomonas sp. 株 C5pp からのカルバリル代謝経路の機能的および進化的解析に関する考察 」 。Scientific Reports。6 ( 1 ) 38430。Bibcode : 2016NatSR ... 638430T。doi : 10.1038 / srep38430。PMC 5141477。PMID 27924916 。 ↑ Huo YY, Li ZY, Cheng H, Wang CS, Xu XW (2014). "重金属耐性細菌 Halomonas zincidurans タイプ株 B6(T) の高品質ドラフトゲノム配列" . Standards in Genomic Sciences . 9 (30): 30. doi : 10.1186/1944-3277-9-30 . PMC 4286145 . PMID 25945155 . ↑ Pan X、Lin D、Zheng Y、Zhang Q、Yin Y、Cai L、et al. (2016 年 2 月) 「Stenotrophomonas sp. DDT-1 による DDT の生分解: 特性評価とゲノム機能解析」 Scientific Reports 6 ( 1) 21332. Bibcode : 2016NatSR...621332P . doi : 10.1038/srep21332 . PMC 4758049 . PMID 26888254 . ↑ GAAS 、NBIS -- スウェーデン国立バイオインフォマティクスインフラストラクチャ、2022年4月13日、 2022年 4月25日 取得 ↑ Banerjee S、Bhandary P、Woodhouse M、Sen TZ、Wise RP、Andorf CM (2021 年 4 月)。 「 FINDER: RNA-Seq データおよび関連するタンパク質配列から真核生物 遺伝子 を注釈 付け するための自動ソフトウェア パッケージ」 。BMC Bioinformatics。22 ( 1 ): 205。doi : 10.1186 /s12859-021-04120-9。PMC 8056616。PMID 33879057 。 ↑ マーティン R、ハックル T、ハッタブ G、フィッシャー MG、ハイダー D (2021 年 4 月)。ビロル I (編)。 「MOSGA: モジュラーオープンソースゲノムアノテーター」。 バイオインフォマティクス 。 36 ( 22 – 23): 5514 – 5515。arXiv : 2009.03758 。 土井 : 10.1093/bioinformatics/btaa1003 。 hdl : 21.11116/0000-0006-FED4-D 。 PMID 33258916 。 ↑ Martin R. "MOSGA" . mosga.mathematik.uni-marburg.de . 2022年 4月25日 取得 . ↑ Schwengers O、Jelonek L、Dieckmann MA、Beyvers S、Blom J、Goesmann A (2021年11月)。 「 Bakta: アライメントフリーの配列同定による細菌ゲノムの迅速かつ標準化されたアノテーション 」 。Microbial Genomics。7 ( 11 ) 。doi : 10.1099 / mgen.0.000685。PMC 8743544。PMID 34739369 。 ↑ Li W、O'Neill KR、Haft DH、DiCuccio M、Chetvernin V、Badretdin A、et al. (2021 年 1 月)。 「RefSeq: タンパク質ファミリーモデル の キュレーションによる原核生物ゲノムアノテーションパイプラインの範囲の拡大」 。Nucleic Acids Research。49 ( D1 ) : D1020– D1028。doi : 10.1093 /nar/ gkaa1105。PMC 7779008。PMID 33270901 。 ↑ 「 NCBO Annotator」 。ncbo.bioontology.org 。 2023年 2月8日 取得 。 ↑ Fang H、Gough J (2013 年 1 月)。 「DcGO: 機能、表現型、疾患などに関するドメイン中心のオントロジーのデータベース」 。Nucleic Acids Research。41 ( データベース 特集 号): D536– D544。doi : 10.1093/nar / gks1080。PMC 3531119。PMID 23161684 。