
分子生物学では、リーディングフレームは開始コドンと終止コドンの間のDNA配列の範囲として定義されます。通常、これは原核生物のDNA配列の研究対象領域内で考慮され、6つの可能なリーディングフレームのうち1つだけが「オープン」になります(ただし、「リーディング」とは、 DNAの転写によって生成されたRNAと、その後の翻訳におけるリボソームとの相互作用を指します)。このようなオープンリーディングフレーム(ORF)は[ 1 ]開始コドン(通常はRNAではAUG )を含むことができ、定義上終止コドン(通常はRNAではUAA、UAG、またはUGA)を超えて広がることはできません。[ 2 ]その開始コドン(必ずしも最初のコドンとは限りません)は、翻訳がどこから始まるかを示します。転写終結部位はORFの後、翻訳終止コドンの先にあります。転写が終止コドンの手前で停止すると、翻訳中に不完全なタンパク質が作られます。[ 3 ]
真核生物の遺伝子で複数のエクソンを持つ場合、転写後にイントロンが除去され、エクソンが結合されて、タンパク質翻訳のための最終的なmRNAが生成されます。遺伝子探索の文脈では、 ORFの開始-停止定義は、イントロンが終止コドンを含む場合や、読み取りフレーム間のシフトを引き起こす可能性があるため、スプライシングされたmRNAにのみ適用され、ゲノムDNAには適用されません。別の定義では、ORFは長さが3で割り切れ、終止コドンで区切られた配列であるとされています。[ 1 ] [ 4 ]このより一般的な定義は、トランスクリプトミクスやメタゲノミクスの文脈で有用です。これらの文脈では、取得した配列に開始コドンや終止コドンが存在しない場合があります。このようなORFは、完全な遺伝子ではなく、遺伝子の一部に対応します。
オープンリーディングフレーム (ORF) の一般的な用途の 1 つは、遺伝子予測を支援する証拠の 1 つとして使用されることです。長い ORF は、他の証拠とともに、DNA配列内の候補タンパク質コード領域または機能的 RNAコード領域を最初に特定するためによく使用されます。[ 5 ] ORF が存在するからといって、その領域が常に翻訳されるとは限りません。たとえば、各ヌクレオチドが均等な割合でランダムに生成された DNA 配列では、 21コドンごとに 1 回、終止コドンが予想されます。[ 5 ]原核生物の単純な遺伝子予測アルゴリズムでは、開始コドンの後に、典型的なタンパク質をコードするのに十分な長さのオープンリーディングフレームが続くものを探すかもしれません。その領域のコドン使用頻度は、特定の生物のコード領域の特徴的な頻度と一致します。[ 5 ]したがって、ORF は最小長を持つべきであり、たとえば 100 コドン[ 6 ]または 150 コドンであるべきだと言う著者もいます。[ 5 ]長いオープンリーディングフレームだけでは、遺伝子の存在を決定的に証明する証拠にはならない。[ 5 ]
短いオープンリーディングフレーム (sORF) [ 7 ] 、別名小型オープンリーディングフレーム (smORF) [ 8 ] 、通常長さが 100 コドン未満[ 9 ]で、タンパク質コード遺伝子 (ncRNA と mRNA の両方) の古典的な特徴を欠いているものの中には、機能的なペプチドを生成できるものがある。[ 10 ]これらはマイクロプロテインまたは sORF コードタンパク質 (SEP) をコードしている。哺乳類の mRNA の約 50% の5'-UTRには、上流 ORF (uORF)とも呼ばれる1 つ以上の sORF が含まれている[ 11 ]。しかし、1994 年の研究で調査された脊椎動物の mRNA の 10% 未満に主要な ORF の前に AUG コドンが含まれていた。uORF は、プロトオンコジーンおよび関連タンパク質の 3 分の 2 に見つかった。[ 12 ]実験的に発見されたsORFの翻訳開始部位の64〜75%はヒトとマウスのゲノムで保存されており、これらの要素が機能を持っていることを示唆している可能性がある。[ 13 ]しかし、sORFはmRNAのマイナーな形態にのみ見られることが多く、選択を免れる。開始部位の高い保存性は、関連遺伝子のプロモーター内部にあることと関連している可能性がある。これは、例えばSLAMF1遺伝子の特徴である。 [ 14 ]
DNAは3つのヌクレオチド(コドン)のグループで解釈されるため、DNA鎖には3つの異なる読み取り枠があります。[ 15 ] DNA分子の二重らせんには2本の逆平行鎖があり、2本の鎖それぞれに3つの読み取り枠があるため、可能なフレーム翻訳は6つあります。[ 15 ]

ORF Finder(Open Reading Frame Finder)[ 16 ]は、ユーザーが指定した最小サイズ以上のオープンリーディングフレームを、ユーザーが指定した配列またはデータベースに登録済みの配列からすべて検出するグラフィカル解析ツールです。このツールは、標準または代替の遺伝暗号を使用してすべてのオープンリーディングフレームを識別します。推定されたアミノ酸配列は、さまざまな形式で保存でき、基本ローカルアラインメント検索ツール(BLAST)サーバーを使用して配列データベースに対して検索できます。ORF Finderは、完全かつ正確な配列提出の準備に役立ちます。また、Sequin配列提出ソフトウェア(配列アナライザー)にも同梱されています。
ORF Investigator [ 17 ]は、コーディング配列と非コーディング配列に関する情報を提供するだけでなく、異なる遺伝子/DNA領域の配列のペアワイズグローバルアライメントも実行できるプログラムです。このツールは、対応するアミノ酸配列のORFを効率的に見つけ、それを1文字のアミノ酸コードに変換し、配列内の位置を提供します。配列間のペアワイズグローバルアライメントにより、一塩基多型を含むさまざまな変異を簡単に検出できます。遺伝子アライメントにはNeedleman–Wunschアルゴリズムが使用されます。ORF Investigatorは移植性の高いPerlプログラミング言語で記述されているため、一般的なすべてのオペレーティングシステムのユーザーが利用できます。
OrfPredictor [ 18 ]は、発現配列タグ (EST) 由来の配列中のタンパク質コード領域を特定するために設計されたウェブサーバーです。BLASTX でヒットしたクエリ配列の場合、このプログラムは BLASTX アライメントで特定された翻訳読み取りフレームに基づいてコード領域を予測し、そうでない場合は、クエリ配列の固有シグナルに基づいて最も可能性の高いコード領域を予測します。出力は、FASTA 形式の予測ペプチド配列と、クエリ ID、翻訳読み取りフレーム、コード領域の開始位置と終了位置を含む定義行です。OrfPredictor は、特に大規模な EST プロジェクトにおいて、EST 由来の配列の注釈付けを容易にします。
ORF Predictorは、上記で述べた2つの異なるORF定義の組み合わせを使用します。開始コドンから始まり、終止コドンで終わる領域を検索します。追加の基準として、5'非翻訳領域(UTRまたはNTR、非翻訳領域[ 19 ] )内の終止コドンを検索します。OrfPredictorウェブサーバーはサポートされなくなりましたが、スタンドアロンのOrfPredictorツールは次のサイト( http://bioinformatics.ysu.edu/publication/tools_download/ )からダウンロードできます。
ORFikは、オープンリーディングフレームを見つけ、次世代シーケンシング技術を使用してORFを正当化するためのBioconductorのRパッケージです。[ 20 ] [ 21 ]
orfipy はPython / Cythonで書かれたツールで、ORF を非常に高速かつ柔軟に抽出します。[ 22 ] orfipy は、プレーンまたは gzip 圧縮された FASTA および FASTQ シーケンスで動作し、開始コドンと終了コドンの指定、部分 ORF の報告、カスタム翻訳テーブルの使用など、ORF 検索を微調整するためのいくつかのオプションを提供します。結果は、スペース効率の良い BED フォーマットを含む複数のフォーマットで保存できます。orfipy は、de novo トランスクリプトーム アセンブリなど、複数の小さな FASTA シーケンスを含むデータに対して特に高速です。[ 23 ]