1000植物トランスクリプトームイニシアチブ(1KP)は、植物の遺伝的変異の最も詳細なカタログを確立するための国際的な研究プロジェクトでした。2008年に発表され、アルバータ大学のGane Ka-Shu WongとMichael Deyholosが主導しました。このプロジェクトは、2014年までに1,000種類の植物種のトランスクリプトーム(発現遺伝子)の配列決定に成功しました。 [ 1 ] [ 2 ]最終的な成果物は2019年に発表されました。[ 3 ] [ 4 ] [ 5 ]
1KPは、ハイスループット(「次世代」)DNAシーケンス技術の普及を活用するために設計された、大規模な(多くの生物を含む)シーケンスプロジェクトでした。たとえば、同様の1000ゲノムプロジェクトは、2008年から2015年の間に1,000人の個人の高カバレッジゲノム配列を取得し、人間の遺伝的変異をよりよく理解しました。[ 6 ] [ 7 ]このイニシアチブは、10,000の植物の全ゲノムをシーケンスする10KPプロジェクト[ 8 ]や、地球上のすべての真核生物の生物多様性のゲノムをシーケンス、カタログ化、特徴付けすることを目的とした地球バイオゲノムプロジェクト[ 9 ]など、さらなる惑星規模のゲノムプロジェクトのテンプレートを提供しました。
2002年現在分類された緑色植物種の数は約37万種と推定されているが、未分類の種はさらに数千種あると考えられる。[ 10 ]この数にもかかわらず、現在までに詳細なDNA配列情報を持つ種はごくわずかである。 2012年4月11日現在、GenBankには125,426種が登録されている。 [ 11 ]しかし、ほとんど (95%) は 1 つまたは 2 つの遺伝子の DNA 配列しか持っていません。「人類に知られている約 50 万種の植物のうち、ゲノミクスが何らかのレベルで触れられたものはほとんどありません」。[ 1 ] 1000植物ゲノムプロジェクトは、利用可能な広範なゲノム配列を持つ植物種の数を約 100 倍に増やすことを目指しました。
既知の植物種間の進化関係を解明する試みは行われてきたが、 [ 12 ] [ 13 ]形態学的データ、細胞構造、単一の酵素、あるいは少数の配列(rRNAなど)のみを用いて作成された系統樹(または系統発生樹)は誤りやすい。[ 14 ]形態学的特徴は、2つの種が物理的に似ているが近縁ではない場合(例えば収斂進化や相同性の結果) 、あるいは近縁の2つの種が環境に応じて非常によく変化できるため非常に異なって見える場合、特に脆弱である。このような状況は植物界では非常に一般的である。進化関係を構築する別の方法は、異なる種間の多数の遺伝子のDNA配列の変化によるものであり、これは類似した外観の種の問題に対してより頑健であることが多い。[ 14 ]このプロジェクトで生成されたゲノム配列の量により、予測された多くの進化関係は、配列アライメントによってより適切に検証され、その確実性が向上する可能性がある。最終分析で使用された383,679の核遺伝子ファミリー系統樹と2,306の遺伝子年齢分布(Ksプロット付き)は、キャップストーン論文とともにGigaDBで共有されています。 [ 15 ]
このプロジェクトで配列決定された植物ゲノムのリストは無作為に選ばれたものではなく、むしろ、関連する遺伝子を特徴づけることで、その根底にある生合成プロセスを利用したり改変したりできることを期待して、貴重な化学物質やその他の製品(多くの場合、二次代謝産物)を生産する植物に焦点が当てられました。 [ 1 ]例えば、オリーブのように油を生産することが知られている植物は多く、特定の植物から得られる油の中には、アブラヤシや炭化水素を生産する種のように、石油製品と強い化学的類似性を持つものがあります。[ 16 ]これらの植物のメカニズムを利用して工業的に有用な油を大量に生産したり、生産するように改変したりできれば、それらは非常に価値のあるものになります。ここで、油を生産する代謝経路に関与する植物の遺伝子の配列を知ることは、そのような利用を可能にするための大きな第一歩です。自然の生化学経路を操作する方法の最近の例として、遺伝子操作によってビタミンAの前駆体を大量に生産する経路を持つゴールデンライスがあり、この茶色の米はビタミンA欠乏症の潜在的な解決策となっています。[ 17 ]植物に「仕事」をさせるというこの概念は人気があり[ 18 ]、これら1000種の植物の遺伝子情報によってその可能性は劇的に高まるでしょう。生合成経路は、現在ほとんどのものが作られている手動の有機化学反応ではなく、植物を使用して医薬品化合物を大量生産するためにも使用できます。
このプロジェクトで最も予想外の結果の一つは、プロジェクトによって100種以上の藻類からオプシンの配列決定と生理学的特性評価によって発見された、ニューロンの光遺伝学的制御に広く使用される複数の新規光感受性イオンチャネルの発見でした。 [ 19 ]これらの新規チャネルロドプシン配列の特性評価は、通常、これらの多くの植物種から配列データを生成することに興味も能力もないタンパク質工学者にリソースを提供します。 [ 20 ]多くのバイオテクノロジー企業が、これらのチャネルロドプシンタンパク質を医療目的で開発しており、これらの光遺伝学的治療候補の多くは、網膜失明の視力を回復するための臨床試験中です。これらの網膜色素変性症の治療に関する最初の発表結果は、2021年7月に発表されました。[ 21 ]
シーケンスは当初、北京ゲノム研究所(BGI Shenzhen、中国)のIllumina Genome Analyzer GAII次世代DNAシーケンスプラットフォームで行われましたが、後のサンプルはより高速なIllumina HiSeq 2000プラットフォームで実行されました。28台のIllumina Genome Analyzer次世代DNAシーケンスマシンから始まり、最終的に北京ゲノム研究所の100台のHiSeq 2000シーケンサーにアップグレードされました。これらのマシンのそれぞれの初期容量は3Gb/ラン(1実験あたり30億塩基対)で、植物サンプルの高速かつ正確なシーケンスが可能になりました。[ 22 ]
配列決定する植物種の選択は、特定の植物に関心を示した様々な資金提供機関と研究者グループの国際的な協力によってまとめられました。[ 1 ]プロジェクトのバイオテクノロジー目標を促進するために有用な生合成能力を持つことが知られている植物種に重点が置かれ、現在の植物系統樹のギャップを埋め、未知の進化関係を説明するために他の種が選択されました。工業用化合物の生合成能力に加えて、医学的に活性な化学物質(オピオイドを生成するケシなど)を生成することが知られている、または疑われている植物種には、合成プロセスをよりよく理解し、商業生産の可能性を探り、新しい医薬品オプションを発見するために高い優先順位が与えられました。薬効のある多数の植物種が伝統中国医学(TCM)から選択されました。[ 1 ]選択された種の完全なリストはウェブサイトで公開されており、[ 23 ]方法論の詳細とデータアクセスの詳細は詳細に公開されています。[ 5 ] [ 24 ]
このプロジェクトでは、さまざまな植物種のゲノム全体(すべてのDNA配列)をシーケンスするのではなく、タンパク質産物を生成するゲノム領域(コード遺伝子)のみをシーケンスしました。これがトランスクリプトームです。[ 1 ]このアプローチは、合成メカニズムを理解するために必要なのは関連するタンパク質を生成する遺伝子のみである生化学的経路に焦点を当てていること、そしてこれらの数千の配列が、配列比較を通じて非常に堅牢な進化関係を構築するのに十分な配列の詳細を表すことから正当化されます。植物種のコード遺伝子の数はかなり異なる場合がありますが、すべて数万以上あり、トランスクリプトームは膨大な情報コレクションとなっています。しかし、非コード配列はゲノム内容の大部分(90%以上)を占めています。[ 25 ]このアプローチは概念的には発現配列タグ(EST)に似ていますが、ESTで遺伝子配列のごく一部を取得するのではなく、各遺伝子の配列全体を高カバレッジで取得するという点で根本的に異なります。[ 26 ]この2つを区別するために、ESTを使用しない方法は「ショットガントランスクリプトームシーケンス」として知られています。[ 26 ]
サンプルからmRNA(メッセンジャーRNA )を採取し、逆転写酵素でcDNAに変換した後、配列決定できるように断片化します。[ 1 ] [ 22 ]トランスクリプトームショットガンシーケンス以外にも、この技術はRNA-seqおよび全トランスクリプトームショットガンシーケンス(WTSS)と呼ばれています。[ 26 ] cDNA断片の配列が決定されたら、データ解析フェーズでその遺伝子のすべての断片を組み合わせることにより、参照ゲノム配列にアラインメントすることなく、de novoアセンブリによって完全な遺伝子配列に組み立てられます。このプロジェクトのために、RNA-Seq専用に設計された新しいde novoトランスクリプトームアセンブラーが作成されました。[ 27 ] SOAPdenovo-Transは、 BGIのSOAPゲノムアセンブリツールスイートの一部です。
サンプルは世界中から集められ、特に希少な種は、妖精湖植物園(中国、深圳)などの植物園から提供された。採取された組織の種類は、生合成活性が予想される場所によって決定された。たとえば、興味深いプロセスや化学物質が主に葉に存在することがわかっている場合は、葉のサンプルが使用された。さまざまな組織タイプに合わせて多数のRNAシーケンスプロトコルが適応され、テストされ、[ 24 ]これらはprotocols.ioプラットフォームを介して公開された。[ 28 ]
トランスクリプトームのみがシーケンスされたため、このプロジェクトでは、遺伝子調節配列、非コードRNA、DNA反復配列、またはコード配列の一部ではないその他のゲノムの特徴に関する情報は明らかにされませんでした。これまでに収集された少数の植物ゲノム全体に基づくと、これらの非コード領域は実際にはゲノムの大部分を構成し、[ 25 ] [ 29 ]非コードDNAは実際には種間で見られる形質の違いの主な要因である可能性があります。[ 30 ]
mRNAが出発物質であるため、特定の遺伝子の配列表現の量は、発現レベル(生成されるmRNA分子の数)に基づいています。つまり、発現量の多い遺伝子は、作業に使用できる配列が多いため、より良いカバレッジが得られます。[ 30 ]その結果、発現レベルが低いものの重要な生化学的機能を持つ重要な遺伝子の中には、プロジェクトによって確実に検出されなかったものがある可能性があります。
多くの植物種(特に農業的に操作されたもの)[ 29 ]は、全ゲノムの重複によってゲノム全体にわたる大きな変化を遂げたことが知られています。たとえば、イネとコムギのゲノムは、全ゲノムのコピーが4~6個あることがあります[ 29 ](コムギ)が、動物は通常2個しかありません(二倍体)。これらの重複した遺伝子は、配列断片のde novoアセンブリに問題を引き起こす可能性があります。なぜなら、反復配列は断片を組み立てようとするコンピュータプログラムを混乱させ、進化を通して追跡することが困難になる可能性があるからです。
中国深圳の北京ゲノム研究所は、 1000ゲノムプロジェクトに関わる主要なゲノムセンターの1つであるのと同様に、1000植物ゲノムプロジェクトのシーケンスの拠点でもあります。[ 31 ]どちらのプロジェクトも、生物の理解を深めるために詳細なDNA配列情報を取得するための大規模な取り組みであり、どちらのプロジェクトも次世代シーケンシングを利用してタイムリーな完了を促進します。
両プロジェクトの目標は大きく異なる。1000ゲノムプロジェクトは単一の種の遺伝的変異に焦点を当てているのに対し、1000植物ゲノムプロジェクトは1000種類の異なる植物種の進化上の関係と遺伝子を研究している。
1000ゲノムプロジェクトの費用は最大5000万米ドルと見積もられたが[ 6 ] 、 1000植物ゲノムプロジェクトはそれほど高額ではなかった。費用の差は、ゲノム内のターゲット配列によるものである[ 1 ]。1000植物ゲノムプロジェクトはトランスクリプトームのみをシーケンスしたのに対し、ヒトプロジェクトは可能な限りゲノムをシーケンスしたため[ 6 ] 、このより特化したアプローチでは必要なシーケンス作業量ははるかに少なくて済む。これは、1000ゲノムプロジェクトに比べて全体的なシーケンス出力が少ないことを意味するが、1000植物ゲノムプロジェクトで除外されたゲノムの非コード部分は、ヒトプロジェクトほどその目標にとって重要ではなかった。そのため、1000植物ゲノムプロジェクトのより焦点を絞ったアプローチは、目標を達成しながらコストを最小限に抑えた。
このプロジェクトは、Alberta Innovates - Technology Futures (iCOREの合併) から資金提供を受けました。)、ゲノム・アルバータ、アルバータ大学、北京ゲノム研究所(BGI)、およびMusea Ventures(米国を拠点とする民間投資会社)が参加している。[ 32 ]現在までに、このプロジェクトはアルバータ州政府から150万カナダドル、Musea Venturesから50万カナダドルの資金提供を受けている。[ 32 ] 2010年1月、BGIは植物と動物の大規模シーケンスプロジェクト(1000植物ゲノムプロジェクト、そしてそれに続く10,000植物ゲノムプロジェクト[ 8 ]を含む)に1億ドルを拠出すると発表した。[ 31 ]
{{cite journal}}: CS1 maint: 数値名: 著者リスト (リンク)