ウォーレン・リチャード・ギッシュ | |
|---|---|
| 国籍 | アメリカ人 |
| 母校 | カリフォルニア大学バークレー校 |
| 知られている | ブラスト |
| 科学者としてのキャリア | |
| フィールド | バイオインフォマティクス |
| 機関 | 国立バイオテクノロジー情報センター セントルイス・ワシントン大学 アドバンスト ・バイオコンピューティングLLC カリフォルニア大学バークレー校 |
| 論文 | I. 形質転換されたヒト細胞から分離されたSV40変異体。II. 配列分析の方法 (1988) |
| 博士課程の指導教員 | マイケル坊っちゃん[1] |
ウォーレン・リチャード・ギッシュは、 Advanced Biocomputing LLCのオーナーです。 1994年にセントルイスのワシントン大学に助教授として着任し、2002年から2007年まで遺伝学の研究准教授を務めました。[2] [3]
教育
ギッシュは当初物理学を学んだ後、カリフォルニア大学バークレー校で生化学の学士号を取得し、1988年に同大学で分子生物学の博士号を取得しました。 [1]
研究
ギッシュは主にNCBI BLASTへの貢献、[4] [5] 、 BLASTネットワークサービスとnr(非冗長)データベースの作成、1996年のオリジナルのギャップ付きBLAST(WU-BLAST 2.0)のリリース、そして最近ではAB-BLASTの開発とサポートで知られています。セントルイスのワシントン大学では、ギッシュは1995年から2002年にかけて大学のゲノムシーケンシングセンターで作成されたすべての完成したヒト、マウス、ラットのゲノムデータを注釈付けしたゲノム解析グループも率いていました。
大学院生だったギッシュは、クワイン・マクラスキー法をスプライス部位認識配列の解析に適用した。1985年、 DNAの制限酵素認識部位を迅速に特定することを目指して、ギッシュはC言語でDFA関数ライブラリを開発した。この問題に有限状態マシンを適用するというアイデアは、同じ大学院生でBSD UNIX開発者のマイク・カレルズが提案したものだった。ギッシュのDFA実装はミーリーマシンアーキテクチャのものであり、同等のムーアマシンよりもコンパクトで高速だった。DFAの構築はO( n )で、nはクエリ配列の長さの合計だった。その後、DFAを使用して対象配列を1回のパスでバックトラックなしでO( m )の時間でスキャンできる。ここで、 mは対象配列の合計長である。DFA構築方法は、後にアルフレッド・V・エイホとマーガレット・J・コラシックが説明したアルゴリズム3とアルゴリズム4の2つのアルゴリズムを統合したものであることが認識された。[6]
1986年12月にカリフォルニア大学バークレー校で働いていたとき、ギッシュはウィリアム・R・ピアソンとデイビッド・J・リップマンのFASTPプログラム [7] (後にFASTA [8]として知られる)を、結果を変えることなく2~3倍高速化した。パフォーマンスの変更がピアソンとリップマンに伝えられたとき、ギッシュはさらに、DFA(ルックアップテーブルではなく)を使用するとkタプルの識別が高速化し、場合によってはプログラム全体の速度が10%ほど向上する可能性があると示唆した。しかし、最良の場合でもそのようなわずかな改善は、追加されたコードの複雑さに見合わないと著者らは判断した。ギッシュはまた、このとき集中型検索サービスを構想していた。これは、GenBankのすべてのヌクレオチド配列をメモリ内に保持してI/Oボトルネックを解消し(メモリを節約するために圧縮形式で保存)、クライアントがインターネット経由でリモートで FASTN検索を呼び出すというものである。
Gish のBLASTへの最も初期の貢献は、1989 年 7 月にNCBIで働いていたときになされました。初期のプロトタイプでも、 BLAST は一般にFASTAよりはるかに高速でした。Gish は、このアプリケーションで単語ヒット認識に DFA を使用することで潜在的な追加の利点が得られることを認識していました。彼は、以前の DFA コードを柔軟な形式に変形し、それをすべての BLAST 検索モードに組み込みました。BLASTへの彼のその他の貢献には、効率的なストレージ形式と高速なネイティブ検索形式の両方として圧縮されたヌクレオチド配列の使用、並列処理、メモリマップ I/O、単語ヒット拡張の速度を向上させるためにシーケンスの先頭と末尾にセンチネル バイトとセンチネル ワードを使用する、BLASTX [9]、TBLASTN [4]、および TBLASTX (未発表) の独自の実装、実行時にクエリ シーケンス内の低複雑性領域をマスクするためのseg、xnu、dustなどの外部 (プラグイン) プログラムの透過的な使用などがあります。 NCBI BLAST 電子メール サービス (オプションで公開鍵暗号化通信が可能)、NCBI 実験的 BLAST ネットワーク サービス、NCBI 非冗長 ( nr ) タンパク質およびヌクレオチド配列データベース (通常、 GenBank、Swiss-Prot、およびPIRのすべてのデータで毎日更新されます) 。Gish は最初のBLAST API を開発し、これはEST [10] アノテーションとEntrezデータ生成、および NCBI BLASTバージョン 1.4 アプリケーション スイート (Gish、未発表)で使用されました。Gish は、分散サービス用の最も初期の NCBIディスパッチャ( CORBAのオブジェクト リクエスト ブローカーに触発された)の作成者であり、プロジェクト マネージャでもありました。1989年 12 月に初めて外部ユーザーに公開された NCBI 実験的 BLAST ネットワーク サービスは、最新のBLASTソフトウェアをSMPハードウェア上で主要な配列データベースの最新リリースに対して実行し、配列類似性検索の便利なワンストップ ショップとしての NCBI を急速に確立しました。
セントルイスのワシントン大学で、ギッシュは、迅速なギャップ付き配列アライメントとギャップ付きアライメントスコアに適した統計的評価方法を組み合わせた最初のBLASTプログラムスイートを開発し、類似性検索に革命をもたらしました。結果として得られた検索プログラムは、ギャップ付きアライメント拡張中にBLASTドロップオフスコアXを新しく適用したため、ギャップなしBLASTよりも大幅に感度が高く、わずかに遅いだけでした。ギャップ付きBLASTの感度は、すべてのBLAST検索モード で複数のギャップ付きアライメントスコアを評価するためのKarlin-Altschul Sum統計[11]を新しく適用したことでさらに改善されました。Sum統計はもともと、複数のギャップなしアライメントスコアを評価するために解析的に開発されました。ギャップ付きアラインメント スコアの処理における Sum 統計の経験的使用は、1994 年から 1995 年にかけてStephen Altschulとの共同作業で検証されました。1996 年 5 月、ギャップ付きアラインメントを備えた WU-BLAST バージョン 2.0 が、ギャップなしの NCBI BLASTおよび WU-BLAST (両方とも 1994 年に分岐した後のバージョン 1.4) の既存のユーザー向けのドロップイン アップグレードの形で公開されました。WU-BLAST の開発に対して NIH から提供される資金はわずかで、1995 年 11 月から 1997 年 9 月の NCBI ギャップ付きBLAST (「blastall」) のリリース直後まで、平均 20% FTE が使用されました。WU-BLAST のオプションとして、Gish は、NCBI ソフトウェアで長年使用されていたものよりも高速で、メモリ効率が高く、感度の高い 2 ヒットBLASTアルゴリズムを実装しました。 1999 年、Gish は WU-BLAST に拡張データベース形式 (XDF) のサポートを追加しました。これは、ヒトゲノムのドラフト配列全体を完全長染色体配列オブジェクトで正確に表現できる最初のBLASTデータベース形式です。これは、データベース I/O 機能をデータ分析機能から抽象化した結果として、既存のユーザーに透過的に新しいデータベース形式を導入した最初の BLAST パッケージでもありました。XDF を使用した WU-BLAST は、NCBI 標準 FASTA 形式の配列識別子 (NCBI 識別子の全範囲を含む) のインデックス付き検索をサポートする最初の BLAST スイートであり、個々の配列を部分的または全体的に、ネイティブ、翻訳済み、または逆補完して検索できる最初の BLAST スイートであり、 BLASTデータベースの全コンテンツを人間が読めるFASTA 形式にダンプできる最初の BLAST スイートでした。2000 年には、リンク(HSP の一貫したセット、チェーンとも呼ばれる)のレポートに対する独自のサポートが追加されました。2001 年から 2003 年にかけて、Gish は WU-BLAST で使用される DFA コードの速度を改善しました。また、BLAST 検索を 1 桁以上高速化するためにクエリ シーケンスの多重化を提案し (MPBLAST)、MPBLAST による多重化を容易にし、ショットガン シーケンス アセンブリからのセグメント化されたクエリ シーケンスの解析を容易にするために、内部センチネル バイトを使用してセグメント化されたシーケンスを実装し、反復要素や複雑度の低いシーケンスについてゲノム シーケンスを正確に識別してマスクする高速で柔軟な検索エンジンとして WU-BLAST を使用することを指示しました ( RepeatMasker 用のMaskerAid [12]パッケージ)。ギッシュは博士課程の学生ミャオ・チャンとともにEXALIN [13]の開発を指揮し、ドナーとアクセプターのスプライス部位モデルからの情報と配列保存からの情報を組み合わせた新しいアプローチにより、スプライスアラインメント予測の精度を大幅に向上させました。EXALINはデフォルトで完全な動的プログラミングを実行しましたが、オプションでWU-BLASTの出力を動的プログラミングのシードとして利用し、感度や精度をほとんど損なうことなくプロセスを約100倍高速化できました。
2008 年、Gish 氏は Advanced Biocomputing, LLC を設立し、AB-BLAST パッケージの改善とサポートを続けています。[引用が必要]
参考文献
- ^ ab Gish, Warren Richard (1988). I. 形質転換されたヒト細胞から分離された SV40 変異体。II. 配列分析の方法(博士論文)。カリフォルニア大学バークレー校。ProQuest 303669506 。
- ^ ウォーレン・ギッシュの出版物はMicrosoft Academicに索引付けされている
- ^ DBLP書誌サーバーの Warren Gish
- ^ ab Altschul, S. ; Gish, W.; Miller, W. ; Myers, E. ; Lipman, D. (1990). 「基本的なローカルアライメント検索ツール」. Journal of Molecular Biology . 215 (3): 403–410. doi :10.1016/S0022-2836(05)80360-2. PMID 2231712. S2CID 14441902.
- ^ シーケンスからの意味: BLAST の改善について語る Stephen F. Altschul
- ^ Aho, Alfred V. ; Corasick, Margaret J. (1975 年 6 月). 「効率的な文字列マッチング: 書誌検索の補助」. Communications of the ACM . 18 (6): 333–340. doi : 10.1145/360825.360855 . S2CID 207735784.
- ^ Lipman, DJ; Pearson, WR (1985). 「迅速で高感度なタンパク質類似性検索」. Science . 227 (4693): 1435–41. Bibcode :1985Sci...227.1435L. doi :10.1126/science.2983426. PMID 2983426.
- ^ Pearson, WR; Lipman, DJ (1988). 「生物学的配列比較のための改良ツール」.米国科学アカデミー紀要. 85 (8): 2444–2448. Bibcode : 1988PNAS ...85.2444P. doi : 10.1073/pnas.85.8.2444 . PMC 280013. PMID 3162770.
- ^ Gish, W.; States, DJ (1993). 「データベース類似性検索によるタンパク質コード領域の同定」. Nature Genetics . 3 (3): 266–272. doi :10.1038/ng0393-266. PMID 8485583. S2CID 15295142.
- ^ Boguski, MS; Lowe, TM; Tolstoshev, CM (1993). 「dbEST - 「発現配列タグ」のデータベース」. Nature Genetics . 4 (4): 332–333. doi :10.1038/ng0893-332. PMID 8401577. S2CID 40138950.
- ^ Karlin, S. ; Altschul, SF (1993). 「分子配列における複数の高スコアセグメントのアプリケーションと統計」.米国科学アカデミー紀要. 90 (12): 5873–5877. Bibcode :1993PNAS...90.5873K. doi : 10.1073/pnas.90.12.5873 . PMC 46825. PMID 8390686 .
- ^ Bedell, JA; Korf, I.; Gish, W. (2000). 「MaskerAid: RepeatMasker のパフォーマンス向上」.バイオインフォマティクス. 16 (11): 1040–1041. doi : 10.1093/bioinformatics/16.11.1040 . PMID 11159316.
- ^ Zhang, M.; Gish, W. (2005). 「情報理論的アプローチによるスプライスアラインメントの改善」.バイオインフォマティクス. 22 (1): 13–20. doi :10.1093/bioinformatics/bti748. PMID 16267086.
