スティーブ・ヤング | |
|---|---|
| 生まれる | スティーブン・ジョン・ヤング 1951年(72~73歳) |
| 母校 | ケンブリッジ大学 |
| 知られている | |
| 科学者としてのキャリア | |
| フィールド | |
| 機関 | |
| 論文 | 音声合成の概念とシステムからの音声出力への応用 (1978) |
| 博士課程の指導教員 | フランク・フォールサイド |
| Webサイト | mi.eng.cam.ac.uk/~sjy |
スティーブン・ジョン・ヤング(1951年生まれ)はイギリスの研究者、[1]であり、ケンブリッジ大学の情報工学教授、起業家でもある。彼は自動音声認識[2]と統計的音声対話システム[3]の先駆者の一人である。 [4]彼は2009年から2015年までケンブリッジ大学の上級副学長を務め、計画とリソースを担当した。 2015年から2019年まで、彼はケンブリッジ大学の教授職とAppleの兼任を務め、 Siri開発チームの上級メンバーであった。[5]
幼少期と教育
ヤングは1951年1月23日にリバプールで生まれた。ケンブリッジ大学で学び、工学部のフランク・フォールサイド教授の指導の下、1973年に電気科学の学士号、 1978年に音声認識の博士号を取得した。1994年にケンブリッジ大学の情報工学科長に選出される前には、マンチェスターとケンブリッジの両方で講師を務めた。[6]
研究と学術的キャリア
彼は、隠れマルコフモデルを使用して時系列をモデル化するソフトウェアパッケージであるHTKツールキット[2]の主要な著者として最もよく知られています。このツールキットは、主に音声認識に使用されます。最初のバージョンは、1989年にケンブリッジ大学工学部機械知能研究所(CUED)のヤングによって開発されました。ツールキットが世界中で人気が高まったため、マイクロソフトはコアHTKツールキットを再び利用できるようにすることを決定し、1993年にスティーブがHTKツールキットの配布と保守のために共同設立したスタートアップ企業であるEntropicを買収した後、CUEDにソフトウェアのライセンスを戻しました。HTKツールキットのチュートリアルであるHTKブック[7]は、7,000回以上引用されています。[8]
1990 年代後半、ヤングの研究対象は統計的音声対話システムの設計に移りました。この分野における彼の最も注目すべき貢献は、部分観測マルコフ決定過程(POMDP) に基づく対話管理フレームワークです。[3] [9] [10]には、POMDP フレームワークに基づく最初の実用的な対話管理モデルである隠れ情報状態 (HIS) 対話モデルが含まれています。 [11]彼の研究は、ノイズの多い音声認識装置によって導入されるノイズに対して堅牢で、実際のユーザーとの対話でオンラインで適応および拡張できる音声対話システムの開発に重点を置いています。このアプローチの注目すべき例の 1 つは、迅速なポリシー最適化のためのガウス過程に基づく強化学習の適用です。[12] [13]近年、ヤングの研究グループは、統計的対話システムのさまざまなサブモジュールにディープラーニング手法を適用することに成功し、[14] [15] [16] [17]権威ある音声および NLP カンファレンスで複数の最優秀論文賞を受賞しています。
起業家精神
ヤング氏は学術的、科学的貢献の他に成功した起業家でもあり、3 つの企業買収で主導的な役割を果たしました。
- エントロピックは、携帯電話事業者を通じて音声によるウェブ利用を可能にするアプリケーションを開発した音声認識ソフトウェア会社です。同社は1999年にマイクロソフトに買収されました。[18]
- フォネティック・アーツは、自然で表現力豊かな音声を生成する技術を提供する音声合成会社です。同社が開発した技術により、コンピュータゲームはさまざまな文章をさまざまな音声で発音できるようになりました。フォネティック・アーツは2010年にGoogleに買収されました。[18]
- VocalIQは、世界初の対話システムアプリケーションプログラミングインターフェースを構築した対話技術企業です。同社の技術は音声インターフェースのプラットフォームを提供し、企業がモバイルデバイスや独自のアプリを音声対応にできるようにしました。VocalIQは2015年にAppleに買収されました。[18]
受賞と栄誉
ヤングは、王立工学アカデミー[19] 、工学技術協会(IET)、電気電子技術者協会(IEEE)、RSA、国際音声コミュニケーション協会(ISCA)の会員です。[5]
2004年にIEEE信号処理学会技術功績賞、2010年にISCA科学功績賞を受賞。また、2013年に欧州信号処理学会個人技術功績賞、2015年にIEEEジェームズ・L・フラナガン音声・音声処理賞、2021年にIEEEカール・フリードリヒ・ガウス教育賞を受賞。 [5]
2020年に王立協会フェロー(FRS)に選出された[20]
ヤングはソフトウェアエンジニアリングへの貢献により、2022年の誕生日叙勲で大英帝国勲章(CBE)を授与された。 [21]
参考文献
- ^ 「Steve Young – Google Scholar Citations」。Google Scholar 。 2017年5月2日閲覧。
- ^ ab 「HTK音声認識ツールキット」。ケンブリッジ大学。
- ^ ab Williams, Jason; Young, Steve (2007). 「音声対話システムのための部分観測マルコフ決定プロセス」(PDF) . Computer Speech and Language . 21 (2): 393– 422. doi :10.1016/j.csl.2006.06.008. S2CID 13903063.
- ^ Young, Steve; et al. 「Hidden Information State モデル: POMDP ベースの音声対話管理の実用的なフレームワーク」(PDF)。Computer Speech and Language。
- ^ abc 「スティーブ・ヤング教授、情報工学教授」ケンブリッジ大学。
- ^ 「スティーブン・ヤング、エマニュエル・フェロー」。
- ^ ヤング、スティーブ。「HTKブック」(PDF)。ケンブリッジ大学工学部。
- ^ 「Google Scholar」 。 2020年12月23日閲覧。
- ^ Blaise Thompson および Steve Young (2010)。「対話状態のベイズ更新: 音声対話システムのための POMDP フレームワーク」(PDF)。Computer Speech and Language。
- ^ Young, Steve (2013). 「POMDP ベースの統計的音声対話システム: レビュー」(PDF) . Proc IEEE.
- ^ Steve Young 他 (2010)。「隠れた情報状態モデル: POMDP ベースの音声対話管理のための実用的なフレームワーク」(PDF)。コンピュータ音声および言語。
- ^ Milica Gasic および Steve Young (2014)。「POMDP ベースのダイアログ マネージャー最適化のためのガウス過程」(文書)。IEEE Trans. Audio, Speech and Language Processing。
- ^ Pei-Hao Su; et al. (2016). 「音声対話システムにおけるポリシー最適化のためのオンラインアクティブ報酬学習」(PDF)。Proc ACL。arXiv : 1605.07669。
- ^ Lina Rojas-Barahona 他 (2016)。「音声言語理解のためのディープニューラルモデルにおける文と文脈の表現の活用」。Proc Coling。pp. 258– 267。
- ^ Nikola Mrkšić; et al. (2017). 「ニューラルビリーフトラッカー:データ駆動型対話状態追跡」(PDF)。Proc ACL。
- ^ Tsung-Hsien Wen; et al. (2015). 「音声対話システムのための意味的に条件付けされた LSTM ベースの自然言語生成」(PDF) . Proc EMNLP. arXiv : 1508.01745 .
- ^ Tsung-Hsien Wen 他 (2017). 「ネットワークベースのエンドツーエンドの訓練可能なタスク指向対話システム」. arXiv : 1604.04562 [cs.CL].
- ^ abc 「スティーブ・ヤング:エグゼクティブプロフィールと経歴」ブルームバーグLP
- ^ 「スティーブン・ヤング」。王立工学アカデミー。 2020年12月23日閲覧。
- ^ 「スティーブン・ヤング」。王立協会。 2020年9月20日閲覧。
- ^ 「No. 63714」。ロンドン・ガゼット(付録)。2022年6月1日。B11ページ。
