レイノルド・シン | |
|---|---|
| 母校 | カリフォルニア大学バークレー校 (博士号)、 トロント大学(学士) |
| 知られている | Apache Spark、データブリックス |
| 科学者としてのキャリア | |
| フィールド | コンピュータサイエンス |
| 博士課程の指導教員 | マイケル・J・フランクリン |
レイノルド・シンは、ビッグデータ、分散システム、クラウドコンピューティングを専門とするコンピュータ科学者およびエンジニアです。彼は、 Databricksの共同設立者であり、チーフアーキテクトです。[1]彼は、主要なオープンソースのビッグデータプロジェクトであるApache Sparkでの仕事で最もよく知られています。[2]彼は、 GraphX、Project Tungsten、およびStructured Streamingコンポーネントの設計者および主任開発者であり、Apache Sparkディストリビューションのコアの一部であるDataFramesの共同設計者でした。また、Sparkの2.0リリースのリリースマネージャーも務めました。[3]
バイオグラフィー
バークレー
Xinはカリフォルニア大学バークレー校のAMPLabで博士課程に在籍中にSparkオープンソースプロジェクトに取り組み始めました。彼はバークレーでコンピュータサイエンスの博士号を取得しました。指導教官はMichael J. FranklinとIon Stoicaでした。[4]
最初の研究プロジェクトであるShark [5] は、SQLと高度な分析ワークロードを大規模に効率的に実行できるシステムを作成しました。Sharkは、 SIGMOD 2012でベストデモ賞を受賞しました。[6] Sharkは、Hadoopシステム上の最初のオープンソースのインタラクティブSQLの1つであり、 Apache Hiveよりも10〜100倍高速であると主張しています。SharkはYahooなどのテクノロジー企業で使用されていましたが、[7] 2014年にSpark SQLと呼ばれる新しいシステムに置き換えられました。[8]
2番目の研究プロジェクトであるGraphX [9]は、汎用データ並列システムであるSpark上にグラフ処理システムを作成しました。GraphXは同時に、グラフ計算には特殊なシステムが必要であるという概念に挑戦しました。GraphXはオープンソースプロジェクトとしてリリースされ、2014年にSpark上のグラフ処理ライブラリとしてSparkに統合されました。
データブリックス
2013 年、Xin 氏はMatei Zaharia 氏や他の主要な Spark 貢献者とともに、 Spark をベースにしたデータ プラットフォームをサービスとして提供するサンフランシスコを拠点とするベンチャー支援企業 Databricks を共同設立しました。
2014年、Xin氏はDatabricksのエンジニアチームを率いてソートベンチマークに出場し、Sparkを使用したデイトナグレーソートで2014年の世界記録を獲得し、Apache Hadoopが保持していた以前の記録を30倍も上回りました。[10] Xin氏は、Sparkがペタバイトのデータをソートする最速のオープンソースエンジンであると主張しました。[11]
Databricks在籍中、彼はDataFramesプロジェクト[12] 、 Project Tungsten [13]、Structured Streaming [14]も立ち上げました。DataFramesは基礎APIとなり、Tungstenは新しい実行エンジンとなりました。
参考文献
- ^ 「Reynold Xin: Executive Profile & Biography - Businessweek」。bloomberg.com . Bloomberg Businessweek . 2016年9月21日閲覧。
- ^ Woodie, Alex (2016 年 6 月 8 日). 「Apache Spark の採用状況 (数字で見る)」. datanami.com . Tabor Communications . 2016 年9 月 21 日閲覧。
- ^ 「Apache Spark 開発者リスト - [発表] Apache Spark 2.0.0 を発表」。apache -spark-developers-list.1001551.n3.nabble.com。2016年 8 月 4 日閲覧。
- ^ 「スピーカー レイノルド・シン」engsci.utoronto.ca 2020年10月5日。
- ^ Xin, Reynold S.; Rosen, Josh; Zaharia, Matei; Franklin, Michael J.; Shenker, Scott; Stoica, Ion (2013-01-01). 「Shark」。2013 ACM SIGMOD 国際データ管理会議議事録。SIGMOD '13。ニューヨーク、ニューヨーク、米国: ACM。pp. 13– 24。doi :10.1145/2463676.2465288。ISBN 9781450320375.S2CID 1597960 。
- ^ 「Shark が SIGMOD 2012 でベストデモ賞を受賞」AMPLab - UC Berkeley 2012 年 5 月 24 日2016 年 8 月 4 日閲覧。
- ^ Tully. 「Yahoo の Spark & Shark の分析」(PDF)。
- ^ 「Shark、Spark SQL、Hive on Spark、そしてApache Spark上のSQLの将来」2014年7月1日。 2016年8月4日閲覧。
- ^ Gonzalez, Joseph E.; Xin, Reynold S.; Dave, Ankur; Crankshaw, Daniel; Franklin, Michael J.; Stoica, Ion (2014-01-01). 「GraphX: 分散データフロー フレームワークでのグラフ処理」。第11 回 USENIX オペレーティング システムの設計と実装に関する会議の議事録。OSDI'14。米国カリフォルニア州バークレー: USENIX 協会: 599– 613。ISBN 9781931971164。
- ^ Finley, Klint. 「スタートアップが記録的な23分で100テラバイトのデータを処理」Wired 。 2016年8月4日閲覧。
- ^ 「Apache Spark はペタバイトをソートする最速のオープンソースエンジン」 2014 年 10 月 10 日。 2016 年 8 月 4 日閲覧。
- ^ 「大規模データサイエンスのための Apache Spark での DataFrames の導入」 2015 年 2 月 17 日. 2016 年 8 月 4 日閲覧。
- ^ Woodie, Alex (2015 年 5 月 4 日)。「Apache Spark 向けの Databricks の大幅なスピードアップ計画の詳細」。datanami.com。Tabor Communications。2016年9月 21 日閲覧。
- ^ Woodie, Alex (2016 年 2 月 25 日)。「Spark 2.0 で新しい「構造化ストリーミング」エンジンを導入」。datanami.com。Tabor Communications。2016年9月 21 日閲覧。
