| 分散R | |
|---|---|
| 開発者 | HP |
| 安定放出 | 1.2.0 [ 1 ] / 2015年10月22日 ( 2015年10月22日) |
| 執筆 | C++、R |
| オペレーティング·システム | Linux |
| タイプ | 機械学習アルゴリズム |
| ライセンス | GNU一般公衆利用許諾書 |
| Webサイト | www.distributedr.org |
| リポジトリ |
|
Distributed Rは、 R言語用のオープンソースの高性能プラットフォームです。複数の処理ノード間でタスクを分割することで、実行時間を短縮し、大規模なデータセットを分析します。Distributed R は、分散データ構造、分散データ上で関数を実行するための並列処理プリミティブ、タスクスケジューラ、および複数のデータローダーを追加することで R を強化します。[ 2 ]主に機械学習タスクの分散バージョンを実装するために使用されます。Distributed R はC++とRで記述されており、R の使い慣れた外観と操作感を維持しています。2015年2 月現在 ヒューレット・パッカード(HP)は、Verticaデータベースからの高速データローダーなどの独自の追加機能を備えた分散Rのエンタープライズサポートを提供しています。[ 3 ]
Distributed R は、2011 年に Indrajit Roy、Shivaram Venkataraman、Alvin AuYoung、および Robert S. Schreiber によって HP Labs の研究プロジェクトとして開始されました。[ 4 ] 2014 年に GPLv2 ライセンスの下でオープンソース化され、 GitHubで入手可能です。
2015年2月、Distributed RはHPからのエンタープライズサポートとともに、最初の安定版バージョン1.0に到達した。[ 5 ]
Distributed R は、R で分散アプリケーションを実装および実行するためのプラットフォームです。その目的は、R のシンプルさと操作性を維持しながら、分散コンピューティング向けに R を拡張することです。Distributed R は以下のコンポーネントで構成されています。
HP Vertica は、データベースとオープンソースの Distributed R プラットフォームとの緊密な統合を提供します。HP Vertica 7.1 には、Vertica データベースから Distributed R への高速な並列ロードを可能にする機能が含まれています。この並列 Vertica ローダーは、従来の ODBC ベースのコネクタを使用する場合よりも 5 倍以上高速です。Vertica データベースは、データベースへの機械学習モデルのデプロイもサポートしています。Distributed R ユーザーは、分散アルゴリズムを呼び出して機械学習モデルを作成し、それを Vertica データベースにデプロイして、データベース内スコアリングと予測にモデルを使用できます。Vertica データベースと Distributed R 統合のアーキテクチャの詳細については、Sigmod 2015 の論文に記載されています。[ 6 ]