継続的分析とは、 ETLや複雑なバッチデータパイプラインを廃止し、クラウドネイティブとマイクロサービスのパラダイムを採用するデータサイエンスプロセスです。継続的なデータ処理により、少ないリソースでリアルタイムのインタラクションと即時的なインサイトが可能になります。
アナリティクスとは、数学と統計学をビッグデータに適用することです。データサイエンティストは、需要予測や最適価格設定といったビジネス上の課題に対する解決策を見つけるために、アナリティクスプログラムを作成します。継続的なアプローチでは、複数のステートレスエンジンが同時に実行され、データの拡充、集約、推論、および処理が行われます。データサイエンティスト、ダッシュボード、クライアントアプリはすべて、適切なIDベースのセキュリティ、データマスキング、およびリアルタイムのバージョン管理を備えた、同じ生データまたはリアルタイムデータ派生データにアクセスします。
従来、データサイエンティストは、通常のJavaプログラマーのようにIT開発チームの一員ではありませんでした。これは、彼らのスキルが、通常ITとは関係のない独自の部門、つまり数学、統計学、データサイエンスに特化しているためです。したがって、彼らのソフトウェアコードの記述方法は、従来のプログラミングチームと同じ効率性を享受できないと結論付けるのは当然です。特に、従来のプログラミングでは、コード記述に継続的デリバリーのアプローチとアジャイル開発手法が採用されています。これは、イテレーションと呼ばれる継続的なサイクルでソフトウェアをリリースするものです。
継続的アナリティクスとは、継続的デリバリーのソフトウェア開発モデルをビッグデータ分析開発チームに拡張したものです。継続的アナリティクスの実践者の目標は、分析コードの記述とビッグデータソフトウェアのインストールを、ユニットテストや機能テストの自動実行、自動化ツールを用いた環境システムの構築といったアジャイル開発モデルに組み込む方法を見つけることです。
これを実現するには、データサイエンティストが通常のプログラマーが使用するのと同じコードリポジトリにコードを記述し、ソフトウェアがそこからコードを取得してビルドプロセスで実行できるようにする必要があります。また、ビッグデータクラスタ(仮想マシンのセット)の構成も何らかのリポジトリに保存する必要があります。これにより、分析コードやビッグデータソフトウェア、オブジェクトを、継続的インテグレーションプロセスと同じ自動化された方法で送信することが容易になります。[ 1 ] [ 2 ] [ 3 ] [ 4 ]