DataOpsは、データに対する統合されたプロセス指向の視点と、自動化およびアジャイルソフトウェアエンジニアリングの手法を組み合わせた一連のプラクティス、プロセス、テクノロジーであり、データ分析の分野で品質、速度、コラボレーションを向上させ、継続的な改善の文化を促進します。[1] DataOpsはベストプラクティスのセットとして始まりましたが、現在ではデータ分析に対する新しい独立したアプローチに成長しました。[2] DataOpsは、データの準備からレポート作成までのデータライフサイクル全体[3]に適用され、データ分析チームと情報技術運用の相互接続性を認識します。[4]
DataOpsはアジャイル手法を取り入れ、ビジネス目標に合わせて分析開発のサイクルタイムを短縮します。[3]
DevOpsは、オンデマンドのITリソースを活用し、ソフトウェアのテストと展開を自動化することで、継続的な配信に重点を置いています。ソフトウェア開発とIT運用の統合により、ソフトウェアエンジニアリングと展開の速度、品質、予測可能性、規模が向上しました。DevOpsの手法を借用して、DataOpsはデータ分析にも同じ改善をもたらすことを目指しています。[4]
DataOpsは統計的プロセス制御(SPC)を利用してデータ分析パイプラインを監視および制御します。SPCを導入すると、運用システムを流れるデータが常に監視され、正常に機能していることが検証されます。異常が発生した場合は、自動アラートを通じてデータ分析チームに通知されます。[5]
DataOpsは特定のテクノロジー、アーキテクチャ、ツール、言語、フレームワークに縛られるものではありません。DataOpsをサポートするツールは、コラボレーション、オーケストレーション、品質、セキュリティ、アクセス、使いやすさを促進します。[6]
歴史
DataOps は、 InformationWeek の 寄稿編集者である Lenny Liebmann 氏によって、 2014 年 6 月 19 日にIBM Big Data & Analytics Hub のブログ記事「ビッグデータの成功に DataOps が不可欠な 3 つの理由」で初めて紹介されました。 [7] DataOps という用語は、後に Tamr の Andy Palmer 氏と Steph Locke 氏によって普及しました。[8] [4] DataOps は「データ操作」の別名です。[3] 2017 年は、エコシステムの大幅な発展、アナリストによる取材、キーワード検索、調査、出版物、オープンソース プロジェクトの増加など、DataOps にとって重要な年でした。[9] Gartner は、2018 年のデータ管理のハイプ サイクルに DataOps を挙げました。 [10]

目標と哲学
データ量は、2025年までに年平均成長率32%で増加し、180ゼタバイトに達すると予測されています(出典:IDC)。[6] DataOpsは、この大幅なデータの増加に対処するためのツール、プロセス、組織構造を提供することを目指しています。[6]自動化により、大規模な統合データベースの管理に関する日々の要求が合理化され、データチームはより効率的かつ効果的な方法で新しい分析を開発できるようになります。[11] [4] DataOpsは、データ分析の速度、信頼性、品質の向上を目指しています。[12] DataOpsでは、データサイエンティスト、アナリスト、データ/ETL(抽出、変換、ロード)エンジニア、情報技術(IT)、品質保証/ガバナンス の間のコミュニケーション、コラボレーション、統合、自動化、測定、協力を重視しています。
実装
ブルーヒルリサーチのトフ・ホイットモアは、情報技術部門向けに次のようなデータオペレーションのリーダーシップ原則を提案しています。[2]
- 「データ フローの各段階で進捗状況とパフォーマンスの測定を確立します。可能な場合は、データ フローのサイクル時間をベンチマークします。
- 抽象化されたセマンティック レイヤーのルールを定義します。全員が「同じ言語を話している」こと、およびデータ (およびメタデータ) が何であるか、何でないかに関して合意していることを確認します。
- 「目視テスト」で検証する: 継続的な改善を目的とした人間のフィードバック ループを含めます。消費者はデータを信頼できる必要がありますが、これは増分検証によってのみ実現できます。
- BI、データ サイエンス、分析など、データ フローのできるだけ多くの段階を自動化します。
- ベンチマークされたパフォーマンス情報を使用してボトルネックを特定し、それに合わせて最適化します。これには、コモディティ ハードウェアへの投資、またはプロセス内で以前は人間が行っていたデータ サイエンスのステップの自動化が必要になる場合があります。
- 双方向のデータ制御、データの所有権、透明性、およびワークフロー全体にわたる包括的なデータ系統の追跡に特に重点を置いて、ガバナンスの規律を確立します。
- 成長と拡張性を考慮した設計プロセス。データフロー モデルは、データの量と種類に対応できるように設計する必要があります。企業のデータの成長に合わせて拡張できるように、有効なテクノロジの価格が手頃であることを確認してください。」
イベント
- データオプティコン[13]
- データオペレーションサミット[14]
- データオペレーションオンラインチャンピオン[15]
参考文献
- ^ Ereth, Julian (2018). 「DataOps - 定義に向けて」(PDF) . LWDA 2018 議事録: 109.
- ^ ab 「DataOps – それは秘密です」www.datasciencecentral.com 。 2017 年 4 月 5 日閲覧。
- ^ abc 「DataOps (データ操作) とは何か? - WhatIs.com からの定義」。SearchDataManagement。2017年4 月 5 日閲覧。
- ^ abcd 「From DevOps to DataOps, By Andy Palmer - Tamr Inc」。Tamr Inc. 2015-05-07。2018-07-12時点のオリジナルよりアーカイブ。2017-03-21に閲覧。
- ^ DataKitchen (2017-03-07). 「データ分析に適用できるリーン製造の秘密」. Medium . 2017-08-24閲覧。
- ^ abc 「DataOps とは? | Nexla: 機械学習時代に向けたスケーラブルなデータ運用プラットフォーム」www.nexla.com 。2017年 9 月 7 日閲覧。
- ^ 「ビッグデータの成功に DataOps が不可欠な 3 つの理由」。IBM Big Data & Analytics Hub。2018年 8 月 10 日閲覧。
- ^ Mango Solutions: #DataOps - それは重要なことです (正直に言うと) 、2021-06-28取得
- ^ DataKitchen (2017-12-19). 「2017: The Year of DataOps」. data-ops . 2018-01-24閲覧。
- ^ 「ガートナーのデータ管理ハイプサイクル、2018年に3つのテクノロジーをイノベーショントリガーフェーズに位置付ける」。ガートナー。2019年7月19日閲覧。
- ^ 「2017 年のビッグデータを推進する 5 つのトレンド」CIO Dive 。2017年 9 月 7 日閲覧。
- ^ 「Unravel Data がビッグデータのアプリケーション パフォーマンス管理を進化」。データベースのトレンドとアプリケーション。2017 年 3 月 10 日。2017年 9 月 7 日閲覧。
- ^ “DataOpticon - YouTube”. www.youtube.com 。2021年6月28日閲覧。
- ^ “DataOps Summit”. www.dataopssummit-sf.com . 2021年7月2日時点のオリジナルよりアーカイブ。2021年6月28日閲覧。
- ^ Intelligence、Corinium Global。「DataOps Champions Online 2021 | Corinium」。dco -dataops.coriniumintelligence.com 。 2021年6月28日閲覧。
