データジャーナリズム、またはデータ駆動型ジャーナリズム(DDJ)とは、ニュース記事を作成または向上させることを目的として、大規模なデータセットをフィルタリングおよび分析することに基づくジャーナリズムのことである。
データジャーナリズムは、デジタル時代における情報の生成と配信において数値データが果たす役割の増大を反映している。それは、ジャーナリズムとデータ視覚化、コンピュータサイエンス、統計学などの他の分野を融合させたものであり、「異質な分野から引き出された重複する能力のセット」である。[ 1 ]
データジャーナリズムは、いくつかの概念を統合し、ジャーナリズムと結びつけるために広く用いられてきた。これらを、ジャーナリズムのプロセスにおける新技術のより単純な使用からより複雑な使用へと至るレベルや段階と捉える人もいる。[ 2 ]
データ主導型ジャーナリズムの多くは、オープンソースソフトウェア、オープンアクセス出版、オープンデータなどの新たに利用可能になったリソースから始まり、その他は公文書開示請求や漏洩資料から生まれています。このジャーナリズムのアプローチは、特に数十年にわたり主に米国で使用されてきたコンピューター支援報道(CAR)という古い慣習に基づいています。部分的に類似したアプローチの他の名称としては、1972年に出版されたフィリップ・マイヤーの著書[ 3 ]に基づく「精密ジャーナリズム」があり、彼はその中で、記事の調査に社会科学の手法を使用することを提唱しました。データ主導型ジャーナリズムは、より広範なアプローチです。そのプロセスの中核は、オンラインで自由に利用でき、オープンソースツールで分析されるオープンデータの利用可能性の増加に基づいています[ 4 ] 。データ主導型ジャーナリズムは、一般市民や特定のグループまたは個人がパターンを理解し、調査結果に基づいて意思決定を行うのを支援することで、公共サービスのレベルを向上させることを目指しています。このように、データ主導型ジャーナリズムは、ジャーナリストを社会にとって新しい形で重要な役割に位置づけるのに役立つ可能性があります。
データに基づいたストーリーテリングが最優先目標です。データから得られた知見は、あらゆる形式のジャーナリズム記事に変換できます。複雑な状況を明確に理解するために、視覚化を活用できます。さらに、ストーリーテリングの要素を用いることで、ある出来事の影響を受ける人の視点から、調査結果が実際に何を意味するのかを説明できます。データとストーリーのこのつながりは、関連性はあるものの十分に理解されていない出来事と、検証可能で信頼性が高く、関連性があり、記憶に残りやすいストーリーとの間のギャップを埋めようとする「新たな流れ」と捉えることができます。

ベグリスとブラトサスはデータジャーナリズムを「データから有用な情報を抽出し、その情報に基づいて記事を書き、読者がストーリーの重要性を理解したり、自分に関連するデータを特定したりできるように、記事に視覚化(場合によってはインタラクティブ)を埋め込むプロセス」と定義した[ 5 ]。
アントノプロスとカリオタキスは、データジャーナリズムの実践を「ニュース記事へのより深い洞察を提供し、関連データを強調するために、統計の使用と分析によって報道とニュース記事作成を強化する方法」と定義している。ジャーナリズムのデジタル時代のトレンドの1つは、表、グラフ、地図、インフォグラフィック、マイクロサイト、ビジュアルワールドなどのデータ視覚化ツールを介したインタラクティブなオンラインコンテンツを通じて、情報を一般に発信することである。このようなデータセットを詳細に分析することで、関心のある時事問題に関して、より具体的な結果と観察が得られる可能性がある。さらに、データジャーナリズムは、ニュース報道で優先事項ではなかったように見える隠れた問題を明らかにする可能性がある。[ 6 ]
建築家でありマルチメディアジャーナリストでもあるミルコ・ローレンツによれば、データ駆動型ジャーナリズムは主に以下の要素から構成されるワークフローである。データのスクレイピング、クレンジング、構造化によるデータの掘り下げ、特定の情報を抽出することによるフィルタリング、視覚化、そしてストーリーの作成。[ 7 ]このプロセスは、個人の関心事やより広い一般大衆のニーズに応える結果を提供するように拡張することができる。
データジャーナリズムのトレーナー兼ライターであるポール・ブラッドショーは、データ駆動型ジャーナリズムのプロセスを同様の方法で説明しています。まずデータを見つける必要があり、そのためにはMySQLやPythonなどの専門的なスキルが必要になる場合があります。次に、そのデータを分析し、そのためには専門用語や統計の理解が必要となり、最後にオープンソースツールの助けを借りて視覚化および統合します。[ 8 ]
より結果重視の定義は、データレポーター兼ウェブストラテジストのヘンク・ファン・エス(2012)によるものです。[ 9 ]「データ駆動型ジャーナリズムは、オープンツールの有無にかかわらず、大量のデータ(あらゆる形式)を見つけ、処理し、提示するワークフローを通じて、レポーターが語られていないストーリーを伝えたり、新しい視点を見つけたり、ストーリーを完成させたりすることを可能にします。」ファン・エスは、データ駆動型ワークフローの中には、「優れたストーリーテリングの法則に沿わない」製品につながるものもあると主張しています。なぜなら、その結果は問題を説明するのではなく、問題を示すことに重点を置いているからです。「優れたデータ駆動型制作には、さまざまなレイヤーがあります。関連するものにドリルダウンすることで、自分にとって重要なパーソナライズされた情報を見つけることができるだけでなく、全体像を把握するためにズームアウトすることもできます。」
2013年、ヴァン・エスは[ 10 ]で、視覚化そのものを含まないより簡潔な定義を提示した。「データジャーナリズムは、関連する記事を作成する前にツールで処理する必要のあるあらゆるデータに基づいている。視覚化そのものは含まれない。」
しかし、データジャーナリズムを定義する上での問題の一つは、多くの定義が十分に明確ではなく、情報の最適化、分析、視覚化の計算方法の説明に焦点を当てていることである。[ 11 ]
「データジャーナリズム」という用語は、政治評論家のベン・ワッテンバーグが1960年代半ばから始めた活動の中で、物語と統計を重ね合わせることで、アメリカ合衆国が黄金時代に入ったという理論を裏付けたことから生まれた。[ 12 ] [ 13 ]
ジャーナリズムでコンピュータを使用した初期の例の1つは、1952年にCBSがメインフレームコンピュータを使用して大統領選挙の結果を予測しようとした試みに遡りますが、データ分析にコンピュータを使用することがより広く採用され始めたのは1967年になってからです。[ 14 ]
当時デトロイト・フリー・プレス紙に勤務していたフィリップ・マイヤーは、メインフレームコンピュータを用いて、市内に広がる暴動に関する報道の質を向上させた。ジャーナリズムにおけるデータ分析の新たな先例を確立したマイヤーは、ドナルド・バートレット、ジェームズ・スティールと協力し、1970年代のフィラデルフィアにおける有罪判決のパターンを分析した。マイヤーは後に『プレシジョン・ジャーナリズム』という著書を執筆し、データ分析をジャーナリズムに取り入れるためのこれらの手法の活用を提唱した。
1980年代後半になると、コンピュータ支援報道の分野を正式に組織化するのに役立つ重要な出来事が起こり始めました。アトランタ・ジャーナル・コンスティテューションの調査報道記者ビル・デッドマンは、1988年にCAR技術を用いて中所得の黒人居住地域における銀行やその他の住宅ローン貸付業者による人種差別を分析した一連の記事「The Color of Money」で1989年にピューリッツァー賞を受賞しました。 [ 15 ]国立コンピュータ支援報道研究所(NICAR)[ 16 ]は、調査報道記者・編集者協会(IRE)との協力のもと、ミズーリ大学ジャーナリズム学部で設立されました。CARに特化した最初の会議は、NICARがインディアナ大学のジェームズ・ブラウンと共同で1990年に開催しました。NICAR会議はそれ以来毎年開催されており、現在ではデータジャーナリストの最大の集まりとなっています。
データジャーナリズムは、コンピューター支援報道の実践者によって何十年も非公式に使われてきたが、主要な報道機関による最初の記録された使用例は、2009年3月にデータブログを立ち上げたガーディアン紙である。 [ 17 ]また、この用語の起源については議論があるものの、 2010年7月にウィキリークスのアフガニスタン戦争文書が流出して以来、広く使われている。[ 18 ]
ガーディアン紙の戦争記録の報道では、データジャーナリズムのもう一つの一般的な側面であるGoogle Fusion Tablesなどの無料のデータ視覚化ツールが活用された。ガーディアン紙のデータブログ編集者であるサイモン・ロジャースは、データジャーナリズムを次のように説明している[ 19 ] 。
「コメントは自由だが、事実は神聖である」と、ガーディアン紙の編集者C・P・スコットは1921年に書いた。それから90年後、その神聖な事実を公表することが、データジャーナリズムという新たなジャーナリズムの形態となり、急速に主流になりつつある。
調査データジャーナリズムは、データジャーナリズムの分野と調査報道を組み合わせたものです。調査データジャーナリズムの例としては、大量のテキストデータや財務データの調査が挙げられます。調査データジャーナリズムは、大規模データセットの処理のためのビッグデータ分析の分野にも関連しています。 [ 20 ]
この概念が導入されて以来、多くのメディア企業がニュースルーム向けの視覚化を開発する「データチーム」を創設しました。最も注目すべきは、ロイター[ 21 ] 、プロパブリカ[ 22 ]、ラ・ナシオン(アルゼンチン)[ 23 ]などのチームです。ヨーロッパでは、ガーディアン[ 24 ]とベルリナー・モルゲンポスト[ 25 ]、公共放送局に非常に生産性の高いチームがあります。
国会議員の経費スキャンダル(2009年)や「オフショア・リークス」の公開(2013年)といった事例が示すように、データ主導型のジャーナリズムは、時に「あまり公開されていない」 、つまり秘密のデータを扱う調査報道の役割を担うことができる。
毎年開催されるデータジャーナリズム賞[ 26 ]は、データジャーナリズムの分野における優れた報道を表彰するものであり、近年では、2018年のピューリッツァー賞国際報道部門[ 27 ]や2017年のピューリッツァー賞公共サービス部門[ 28 ]など、データ主導のストーリーテリングに対して数多くのピューリッツァー賞が授与されている。
多くの研究者がデータジャーナリズムプロジェクトのさまざまな分類法を提案している。メーガン・ナイトは、データジャーナリズムプロジェクトを作成するために必要な解釈と分析のレベルに基づいた分類法を提案した。具体的には、その分類法には、数値引用、静的マップ、リストとタイムライン、表、グラフとチャート、動的マップ、テキスト分析、インフォグラフィックが含まれる。[ 29 ]
サイモン・ロジャースは、データジャーナリズムプロジェクトを5つのタイプに分類しました。事実のみに基づくもの、データに基づくニュース記事、ローカルデータによるストーリーテリング、分析と背景、そして徹底的な調査です。[ 30 ]マーサ・カンは、7つのタイプのデータストーリーについて議論しました。すなわち、時間の経過に伴う変化を物語る、大きく始めて掘り下げる、小さく始めてズームアウトする、対比を強調する、交差点を探る、要因を分析する、そして外れ値をプロファイリングする、です。[ 31 ]
ベグリスとブラトサスは、情報を視聴者に提示する方法に基づいた別の分類法を提案した。彼らの分類法は階層構造を持ち、以下のタイプが含まれていた。数値のみのデータジャーナリズム記事、表を含む記事、および視覚化(インタラクティブと非インタラクティブ)を含む記事。また、インタラクティブな視覚化を含む記事の場合、伝達型、相談型、会話型の3つの異なるタイプを提案した。[ 32 ]
多くの調査において、入手可能なデータには欠落があったり、誤解を招くような情報が含まれている可能性があります。データ主導型ジャーナリズムの一環として、データ品質を批判的に検証することは重要です。また、データが非公開であったり、分析に適した形式になっていない場合もあります(例えば、PDF形式でしか入手できないなど)。このような場合、データ主導型ジャーナリズムのプロセスは、データ品質に関する記事や、機関によるデータ提供拒否といった問題へと発展する可能性があります。この手法全体がまだ発展途上にあるため、データソース、データセット、データ品質、データ形式の検証は、この作業において同様に重要な部分となります。
事実や出来事の要因をより深く掘り下げるという観点に基づき、メディア戦略の変更が提案されている。この観点では、「注目から信頼へ」という考え方である。メディアビジネスモデルの柱であった注目の創出は、新しい出来事の報道が従来のメディアチャネルよりもTwitterなどの新しいプラットフォームを通じてより速く拡散されることが多いため、その重要性を失っている。一方、信頼は希少な資源と理解できる。ウェブを通じて情報を配信することははるかに容易かつ迅速であるが、提供されている情報が豊富にあるため、あらゆる記事の内容を検証および確認するコストが発生し、機会が生まれる。メディア企業を信頼できるデータハブに変えるという見解は、2011年2月にOwni.eu [ 33 ]とNieman Lab. [ 34 ]で相互公開された記事で説明されている。
生データをストーリーに変換するプロセスは、洗練と変革に似ています。主な目的は、情報を受け取る人が行動に移せる情報を抽出することです。データジャーナリストの役割は、隠された情報を引き出すことです。このアプローチは、金融、健康、環境、その他の公共の利益に関わる分野など、ほぼあらゆる状況に適用できます。
2011年、ポール・ブラッドショーは「データジャーナリズムの逆ピラミッド」と名付けたモデルを発表した。
これを実現するためには、プロセスをいくつかの段階に分割する必要があります。結果に至る手順は異なる場合もありますが、基本的な区分として以下の6つの段階に分けることができます。
データは、 data.gov、data.gov.uk、世界銀行データAPI [ 35 ]などの政府データベースから直接取得できますが、政府機関に情報公開請求を行うことによっても取得できます。一部の請求は、英国の What Do They Know のような Web サイト上で集約されます。データの公開は世界的な傾向ですが、その情報が使用可能な形式で自由に利用できる範囲については国によって異なります。データが Web ページにある場合は、スクレイパーを使用してスプレッドシートを生成します。スクレイパーの例としては、WebScraper、Import.io、QuickCode、OutWit Hub、Needlebase (2012 年にサービス終了[ 36 ] ) などがあります。その他の場合、OCR ソフトウェアを使用して PDF からデータを取得できます。
データは、2012年3月にハンブルクで開催されたデータジャーナリズム会議でヘンク・ファン・エスが示したように、クラウドソーシングを通じて一般の人々によって作成されることもあります。[ 37 ]
通常、データは視覚化しやすい形式ではありません。例えば、データポイントが多すぎたり、行と列の並べ替え方が異なったりします。また、調査したデータセットの多くは、クリーニング、構造化、変換が必要になります。OpenRefine (オープンソース)、Data Wrangler、Google Spreadsheets [ 38 ]などのさまざまなツールを使用すると、データのアップロード、抽出、フォーマットが可能です。
データをグラフやチャートの形で視覚化するには、Many EyesやTableau Publicなどのアプリケーションが利用できます。Yahoo ! PipesやOpen Heat Map [ 39 ]は、データスプレッドシートに基づいてマップを作成できるツールの例です。オプションとプラットフォームの数は拡大しています。Timetric [ 40 ]のように、データの検索、表示、埋め込みのオプションを提供する新しいサービスもあります。
有意義で関連性の高いビジュアライゼーションを作成するために、ジャーナリストはますます多くのツールを活用しています。現在では、何に注目すべきか、どのように行うべきかについての説明が数多く存在します。特に注目すべき記事は以下のとおりです。
2011年現在、canvasタグを使用したHTML5ライブラリの使用が人気を集めています。さまざまな形式でデータをグラフ化できるライブラリが多数存在します。RGraphはその一例です。 [ 43 ] 2011年現在、データを視覚化できるJavaScriptライブラリのリストは増え続けています。[ 44 ]
データやビジュアライゼーションを公開するには、さまざまな方法があります。基本的なアプローチとしては、ウェブ動画を埋め込むように、データを個々の記事に添付する方法があります。より高度な方法では、複数のビジュアライゼーション、記事、データへのリンクを1ページに表示するなど、個別の特集記事を作成できます。多くのコンテンツ管理システムは公開日に基づいて個々の投稿を表示するように設計されているため、このような特集記事は個別にコーディングする必要がある場合がよくあります。
既存データへのアクセスを提供することは、重要性を増しているもう一つの段階です。ウェブサイトを(営利・非営利を問わず)「マーケットプレイス」と考え、データセットを他の人が容易に見つけられるようにすることが重要です。特に、オープンデータから得られた記事の知見については、ジャーナリストは使用したデータへのリンクを提供し、他の人が調査できるようにすべきです(これにより、新たな調査サイクルが始まり、新たな知見につながる可能性があります)。
データへのアクセスを提供し、グループがどのような情報を抽出できるかを議論できるようにすることが、Buzzdata [ 45 ]の主なアイデアです。このサイトは、共有やフォローなどのソーシャルメディアの概念を使用して、データ調査のためのコミュニティを作成します。
その他のプラットフォーム(データの収集と配信の両方に使用可能):
プロセスの最終段階は、データセットまたは視覚化がどのくらいの頻度で閲覧されているかを測定することです。
データ駆動型ジャーナリズムの文脈では、ユーザーデータの収集やマーケティング目的、またはユーザーの制御を超えたその他の用途に使用できるその他の情報の収集など、そのような追跡の範囲は問題視されるべきである。使用状況を測定するための新しい非侵入的なオプションの1つは、PixelPingと呼ばれる軽量トラッカーである。このトラッカーは、 ProPublicaとDocumentCloudのプロジェクトの成果である。[ 49 ]データ収集のための対応するサービスがある。このソフトウェアはオープンソースであり、GitHubからダウンロードできる。[ 50 ]
データ駆動型ジャーナリズムの応用例は増え続けている。この分野の先駆的なメディア企業の1つであるガーディアン紙(「ガーディアン紙のデータジャーナリズム:それは何で、どのように行っているのか?」 [ 51 ]を参照)は、データ記事の広範なリストをまとめている。「すべてのデータジャーナリズムを1つのスプレッドシートにまとめた」[ 52 ]を参照。
データ駆動型ジャーナリズムのその他の顕著な使用例としては、内部告発組織WikiLeaksによるアフガニスタン戦争日誌の公開が挙げられます。これは、2004年から2010年までのアフガニスタン戦争を網羅した91,000件の秘密軍事報告書をまとめたものです。[ 53 ]世界的な大手新聞3紙、すなわちガーディアン、ニューヨーク・タイムズ、デア・シュピーゲルは、これらの文書に広範囲にわたるセクションを設けました。 [ 54 ] [ 55 ] [ 56 ]ガーディアンの報道には、16,000件のIED攻撃の種類、場所、および死傷者を示すインタラクティブマップが含まれていました。[ 57 ]ニューヨーク・タイムズは、下線付きテキストにマウスカーソルを合わせると軍事用語の説明が表示されるレポートを掲載しました。[ 58 ]一方、デア・シュピーゲルは、反乱軍の爆弾攻撃に関連する死者数などのトピックについて、グラフとマップの両方を含むハイブリッドな視覚化を提供しました。[ 59 ]イラク戦争のログ公開に際し、ガーディアン紙はGoogle Fusion Tablesを使用して、死者が出たすべての事件のインタラクティブマップを作成しました。[ 60 ]同紙は2011年のイングランド暴動でもこの手法を再び使用しました。[ 61 ]