データ分析とは、有用な情報を発見し、結論を導き出し、 意思決定を 支援することを目的として、データを検査、 クレンジング 、変換 、モデリングする プロセスです。[ 1 ] データ分析には、さまざまな名前で呼ばれる多様な手法を含む、複数の側面とアプローチがあり、さまざまなビジネス、科学、社会科学の領域で使用されています。[ 2 ] 今日のビジネスの世界では、データ分析は意思決定をより科学的にし、企業がより効果的に運営する上で重要な役割を果たしています。[ 3 ] ビジネス分析 、ヘルスケア、人工知能などの分野で、データから有意義な洞察を抽出するために広く使用されています。
データマイニングは 、純粋に記述的な目的ではなく、予測的な目的で統計モデリングと知識発見に焦点を当てた特定のデータ分析手法です。一方、ビジネスインテリジェンスは 、主にビジネス情報に焦点を当て、集計に大きく依存するデータ分析をカバーします。統計アプリケーションでは、データ分析は、記述統計 、探索的データ分析 (EDA)、および確認的データ分析 (CDA)に分類できます。[ 4 ] EDAはデータ内の新しい特徴の発見に焦点を当て、CDAは既存の仮説の 確認または反証に焦点を当てます。[ 5 ] 予測分析は 、予測予測または分類のための統計モデルの適用に焦点を当て、テキスト分析は、さまざまな 非構造化データ であるテキストソースから情報を抽出および分類するために、統計的、言語的、および構造的手法を適用します。上記のすべては、データ分析のさまざまな種類です。[ 6 ]
データ分析プロセス Schutt & O'Neil著『Doing Data Science』 (2013年)より、データサイエンスのプロセスフローチャート データ分析とは、 生データ を取得し、それをユーザーの意思決定に役立つ情報に変換するプロセス である。 [ 1 ] 統計学者のジョン・テューキーは 、1961年にデータ分析を次のように定義した。
「データの分析手順、そのような手順の結果を解釈する技術、データの分析をより容易に、より正確に、またはより精密にするためのデータ収集の計画方法、およびデータの分析に適用される(数学的)統計のすべての仕組みと結果。」[ 7 ]
いくつかの段階があり、それらは反復的 であり、後の段階からのフィードバックによって、前の段階で追加の作業が必要になる場合があります。[ 8 ]
データ要件 データは分析への入力として必要であり、分析の指示者(または分析の最終成果物を使用する顧客)の要件に基づいて指定されます。[ 9 ] データが収集されるエンティティの一般的なタイプは、実験単位 (例:個人または人々の集団)と呼ばれます。集団に関する特定の変数(例:年齢と収入)を指定して取得することができます。データは数値またはカテゴリ(つまり、数値のテキストラベル)である可能性があります。[ 8 ]
データクリーニング 処理および整理されたデータは、不完全であったり、重複を含んでいたり、エラーを含んでいたりする可能性があります。[ 12 ] データクリーニング の必要性は、データの入力および保存方法の問題から生じます。[ 12 ] [ 13 ] データクリーニングは、これらのエラーを防止および修正するプロセスです。一般的なタスクには、レコードのマッチング、データの不正確さの特定、既存データの全体的な品質、重複排除、および列の分割が含まれます。[ 14 ] [ 15 ]
このようなデータの問題も、さまざまな分析手法によって特定できます。たとえば、財務情報の場合、特定の変数の合計を、信頼できると考えられる別途公開された数値と比較することができます。[ 16 ] 事前に設定されたしきい値を超える、または下回る異常な金額も確認することができます。データセット内のデータの種類に応じて、いくつかの種類のデータクリーニングがあります。これは、電話番号、電子メールアドレス、雇用主、またはその他の値である可能性があります。[ 17 ] 外れ値検出のための定量的データ手法を使用して、誤って入力された可能性が高いと思われるデータを取り除くことができます。テキストデータのスペルチェッカーを使用して、入力ミスの単語の数を減らすことができます。ただし、単語が文脈的に(つまり、意味的に、慣用的に)正しいかどうかを判断するのは困難です。
データモデリング 変数間の関係を特定するために、数式 または数理モデル( アルゴリズム によってサポートされる)をデータに適用することができます。たとえば、相関関係を確認したり、 因果 関係の有無を判断したりすることができます。一般的に、モデルは、データセットに含まれる他の変数に基づいて特定の変数を評価するように開発できますが、実装されたモデルの精度に応じて、ある程度の残差誤差が 生じます(例 :データ = モデル + 誤差)。[ 21 ]
推測統計学は、 特定の変数間の関係を測定する手法を利用します。[ 22 ] 例えば、回帰分析は 、広告の変化(独立変数 X )が売上の変動( 従属変数 Y )を説明できるかどうか、つまり Y が X の関数であるかどうかをモデル化するために使用できます。これは ( Y = aX + b + error )と表すことができ、モデルは、モデルがX の特定の範囲の値に対してY を 予測するときに、( a ) と ( b ) が誤差を最小化するように設計されます。[ 23 ]
データ製品 データ製品とは、 データ入力を 受け取り、出力を 生成して環境にフィードバックするコンピュータアプリケーションです。 [ 24 ] これはモデルまたはアルゴリズムに基づいている場合があります。たとえば、顧客の購入履歴に関するデータを分析し、その結果を使用して顧客が気に入る可能性のある他の購入を推奨するアプリケーションなどです。[ 25 ] [ 8 ]
コミュニケーション データ視覚化 は、データ分析後の結果を理解するのに役立つ。[ 26 ] データが分析されると、分析結果の利用者の要件をサポートするために、さまざまな形式で提示される可能性があります。[ 27 ] 利用者からのフィードバックによって、追加の分析が行われる場合があります。
結果を伝える方法を決定する際、アナリストは、メッセージをより明確かつ効率的に聴衆に伝えるために、さまざまなデータ視覚化手法の実装を検討する場合があります。データ視覚化は、情報表示 (表やグラフなどのグラフィック)を使用して、データに含まれる重要なメッセージを伝えるのに役立ちます。表は 、ユーザーが特定の数値を照会して焦点を当てることができるため、貴重なツールです。一方、グラフ(棒グラフや折れ線グラフなど)は、データに含まれる定量的なメッセージを説明するのに役立ちます。[ 28 ]
定量的なメッセージ 米国の連邦政府支出と歳入の経時的な推移を示す折れ線グラフで表した時系列データ 2つの変数(インフレ率と失業率)の相関関係をある時点において示した散布図 スティーブン・フューは、 関連するグラフを含め、ユーザーがデータセットから伝えようとする可能性のある8種類の定量的メッセージについて説明した。[ 29 ] [ 30 ]
時系列データ:1つの変数を一定期間にわたって捉えたもので、例えば10年間の失業率などが挙げられます。傾向を示すために折れ線グラフが用いられることがあります。 ランキング: カテゴリ区分は昇順または降順にランク付けされます。たとえば、ある期間における営業担当者 (カテゴリ 、各営業担当者はカテゴリ区分) ごとの販売実績 ( 指標) のランキングなどです。 棒グラフ を使用して、営業担当者間の比較を示すことができます。[ 31 ] 部分対全体:カテゴリ別細分化は全体に対する比率(つまり、100%に対する割合)として測定されます。円グラフ や棒グラフは、市場における競合他社の市場シェアなど、比率の比較を示すことができます。[ 32 ] 偏差:カテゴリ別の細分化は、基準値と比較されます。たとえば、特定の期間における企業の複数の部門の実際の支出と予算支出の比較などです。棒グラフは、実際の金額と基準値の比較を示すことができます。[ 33 ] 度数分布:特定の変数について、与えられた期間における観測値の数を示します。例えば、株式市場のリターンが0~10%、11~20%などの区間内にある年数などです。この分析には、棒グラフの一種であるヒストグラムが使用されることがあります。 相関:2つの変数(X、Y)で表される観測値を比較して、それらが同じ方向または反対方向に動く傾向があるかどうかを判断する。たとえば、数ヶ月のサンプルにおける失業率(X)とインフレ率(Y)をプロットする。このメッセージには通常、散布図 が使用される。[ 34 ] 名義比較:製品コード別の販売量など、特定の順序なしにカテゴリの細分化を比較します。この比較には棒グラフを使用できます。[ 35 ] 地理的または地理空間的: 地図やレイアウト上で変数を比較すること。例えば、州別の失業率や建物の各階の人数など。通常はカルトグラム が使用される。[ 29 ]
金融における定量的データの分析 著者ジョナサン・クーミーは 、定量的データを理解するための一連のベストプラクティスを推奨しています。これらには以下が含まれます。[ 16 ]
分析を実行する前に、生データに異常がないか確認してください。 数式に基づいて生成されるデータ列の検証など、重要な計算を再実行する。 合計金額が小計の合計であることを確認してください。 時間の経過に伴う比率など、予測可能な形で関連しているはずの数値間の関係性を確認する。 比較を容易にするために数値を正規化する。例えば、一人当たりの金額、GDPに対する比率、または基準年に対する指数値として分析する。 デュポン分析 のように、結果につながった要因を分析することで、問題を構成要素に分解する。分析者は、調査対象の変数について、平均、中央値 、標準偏差などの 記述統計量を取得するのが一般的です。また、主要変数の 分布 を分析して、個々の値が平均値の周りにどのように集まっているかを確認することもあります。 [ 16 ]
データ分析に用いられるMECE原理 の図解 マッキンゼー・アンド・カンパニーは、 定量的な問題を構成要素に分解する手法をMECE原則 と名付けました。MECEとは「相互排他的かつ網羅的」という意味です。[ 36 ] 各層は構成要素に分解でき、各サブコンポーネントは互いに排他的でなければならず、それらを 合計すると 上位の層になります。たとえば、利益は定義上、総収入と総費用に分解できます。[ 37 ]
アナリストは、特定の分析問題を解決するために、堅牢な統計的測定法を使用する場合があります。 仮説検定は 、アナリストが実際の状況について特定の仮説を立て、その仮説が真か偽かを判断するためにデータを収集する場合に使用されます。[ 38 ] 例えば、「失業はインフレに影響を与えない」という仮説は、フィリップス曲線 と呼ばれる経済学の概念に関連しています。[ 39 ] 仮説検定では、データが仮説の受容または棄却を支持するかどうかに関連する、第一種過誤と第二種過誤 の可能性を考慮する必要があります。[ 40 ]
回帰分析は、 独立変数Xが従属変数Yにどの程度影響を与えるかを分析者が判断しようとする場合に使用されることがあります(例:「失業率(X)の変化はインフレ率(Y)にどの程度影響するか?」)。[ 41 ]
必要条件分析 (NCA) は、独立変数 X が変数 Y をどの程度許容するかを分析者が判断しようとする場合に使用できます (例: 「特定の失業率 (X) は、特定のインフレ率 (Y) に対してどの程度必要か?」)。[ 41 ] (重) 回帰分析では、各 X 変数が結果を生み出すことができ、X が互いに補償できる (十分条件ではあるが、必要条件ではない) という加法論理を使用するのに対し、[ 42 ] 必要条件分析 (NCA) では、1 つ以上の X 変数が結果の存在を可能にするが、結果を生み出すとは限らない (必要条件ではあるが、十分条件ではない) という必要性論理を使用します。各必要条件は必ず存在しなければならず、補償は不可能です。[ 43 ]
データ利用者の分析活動 データ可視化ユーザーの分析活動 ユーザーは、上記で概説した一般的なメッセージングとは対照的に、データセット内の特定のデータポイントに関心を持つ場合があります。このような低レベルの分析活動は、次の表に示されています。分類体系は、値の取得、データポイントの検索、データポイントの配置という 3 つの活動の極によって整理することもできます。[ 44 ] [ 45 ] [ 46 ]
効果的な分析を阻害する要因 効果的な分析を妨げる障壁は、データ分析を行うアナリストの間、あるいは聴衆の間に存在する可能性がある。事実と意見の区別、認知バイアス、数的理解力の欠如はすべて、健全なデータ分析に対する課題である。[ 47 ]
事実と意見の混同 あなたは自分の意見を持つ権利はあるが、自分だけの事実を持つ権利はない。
効果的な分析には、質問に答えたり、結論や正式な意見 を裏付けたり、仮説を検証したりするための関連 事実の 入手が必要です。[ 48 ] 事実は定義上反論不可能であり、分析に関与する人は誰でもそれについて合意できるはずです。上場企業の監査人は、上場企業の財務諸表が「すべての重要な点で公正に表示されている」かどうかについて正式な意見を述べなければなりません。[ 49 ] これには、意見を裏付ける事実データと証拠の広範な分析が必要です。
数的理解力の欠如 有能なアナリストは一般的にさまざまな数値的手法に精通しています。しかし、聴衆はそのような数字や計算能力 を持ち合わせていない可能性があり、彼らは計算が苦手であると言われています。[ 55 ] データを伝える人が、意図的に不適切な数値的手法を用いて、誤解を招いたり誤った情報を伝えようとしている場合もあります。[ 56 ]
例えば、数値が上昇しているか下降しているかは、重要な要因ではないかもしれません。より重要なのは、別の数値に対する数値の比率、例えば、政府の歳入や歳出の規模と経済規模(GDP)の比率、あるいは企業の財務諸表におけるコストと収益の比率などです。[ 57 ]この数値的手法は、正規化 [ 16 ] または共通規模化と呼ばれます。アナリストは、インフレ調整(つまり、実質データと名目データの比較)や人口増加、人口統計などを考慮するなど、このような手法を数多く用いています。[ 58 ]
アナリストは、さまざまな仮定やシナリオに基づいてデータを分析することもあります。たとえば、アナリストが財務諸表分析を 行う場合、将来のキャッシュフローの見積もりを得るために、さまざまな仮定に基づいて財務諸表を再構成することがよくあります。そして、その見積もりを一定の金利に基づいて現在価値に割り引いて、企業やその株式の評価を決定します。[ 59 ] 同様に、CBOはさまざまな政策オプションが政府の歳入、歳出、赤字に与える影響を分析し、主要な指標について代替的な将来シナリオを作成します。[ 60 ]
その他の用途
分析とビジネスインテリジェンス アナリティクスとは、「意思決定と行動を促進するために、データ、統計的および定量的分析、説明モデルおよび予測モデル、事実に基づく管理を幅広く利用すること」です。これはビジネスインテリジェンス のサブセットであり、ビジネスインテリジェンスとは、データを使用してビジネスパフォーマンスを理解および分析し、意思決定を促進する一連のテクノロジーとプロセスです。[ 61 ]
教育 教育分野 では、ほとんどの教育者が生徒のデータを分析するためのデータシステム にアクセスできます。 [ 62 ] これらのデータシステムは、教育者のデータ分析の精度を向上させるために、市販のデータ 形式(ラベル、補足資料、ヘルプシステムを埋め込み、主要なパッケージ/表示およびコンテンツの決定を行う)で教育者にデータを提供します。[ 63 ]
施術者向けメモ このセクションには、実務家にとって役立つかもしれないが、ウィキペディアの記事の一般的な範囲を超える、やや技術的な説明が含まれています。[ 64 ]
初期データ分析 初期データ分析フェーズと主要分析フェーズの最も重要な違いは、初期データ分析では、元の研究課題に答えることを目的とした分析を一切行わないことである。初期データ分析フェーズは、次の4つの質問によって導かれる。
データの品質 データの品質はできるだけ早い段階で確認する必要があります。データの品質は、度数カウント、記述統計(平均、標準偏差、中央値)、正規性(歪度、尖度、度数ヒストグラム)、正規代入 など、さまざまな種類の分析を使用して、いくつかの方法で評価できます。[ 66 ]
極端な観測値 の分析:データ内の外れ値を分析し、それらが分布を乱しているように見えるかどうかを確認します。[ 67 ] コーディング方式の相違点の比較と修正:変数はデータセット外の変数のコーディング方式と比較され、コーディング方式が比較できない場合は修正される可能性がある。[ 68 ] 共通方法の分散 を検定する。初期データ分析段階でデータ品質を評価するための分析の選択は、主要分析段階で実施される分析に依存する。
測定の質 測定機器 の品質は、それが研究の焦点や研究課題ではない初期データ分析段階でのみ確認されるべきである。[ 70 ] 測定機器の構造が文献で報告されている構造と一致するかどうかを確認する必要がある。
測定品質を評価する方法は2つあります。
データと測定の質を評価した後、欠損データを補完したり、1 つ以上の変数の初期変換を実行したりすることを決定する場合がありますが、これはメイン分析フェーズ中にも実行できます。 変数の可能な変換は次のとおりです。[ 74 ]
平方根変換(分布が正規分布からやや異なる場合) 対数変換(分布が正規分布と大きく異なる場合) 逆変換(分布が正規分布から大きく異なる場合) (分布が正規分布から大きく異なり、変換しても改善しない場合は)カテゴリ変数(順序変数/二値変数)に変換する。
研究の実施は、研究計画の意図を十分に満たしていたか?ランダム化 手順の成功を確認するには、例えば、背景変数と実質変数がグループ内およびグループ間で均等に分布しているかどうかを確認する必要があります。研究でランダム化手順が必要なかった、または使用しなかった場合は、非ランダムサンプリングの成功を確認するには、例えば、対象となる母集団のすべてのサブグループがサンプルに代表されているかどうかを確認する必要があります。[ 75 ] その他に確認すべきデータ歪みの可能性としては、次のものがあります。
脱落者 (これは初期データ分析段階で特定されるべきである)項目無回答 (これがランダムなものか否かは、初期データ分析段階で評価する必要がある) 治療の質(操作チェック を使用)。
データサンプルの特性 報告書や論文では、サンプルの構造を正確に記述する必要があります。特に、主要分析段階でサブグループ分析を実施する場合は、サブグループのサイズを正確に決定することが重要です。[ 77 ] データサンプルの特性は、以下の点から評価できます。
重要な変数の基本統計 散布図 相関関係と関連性 クロス集計
初期データ分析の最終段階 最終段階では、初期データ分析の結果を文書化し、必要かつ望ましい、そして可能な是正措置を講じます。また、主要データ分析の当初の計画をより詳細に規定したり、書き直したりすることも可能ですし、そうすべきです。そのためには、主要データ分析に関していくつかの決定を下す必要があります。
非正規分布 の場合:変数を変換す べきか?変数をカテゴリ変数(順序尺度/二値変数)にするべきか?分析方法を調整すべきか?欠損データ がある場合:欠損データを無視すべきか、それとも補完すべきか?また、どの補完手法を用いるべきか?外れ値 が存在する場合、ロバストな分析手法を用いるべきでしょうか?項目が尺度に適合しない場合、項目を削除して測定機器を調整すべきでしょうか、それとも他の(使用方法の)測定機器との比較可能性を確保すべきでしょうか? (小さすぎる)サブグループの場合:グループ間の違いに関する仮説を放棄すべきか、それとも正確検定やブートストラップ法 などの小標本解析手法を用いるべきか? ランダム化 手順に欠陥があると思われる場合、傾向スコア を計算して、それを主要解析の共変量として含めることは可能であり、またそうすべきでしょうか?
分析 初期データ分析段階では、いくつかの分析を利用できます。
単変量統計(単一変数) 二変量間の関連性(相関関係) グラフ技法(散布図) 分析においては変数の測定レベルを考慮することが重要であり、各レベルには特別な統計的手法が利用可能である。
名義変数と順序変数 頻度集計(数値とパーセンテージ) 協会 周回調査(クロス集計) 階層的対数線形分析(最大8変数まで) 対数線形分析(関連性の高い/重要な変数および潜在的な交絡因子を特定するため) 厳密な検定、またはブートストラップ法(サブグループが小さい場合) 新しい変数の計算 連続変数 分布 統計量(平均値、標準偏差、分散、歪度、尖度) 幹葉図 箱ひげ図
主なデータ分析 主要分析段階では、研究課題に答えることを目的とした分析と、研究報告書の初稿を作成するために必要なその他の関連分析が実施されます。
結果の安定性 結果の一般化可能性について何らかの指標を得ることが重要です。これは確認するのが難しい場合が多いですが、結果の安定性を調べることができます。結果は信頼性があり、再現性がありますか? それを行う主な方法は 2 つあります。
データ分析用の無料ソフトウェア データ分析のための無料ソフトウェアには以下が含まれます。
再現性のある分析 一般的なデータ分析ワークフローは、データの収集、分析の実行、可視化の作成、レポートの作成という流れで進みます。しかし、このワークフローには、分析スクリプトとデータの分離、分析とドキュメントのギャップといった課題があります。多くの場合、スクリプトの正しい実行順序は非公式に説明されるか、データサイエンティストの記憶に頼っているだけです。こうした情報が失われる可能性は、再現性の問題につながります。
これらの課題に対処するには、分析スクリプトの内容とワークフローを文書化することが不可欠です。さらに、全体的な文書化も重要であり、機械と人間の両方が理解できるレポートを提供すること、そしてスクリプトが進化しても分析ワークフローを正確に表現することを保証することも重要です。[ 96 ]
データ分析コンテスト さまざまな企業や団体が、研究者が自社のデータを活用したり、データ分析を用いて特定の問題を解決したりすることを奨励するために、データ分析コンテストを開催しています。よく知られている国際的なデータ分析コンテストの例をいくつか挙げます。
参考文献
引用文献 1 2 「非構造化データを有用な情報に変換する」、ビッグデータ、マイニング、および分析 、Auerbach Publications、2014年3月12日、pp. 227–246 、doi : 10.1201/b16666-14、ISBN 978-0-429-09529-0 2021年5月29日 取得 ↑ 「相関関数の多面性」 、 『物理科学者のためのデータ分析手法』 、ケンブリッジ大学出版局、2017年、 526~ 576ページ、 doi : 10.1017/9781108241922.013 、 ISBN 978-1-108-41678-8 2021年5月29日 取得↑ Xia, BS, & Gong, P. (2015). データ分析によるビジネス インテリジェンスのレビュー。Benchmarking、 21 ( 2)、300-311。doi : 10.1108/BIJ-08-2012-0050 ↑ 「データコーディングと探索的分析(EDA)データコーディングのルール探索的データ分析(EDA)統計的仮定」 、 SPSS中級統計、Routledge、2004年8月16日、 42~ 67 ページ、 doi : 10.4324/9781410611420-6 、 ISBN 978-1-4106-1142-0 2021年5月29日 取得↑ サマンダール、ピーターソン;ソフィア・スヴァンテッソン (2017)。 Skapandet av förtroende inom eWOM : En Study av profilbildens effekt ur ett könsperspektiv . Högskolan i Gävle、Företagsekonomi。 OCLC 1233454128 。 ↑ Goodnight, James (2011-01-13). "予測分析の予測: 熱く、さらに熱くなっている" . Statistical Analysis and Data Mining: The ASA Data Science Journal . 4 (1): 9– 10. doi : 10.1002/sam.10106 . ISSN 1932-1864 . S2CID 38571193 . ↑ Tukey, John W. (1962 年 3 月). "John Tukey - データ分析の未来 - 1961 年 7 月" . The Annals of Mathematical Statistics . 33 (1): 1– 67. doi : 10.1214/aoms/1177704711 . 2020 年 1 月 26 日にオリジナルから アーカイブ済み。2015 年 1 月 1 日 に取得 。 1 2 3 4 5 6 Schutt, Rachel; O'Neil, Cathy (2013). Doing Data Science . O'Reilly Media . ISBN 978-1-449-35865-5 。↑ 「データの利用」 、 『石油製品分析ハンドブック 』 、ニュージャージー州ホーボーケン:ジョン・ワイリー・アンド・サンズ社、2015年2月6日、 296~ 303ページ、 doi : 10.1002/9781118986370.ch18 、 ISBN 978-1-118-98637-0 2021年5月29日 取得↑ オルソラ、ジョンソン・アデジ。ショーテ、アデボラ・アデクンル。ウィグマヌ、アブデラ。イサイファン、リマ・J(2021年5月7日)。 「表 1: この調査のために収集されたデータの種類とソース」 。 ピアJ 。 9 : e11387。 土井 : 10.7717/peerj.11387/table-1 。 ↑ MacPherson, Derek (2019-10-16)、 「Information Technology Analysts' Perspectives」 、 Data Strategy in Colleges and Universities 、Routledge、pp. 168–183 、 doi : 10.4324/9780429437564-12 、 ISBN 978-0-429-43756-4 S2CID 211738958、取得日 :2021年5月29日 1 2 Bohannon, John (2016-02-24). 「多くの調査、約5件に1件は不正なデータを含む可能性がある」 Science . doi : 10.1126 /science.aaf4104 . ISSN 0036-8075 . ↑ Hancock, RGV; Carter, Tristan (2010年2月) 「公表されている考古学的分析はどの程度信頼できるか?分析技術が時代を経て黒曜石の元素分析に及ぼす影響」 . Journal of Archaeological Science . 37 (2): 243– 250. Bibcode : 2010JArSc..37..243H . doi : 10.1016/j.jas.2009.10.004 . ISSN 0305-4403 . ↑ 「データクリーニング」 。マイクロソフトリサーチ。 2013年10月29日時点のオリジナルから アーカイブ 。 2013年 10月26日 取得。 ↑ Hellerstein, Joseph (2008年2月27日). 「大規模データベースのための定量的データクリーニング」 (PDF) . EECSコンピュータサイエンス部門 : 3. 2013年10月13日のオリジナルから アーカイブ (PDF) 。 2013年 10月26日 取得 。 1 2 3 4 「知覚のエッジ - ジョナサン・クーミー - 定量的データを理解するためのベストプラクティス - 2006 年 2 月 14 日」 (PDF) 。2014 年 10 月 5 日にオリジナルから アーカイブ (PDF) 。2014 年 11 月 12 日 に取得 。 ↑ Peleg, Roni; Avdalimov, Angelika; Freud, Tamar (2011-03-23). "患者に携帯電話番号とメールアドレスを提供する:医師の視点" . BMC Research Notes . 4 (1): 76. doi : 10.1186/1756-0500-4-76 . ISSN 1756-0500 . PMC 3076270 . PMID 21426591 . ↑ 「FTCが追加データを要求」 。 ポンプ 業界アナリスト 。 1999年 (48):12。1999年12月。doi : 10.1016 / s1359-6128(99)90509-8。ISSN 1359-6128 。 ↑ 「データ視覚化と記述統計によるデータの探索:定量的データのための一般的な記述統計」 . 2017. doi : 10.4135/9781529732795 . ↑ マレー、ダニエル G. (2013). Tableau your data! : Tableau Software による高速で簡単なビジュアル分析 . J. Wiley & Sons. ISBN 978-1-118-61204-0 OCLC 873810654 ↑ Evans, Michelle V.; Dallas, Tad A.; Han, Barbara A.; Murdock, Courtney C.; Drake, John M. (2017年2月28日). Brady, Oliver (編). "図2. 25モデルの平均による順列による変数重要度" . eLife . 6 : e22053. doi : 10.7554/elife.22053.004 . ↑ Watson, Kevin; Halperin, Israel; Aguilera-Castells, Joan; Iacono, Antonio Dello (2020年11月12日). "表3:自己選択条件と事前決定条件間の全変数の記述統計(平均±標準偏差)、推論統計(95%信頼区間)、および定性統計(ES)" . PeerJ . 8 : e10361. doi : 10.7717/peerj.10361/table-3 . ↑ Nwabueze, JC (2008-05-21). "独立変数が正規分布に従う場合の、自己相関誤差項を持つ線形モデルの推定量の性能" . Journal of the Nigerian Association of Mathematical Physics . 9 (1). doi : 10.4314/jonamp.v9i1.40071 . ISSN 1116-4336 . ↑ Conway, Steve (2012-07-04). "ソーシャルネットワーク分析におけるデータ入力と視覚出力に関する注意点" . British Journal of Management . 25 (1): 102–117 . doi : 10.1111/j.1467-8551.2012.00835.x . hdl : 2381/36068 . ISSN 1045-3172 . S2CID 154347514 . ↑ 「顧客購入およびその他の反復イベント」 、 SQLとExcel®を使用したデータ分析 、インディアナ州インディアナポリス:John Wiley & Sons, Inc.、2016年1月29日、pp. 367–420 、 doi : 10.1002/9781119183419.ch8 、 ISBN 978-1-119-18341-9 2021年5月31日 取得↑ グランジャン、マーティン (2014)。 「La connaissance est un réseau」 (PDF) 。 レ・カイエ・デュ・ヌメリク 。 10 (3): 37–54 . 土井 : 10.3166/lcn.10.3.37-54 。 2015 年 9 月 27 日にオリジナルから アーカイブ (PDF)されました 。 2015 年 5 月 5 日 に取得 。 ↑ 半導体ダイのデータ要件。データ交換フォーマットとデータ辞書 、BSI英国規格、 doi : 10.3403/02271298 、 2021年5月31日 取得 ↑ 英国の博物館に関する データの可視化:棒グラフ、折れ線グラフ、ヒートマップ 。 2021年。doi : 10.4135 /9781529768749。ISBN 9781529768749 . S2CID 240967380 . 1 2 「Stephen Few - Perceptual Edge - Selecting the Right Graph for Your Message - 2004」 (PDF) 。 2014年10月5日にオリジナルから アーカイブ済み (PDF) 。 2014年10月29日 に取得 。 ↑ 「Stephen Few-知覚エッジグラフ選択行列」 (PDF) 。 2014年10月5日のオリジナルから アーカイブ (PDF) 。 2014年10月29日 取得 。 ↑ Swamidass, PM (2000). "Xバーチャート". 生産・製造管理百科事典 . p. 841. doi : 10.1007/1-4020-0612-8_1063 . ISBN 978-0-7923-8630-8 。↑ 「図表C5.3. 労働市場における状況別、教育を受けていない15~19歳の割合(2012年)」 。 doi : 10.1787/888933119055。 2021年6月3日 取得 。 ↑ 「図表7:家計:最終消費支出と実際の個人消費」 。doi : 10.1787 /665527077310。 2021年6月3日 取得 。 ↑ Garnier, Elodie M.; Fouret, Nastasia; Descoins, Médéric (2020年2月3日). "表2:散布図、バイオリン+散布図、ヒートマップ、ViSiElseグラフのグラフ比較" . PeerJ . 8 : e8341. doi : 10.7717/peerj.8341/table-2 . ↑ 「製品比較表:ウェアラブル」 。PsycEXTRA データセット 。2009年。doi : 10.1037 /e539162010-006 。 2021年6月3日 取得。 ↑ 「マッキンゼー・アンド・カンパニーに雇用されているコンサルタント」 、 組織行動学5 、ラウトレッジ、2008年7月30日、 77~ 82 ページ、 doi : 10.4324/9781315701974-15 、 ISBN 978-1-315-70197-4 2021年6月3日 取得↑ キャリー 、マラキー(1981 年11月 ) 。 「 需要関数の相互排他的かつ網羅的な性質について」 。Economica。48 ( 192 ) : 407–415。doi : 10.2307 /2553697。ISSN 0013-0427。JSTOR 2553697 。 ↑ Heckman (1978). "離散パネルデータのための単純な統計モデルの開発と適用により、真の状態依存性の仮説と偽の状態依存性の仮説を検証" . Annales de l'inséé (30/31): 227– 269. doi : 10.2307/20075292 . ISSN 0019-0209 . JSTOR 20075292 . ↑ Munday, Stephen CR (1996), "Unemployment, Inflation and the Phillips Curve" , Current Developments in Economics , London: Macmillan Education UK, pp. 186–218 , doi : 10.1007/978-1-349-24986-2_11 , ISBN 978-0-333-64444-7 2021年6月3日 取得↑ Louangrath, Paul I. (2013). "仮説検定におけるタイプIおよびタイプII推論エラーの判定のためのアルファ検定とベータ検定" . SSRN電子ジャーナル . doi : 10.2139/ssrn.2332756 . ISSN 1556-5068 . 1 2 Yanamandra, Venkataramana (2015 年 9 月) 「インドにおける為替レート変動とインフレ:輸入への為替レートパススルーの程度はどの程度か?」 . Economic Analysis and Policy . 47 : 57– 68. doi : 10.1016/j.eap.2015.07.004 . ISSN 0313-5926 . ↑ ファインマン、ジェーン。 「エンジニアとジャーナリストはどのように互いに助け合えるのか?」 (ビデオ)。工学技術研究所。doi : 10.1049 /iet-tv.48.859 。 2021年6月3日 取得。 ↑ Dul, Jan (2015). "必要条件分析 (NCA): '必要だが十分ではない'因果関係の論理と方法論' . SSRN 電子ジャーナル . doi : 10.2139/ssrn.2588480 . hdl : 1765/77890 . ISSN 1556-5068 . S2CID 219380122 . ↑ Robert Amar、James Eagan、John Stasko (2005)「情報視覚化における分析活動の低レベルコンポーネント」Wayback Machine に2015年2月13日に アーカイブ済み ↑ ウィリアム・ニューマン (1994)「プロフォーマ抄録を用いたHCI研究成果の予備的分析」 2016年3月3日にWayback Machine に アーカイブ済み ↑ Mary Shaw (2002)「ソフトウェアエンジニアリングにおける優れた研究とは何か?」Wayback Machine に2018年11月5日に アーカイブ済み ↑ 「接続ツールはデータベースと統計製品間でデータを転送します」 。 計算 統計学とデータ分析 。8 ( 2):224。1989年7月。doi : 10.1016 / 0167-9473(89)90021-2。ISSN 0167-9473 。 ↑ 「仕事に関連する情報」 、 効果的な管理のための情報入手、Routledge、2007年7月11日、 48~ 54 ページ、 doi : 10.4324/9780080544304-16 (2025年7月1日非アクティブ)、 ISBN 978-0-08-054430-4 2021年6月3日 取得{{citation}}: CS1メンテナンス: DOIは2025年7月現在非アクティブです(リンク)↑ ゴードン、ロジャー(1990年3月) 「上場企業は公益のために行動しているのか?」 。 全米 経済研究所ワーキングペーパー 。マサチューセッツ州ケンブリッジ。doi : 10.3386/w3303 。 ↑ Rivard, Jillian R (2014).証人尋問における確証バイアス:尋問者 は 先入観を無視できるか? (学位論文)。フロリダ国際大学。doi : 10.25148/etd.fi14071109 (2026年1月21日非アクティブ)。 {{cite thesis}}: CS1メンテナンス: DOIは2026年1月現在非アクティブです(リンク)↑ パピノー、デイヴィッド(1988) 「科学社会学は科学を信用しないのか?」 、 『科学における相対主義と実在論』 、ドルトレヒト:シュプリンガー・ネーデルラント、 37-57 頁 、 doi : 10.1007/978-94-009-2877-0_2 、 ISBN 978-94-010-7795-8 2021年6月3日 取得↑ Bromme, Rainer; Hesse, Friedrich W.; Spada, Hans 編 (2005). コンピュータを介した知識伝達における障壁とバイアス . doi : 10.1007/b105100 . ISBN 978-0-387-24317-7 。↑ Heuer, Richards (2019-06-10). Heuer, Richards J (編). 政治情報への定量的アプローチ . doi : 10.4324/9780429303647 . ISBN 9780429303647 . S2CID 145675822 . ↑ 「はじめに」 (PDF) 。中央情報局。 2021年10月25日のオリジナルから アーカイブ (PDF) 。 2021年10月25日 に取得。 ↑ 「図6.7. OECD諸国間の識字能力スコアの差は、概して算数能力の差を反映している」 。doi : 10.1787 /888934081549。 2021年6月3日 取得 。 ↑ Ritholz, Barry. 「洞察力とされる悪い数学」 . Bloomberg View . 2014年10月29日の オリジナル からアーカイブ済み。 2014年10月29日 閲覧 。 ↑ Gusnaini, Nuriska; Andesto, Rony; Ermawati (2020-12-15). "地方政府規模、立法規模、人口数、および政府間歳入が財務諸表の開示に与える影響" . European Journal of Business and Management Research . 5 (6). doi : 10.24018/ejbmr.2020.5.6.651 . ISSN 2507-1076 . S2CID 231675715 . ↑ 田浦俊治、永井ゆかり(2011)「名目上のグループと実際のチームの比較」 『 デザイン ・クリエイティビティ2010 』ロンドン:シュプリンガー・フェルラーク・ロンドン、pp. 165–171。ISBN 978-0-85729-223-0 。↑グロス、ウィリアム H. (1979 年7 月 ) 。「クーポン評価と金利サイクル」。Financial Analysts Journal。35 ( 4 ): 68–71。doi : 10.2469 /faj.v35.n4.68。ISSN 0015-198X 。 ↑ 「25. 一般政府総支出」 . doi : 10.1787/888932348795 . 2021年6月3日 取得。 ↑ ダベンポート、トーマス;ハリス、ジーン(2007)。 アナリティクスで競争する 。オライリー 。ISBN 978-1-4221-0332-6 。↑ アーロンズ、D. (2009).報告書によると、各州は生徒データシステムの構築に向けて順調に進んでいる。Education Week、29 (13)、6。 ↑ Rankin, J. (2013年3月28日).データシステムとレポートがデータ分析エラーの蔓延を阻止するか、あるいは助長するか、そして教育指導者がどのように支援できるか。 2019年3月26日にWayback Machine に アーカイブ済み。Technology Information Center for Administrative Leadership (TICAL) School Leadership Summitで行われたプレゼンテーション。 ↑ Brödermann、Eckart J. (2018)、 「第 2.2.1 条 (セクションの範囲)」 、 商法 、Nomos Verlagsgesellschaft mbH & Co. KG、p. 525、 土井 : 10.5771/9783845276564-525 、 ISBN 978-3-8452-7656-4 2021年6月3日 取得↑ Kjell, Oscar NE; Thompson, Sam (2013年12月19日). 「各条件(N = 参加者数)および従属変数(DV)の平均値、標準偏差、欠損値の頻度を示す記述統計」 . PeerJ . 1 : e231. doi : 10.7717/peerj.231/table-1 . ↑ 外れ値の取り扱いに関する実践方法 、ASTM International、 doi : 10.1520/e0178-16a 、 2021年6月3日取得 ↑ 「ダミー変数の代替コーディング方式」 、 ダミー変数を用いた回帰分析 、ニューベリーパーク、カリフォルニア州:SAGE Publications, Inc.、1993年、 64~ 75ページ、 doi : 10.4135/9781412985628.n5 、 ISBN 978-0-8039-5128-0 2021年6月3日 取得↑ ニューマン、イサドール(1998)。 質的・量的研究方法論 :相互作用的連続体の探求 。南イリノイ大学出版局 。ISBN 0-585-17889-5 OCLC 44962443。 ↑ Terwilliger, James S.; Lele, Kaustubh (1979年6月) 「内部一貫性、再現性、均質性の間のいくつかの関係」 教育 測定 ジャーナル 16 (2): 101–108 . doi : 10.1111/j.1745-3984.1979.tb00091.x . ISSN 0022-0655 . ↑ Tabachnick & Fidell、2007年、87-88ページ。 ↑ ランダムサンプリングとランダム化手順 、BSI英国規格、 doi : 10.3403/30137438 、 2021年6月3日 取得 ↑ フォス、クリスチャン。ヘドリック、ブランドン P.エズクラ、マーティン・D. (2016 年 1 月 18 日) 「図 4: メインサンプルの重心サイズ回帰分析」 。 ピアJ 。 4 :e1589。 土井 : 10.7717/peerj.1589/fig-4 。 ↑ 「探索的データ分析」 、 Python® for R Users 、米国ニュージャージー州ホーボーケン:John Wiley & Sons, Inc.、2017年10月13日、pp. 119–138 、 doi : 10.1002/9781119126805.ch4 、 hdl : 11380/971504 、 ISBN 978-1-119-12680-5 2021年6月3日 取得↑ 「探索的データ分析、可視化、仮説検定への取り組み – 探索的データ分析、地理可視化、データ」 、 空間分析 、CRC Press、2015年7月28日、pp. 106–139 、 doi : 10.1201/b18808-8 、 ISBN 978-0-429-06936-9 S2CID 133412598、2021年6月3日 取得 ↑ 「カテゴリーに関する仮説」 、 『統計学入門:簡潔明瞭ガイド 』、ロンドン:SAGE Publications Ltd、2010年、 138~ 151ページ、 doi : 10.4135/9781446287873.n14 、 ISBN 978-1-84920-098-1 2021年6月3日 取得↑ Liquet, Benoit; Riou, Jérémie (2013-06-08). "一般化線形モデルにおける説明変数の多重変換を試みた場合の有意水準の補正" . BMC Medical Research Methodology . 13 (1): 75. doi : 10.1186 / 1471-2288-13-75 . ISSN 1471-2288 . PMC 3699399. PMID 23758852 . 1 2 3 Mcardle, John J. (2008). "確認分析と探索分析における倫理的問題のいくつか" . PsycEXTRA Dataset . doi : 10.1037/e503312008-001 . 2021-06-03 に取得. ↑ Benson, Noah C; Winawer, Jonathan (2018年12月) 「 網膜局所マップのベイズ分析」 . eLife . 7 e40224. doi : 10.7554/elife.40224 . PMC 6340702. PMID 30520736 . 補足ファイル1. クロスバリデーションのスキーマ。doi : 10.7554 /elife.40224.014 ↑ Hsiao, Cheng (2014), "Cross-Sectionally Dependent Panel Data" , Analysis of Panel Data , Cambridge: Cambridge University Press, pp. 327–368 , doi : 10.1017/cbo9781139839327.012 , ISBN 978-1-139-83932-7 2021年6月3日 取得↑ Hjorth, JS Urban (2017-10-19)、 「交差検証」 、 Computer Intensive Statistical Methods 、Chapman and Hall/CRC、pp. 24–56 、 doi : 10.1201/9781315140056-3 、 ISBN 978-1-315-14005-6 2021年6月3日 取得↑ Sheikholeslami, Razi; Razavi, Saman; Haghnegahdar, Amin (2019-10-10). "モデルがクラッシュしたとき、どうすべきか?地球および環境システムモデルのグローバル感度分析に関する推奨事項" . Geoscientific Model Development . 12 (10): 4275– 4296. Bibcode : 2019GMD....12.4275S . doi : 10.5194/gmd-12-4275-2019 . ISSN 1991-9603 . S2CID 204900339 . ↑ 国連開発計画(2018)。「人間開発複合指標」。 人間開発指標と指標2018。 国連 。pp. 21–41。doi: 10.18356 / ce6f8e92 - en。S2CID 240207510 。 ↑ Wiley, Matt; Wiley, Joshua F. (2019), "Multivariate Data Visualization" , Advanced R Statistical Programming and Data Models , Berkeley, CA: Apress, pp. 33–59 , doi : 10.1007/978-1-4842-2872-2_2 , ISBN 978-1-4842-2871-5 S2CID 86629516、2021年6月3日 取得 ↑ Mailund, Thomas (2022). Beginning Data Science in R 4: Data Analysis, Visualization, and Modelling for the Data Scientist (2nd ed.). ISBN 978-148428155-0 。↑ 「機械学習コミュニティがヒッグス粒子に挑戦」 Symmetry Magazine 、2014年7月15日。 2021年4月16日にオリジナルから アーカイブ済み 。 2015年 1月14日 に取得。 ↑ 「Data.Gov:長期舗装性能(LTPP)」 。2016年5月26日。 2017年11月1日にオリジナルから アーカイブ済み 。 2017年 11月10日 に取得。 ↑ Nehme, Jean (2016年9月29日)。 「LTPP国際データ分析コンテスト」 。連邦道路管理局。 2017年10月21日のオリジナルから アーカイブ。 2017年 10月22日 取得 。
参考文献 Adèr, Herman J. (2008a). 「第14章:データ分析の段階と初期ステップ」。Adèr, Herman J.、Mellenbergh, Gideon J. 、 Hand , David J (編) 『研究方法に関する助言 :コンサルタントのための手引き』 所収。オランダ、Huizen:Johannes van Kessel Pub. pp. 333–356。ISBN 9789079418015 . OCLC 905799857 . アデール、ヘルマン・J. (2008b). 「第15章:主要分析段階」。アデール、ヘルマン・J.、メレンベルフ、ギデオン・J. 、ハンド、デイビッド・J. (編) 『研究方法に関する助言 :コンサルタントのための手引き』所収 。 オランダ 、ハイゼン:ヨハネス・ファン・ケッセル出版。357–386頁。ISBN 9789079418015 . OCLC 905799857 . Tabachnick, BG & Fidell, LS (2007). 第4章:データの整理。分析前のデータスクリーニング。BG Tabachnick & LS Fidell (編)『多変量統計学の利用』第5版( 60–116頁)。ボストン:Pearson Education, Inc. / Allyn and Bacon。
さらに読む Adèr, HJ & Mellenbergh , GJ (DJ Hand の寄稿あり) (2008).研究方法に関するアドバイス:コンサルタントのための手引き 。オランダ、ハイゼン:Johannes van Kessel Publishing。ISBN 978-90-79418-01-5 Chambers, John M.; Cleveland, William S .; Kleiner, Beat; Tukey, Paul A. (1983). Graphical Methods for Data Analysis , Wadsworth/Duxbury Press. ISBN 0-534-98052-X Fandango , Armando (2017). Pythonデータ分析、第2版 。Packt Publishers。ISBN 978-1787127487 ジュラン、ジョセフ・M.、ゴッドフリー、A.ブラントン(1999)。ジュランの品質ハンドブック、第5版。 ニューヨーク:マグロウヒル。ISBN 0-07-034003-X Lewis-Beck, Michael S. (1995).データ分析入門 、Sage Publications Inc、ISBN 0-8039-5772-6 NIST/SEMATECH(2008)統計手法ハンドブック Pyzdek, T, (2003).品質工学ハンドブック 、ISBN 0-8247-4614-7 リチャード・ベリアード (1984)。実用的データ分析 。オックスフォード:ブラックウェル・サイエンティ フィック・パブリケーションズ。ISBN 0-632-01311-7 Tabachnick, BG; Fidell, LS (2007).多変量統計学の利用、第5版 。ボストン:Pearson Education, Inc. / Allyn and Bacon、ISBN 978-0-205-45938-4