予測モデリングは、統計学を用いて結果を予測します。[ 1 ]予測したい事象は多くの場合未来の出来事ですが、予測モデリングは、いつ発生したかに関わらず、あらゆる種類の未知の事象に適用できます。たとえば、予測モデルは、犯罪が発生した後に犯罪を検出し、容疑者を特定するためによく使用されます。[ 2 ]
予測モデルの出力は、特定のイベントが発生する推定確率(例:二項回帰)やスカラー応答変数(例:線形回帰)など、複数の形式で得られます。ビジネス上の意思決定における予測モデリングの使用は、予測分析と呼ばれることがよくあります。
予測モデリングは、しばしば因果モデリングと対比される。前者の場合、関心のある結果の指標、あるいは代理変数を用いるだけで十分満足できる。後者の場合、真の因果関係を明らかにしようとする。この区別は、研究方法論や統計学の分野で膨大な文献を生み出し、「相関関係は因果関係を意味しない」という一般的な見解につながっている。
定義の範囲にもよりますが、予測モデリングは、学術分野や研究開発分野でより一般的に用いられる機械学習の分野と同義、あるいは大部分が重複しています。この成長分野は、コンピューティング能力の向上と、より効率的なモデルトレーニング手法を可能にする新しいデータアーキテクチャによって、よりアクセスしやすくなっています(「Attention Is All You Need 」を参照)。
予測モデリングの力と複雑さが増大し続けるにつれて、予測モデルにおける公平性は、特に医療、保険、融資などの分野における予測モデリングの応用を考慮すると、ますます研究される分野となっています[ 3 ]。
ほぼすべての統計モデルを予測目的で使用できます。大まかに言うと、予測モデルにはパラメトリックモデルとノンパラメトリックモデルの2種類があります。3つ目の種類であるセミパラメトリックモデルは、両方の特徴を備えています。パラメトリックモデルは、「基礎となる分布を特徴付ける1つ以上の母集団パラメータに関して特定の仮定を置く」ものです。[ 4 ]ノンパラメトリックモデルは、「通常、構造と分布形式に関する仮定はパラメトリックモデルよりも少ないが、独立性に関する強い仮定を含む」ものです。[ 5 ]
考古学における予測モデリングの基礎は、1950年代半ばにゴードン・ウィリーがペルーのヴィル渓谷で行った研究に由来する。 [ 6 ]徹底的かつ集中的な調査が行われ、文化遺物と傾斜や植生などの自然の特徴との共変動性が決定された。定量的手法の開発と適用可能なデータの入手可能性の向上により、1960年代にこの分野は成長し、1980年代後半には世界中の主要な土地管理者によって大幅な進歩が遂げられた。
一般的に、考古学における予測モデリングとは、土壌の種類、標高、傾斜、植生、水域への近さ、地質、地形などの自然指標と考古学的特徴の存在との間に、統計的に有効な因果関係または共変関係を確立することです。考古学的調査を受けた土地のこれらの定量化可能な属性を分析することで、未調査地域の自然指標に基づいて、その地域の「考古学的感受性」を予測できる場合があります。米国では、土地管理局(BLM)、国防総省(DOD)[ 7 ] [ 8 ] 、多数の高速道路および公園管理機関など、大規模な土地管理者がこの戦略をうまく活用しています。文化資源管理計画に予測モデリングを使用することで、地盤の攪乱を伴い、結果として考古学的遺跡に影響を与える可能性のある活動を計画する際に、より情報に基づいた意思決定を行うことができます。
予測モデリングは、顧客が特定の行動をとる可能性を記述する顧客レベルのモデルを作成するために、分析的な顧客関係管理やデータマイニングで広く使用されています。これらの行動は通常、販売、マーケティング、顧客維持に関連しています。[ 9 ]
例えば、モバイル通信事業者などの大規模な消費者向け組織は、製品のクロスセル、製品のディープセル(またはアップセル)、および解約に関する一連の予測モデルを持っています。また、現在では、このような組織がアップリフトモデルを使用した顧客維持可能性モデルを持つことも一般的になっています。これは、標準的な解約予測モデルとは異なり、契約期間の終わりに顧客を維持できる可能性(解約確率の変化)を予測します。[ 9 ]
保険業界では、予測モデリングの応用例が数多く存在するが、これは主に保険契約が将来を見据えた性質を持つためである。実際、損害保険の料率設定における重要な原則は、料率は過去の損失を回収するのではなく、将来のコスト予測に基づいて設定されなければならないということであり、この機能において予測モデリングは極めて重要となる。[ 10 ]
予測モデリングは、自動車保険において、保険契約者から得られた情報に基づいて、保険契約者に事故のリスクを割り当てるために利用されています。これは、予測モデルがテレメトリベースのデータを使用して、請求の可能性に対する予測リスクのモデルを構築する使用ベースの保険ソリューションで広く使用されています。 [ 11 ]ブラックボックス自動車保険の予測モデルは、GPSまたは加速度センサーの入力のみを使用します。[ 11 ]一部のモデルは、高度な運転行動、独立した衝突記録、道路履歴、ユーザープロファイルなど、基本的なテレメトリを超える幅広い予測入力を含み、リスクモデルを改善します。[ 11 ]
2009年、パークランド・ヘルス&ホスピタル・システムは、再入院リスクの高い患者を特定するために予測モデリングを使用する目的で、電子カルテの分析を開始しました。当初、同病院はうっ血性心不全の患者に焦点を当てていましたが、このプログラムは糖尿病、急性心筋梗塞、肺炎の患者にも拡大しました。[ 12 ]
2018年、Banerjeeら[ 13 ]は、電子カルテの自由記述形式の臨床記録を分析し、受診の時系列を維持しながら、患者の短期的な余命(3か月以上)を推定する深層学習モデルを提案した。このモデルは、大規模なデータセット(10,293人の患者)でトレーニングされ、別のデータセット(1,818人の患者)で検証された。ROC(受信者操作特性)曲線下面積は0.89であった。説明可能性を高めるため、彼らは、モデルの予測の根拠を医師がより理解しやすくなるような対話型のグラフィカルツールを開発した。PPES-Metモデルの高い精度と説明可能性により、このモデルは転移性癌の治療を個別化するための意思決定支援ツールとして使用でき、医師に貴重な支援を提供できる可能性がある。
最初の臨床予測モデル報告ガイドラインは2015年に発表され(個々の予後または診断のための多変量予測モデルの透明性のある報告(TRIPOD))、その後更新されました。[ 14 ] TRIPOD声明は2024年に機械学習と人工知能の手法に関する項目を含むTRIPOD+AI声明に更新されました[ 15 ]。TRIPOD+AI声明はTRIPOD声明に取って代わります。
臨床予測モデルは、データの出所が不明な合成または捏造された疑いのある信頼性の低いデータに基づいて開発され、その後臨床現場で使用されたことも示されている[ 16 ] [ 17 ] [ 18 ]。
トレーディングにおける予測モデリングとは、一連の予測変数を用いて結果の確率を予測するモデリングプロセスです。予測モデルは、株式、先物、通貨、商品など、さまざまな資産に対して構築できます。予測モデリングは、トレーディング会社が戦略を立案し取引を行うために今でも広く利用されています。価格、出来高、建玉、その他の過去のデータに関する指標を評価するために、数学的に高度なソフトウェアを使用し、再現可能なパターンを発見します。[ 19 ]
予測モデリングは、各キャンペーンのデータに基づいた結果を予測することで、リードジェネレーターに有利なスタートを切らせます。この方法は時間を節約し、潜在的な盲点を明らかにして、クライアントがより賢明な意思決定を行うのに役立ちます。[ 20 ]
予測モデリングは、米国の農業協同組合の持続可能性を予測するために使用されており、会員の異質性の影響と、農業協同組合のマクロ環境における将来の集計レベルの持続可能性を予測する上でのその重要性に焦点を当てています。[ 21 ]
予測モデリングを自動意思決定プロセスに使用する場合、予測が差別的な方法で偏っていないことを確認するために注意を払う必要があります(公平性(機械学習)を参照)。モデルが予測の生成に機密情報を直接使用しない場合でも、特定のグループに対して体系的に差別する結果を生み出す可能性があります。[ 3 ]
歴史は必ずしも未来を正確に予測できるとは限らない。過去のデータから導き出された関係性を用いて未来を予測しようとすると、複雑なシステムには一定の永続的な条件や定数が存在するという前提が暗黙のうちに成り立つ。そして、そのシステムに人間が関わっている場合、この前提はほぼ必ず何らかの不正確さを招く。
未知の未知数は問題となる。データ収集においては、まず収集者がデータ収集の対象となる変数群を定義する。しかし、収集者が変数の選択をどれほど綿密に検討したとしても、考慮されていない、あるいは定義すらされていないにもかかわらず、結果に決定的な影響を与える新たな変数が存在する可能性は常に存在する。
モデルは敵対的に打ち負かされる可能性がある。モデルが測定の標準として受け入れられた後、個々の説明変数が目的変数の予測に与える影響に関する知識によって、モデルが再学習されるまでモデルが悪用される可能性がある。この現象は2008年の金融危機の一因となり、CDOディーラーは発行するCDOの格付けをAAAまたはスーパーAAAにするために、格付け機関のインプットを積極的に実行した。[ 22 ]
{{cite journal}}: CS1メンテナンス: フラグなしの無料DOI (リンク)