統計学において、モデル検証とは、選択した統計モデルが適切かどうかを評価する作業です。統計的推論では、データに適合しているように見えるモデルからの推論が偶然の産物である場合が多く、その結果、研究者はモデルの実際の妥当性を誤解してしまうことがあります。これに対処するため、モデル検証は、統計モデルがデータの様々な変化に耐えうるかどうかをテストするために用いられます。モデル検証は、モデル批判またはモデル評価とも呼ばれます。
このトピックは、複数の候補モデルを区別するプロセスであるモデル選択という密接に関連するタスクと混同してはならない。モデル検証は、モデルの概念設計にはあまり関係がなく、選択されたモデルとその出力との整合性のみをテストする。
モデルを検証する方法は数多くあります。残差プロットは、実際のデータとモデルの予測との差をプロットします。残差プロットの相関関係は、モデルの欠陥を示している可能性があります。交差検証は、モデル検証の手法の一つで、毎回小さなサンプルだけを除外してモデルを再適合させ、除外したサンプルがモデルによって予測されるかどうかを比較します。交差検証には多くの種類があります。予測シミュレーションは、シミュレーションデータと実際のデータを比較するために使用されます。外部検証では、モデルを新しいデータに適合させます。赤池情報量規準は、モデルの品質を推定します。
モデル検証には様々な方法があり、研究者が用いる具体的なモデル検証方法は、研究デザインの制約となることが多い。つまり、モデル検証に万能な方法は存在しないということだ。例えば、研究者が非常に限られたデータセットしか扱っていないが、そのデータについて強い事前仮説を持っている場合、ベイズフレームワークを用いてモデルの適合性を検証し、様々な事前分布を用いてモデルの適合性をテストすることを検討するかもしれない。しかし、研究者が大量のデータを持っており、複数のネストされたモデルをテストしている場合は、交差検証や、場合によってはリーブワンアウト法が適しているかもしれない。これらは2つの抽象的な例であり、実際のモデル検証ではここで説明したよりもはるかに複雑な要素を考慮する必要があるが、これらの例は、モデル検証方法は常に状況に応じて変化するということを示している。
一般的に、モデルは既存のデータまたは新しいデータを使用して検証することができ、これらの両方の方法については以降のサブセクションで詳しく説明し、注意点も示します。
既存データに基づく検証では、モデルの適合度を分析したり、残差がランダムであるかどうかを分析したりします(つまり、残差診断)。この方法では、モデルとデータの近さを分析し、モデルが自身のデータをどれだけうまく予測できるかを理解しようとします。この方法の一例を図 1 に示します。これは、いくつかのデータに適合させた多項式関数を示しています。多項式関数は、線形に見えるデータにうまく適合しておらず、この多項式モデルが無効になる可能性があることがわかります。
一般的に、既存データに基づく統計モデルは、検証セット(ホールドアウトセットとも呼ばれる)を用いて検証されます。検証セットとは、統計モデルを構築する際にユーザーが除外するデータポイントのセットです。統計モデルの構築後、検証セットはモデルの誤差の尺度として使用されます。モデルが初期データにはうまく適合するものの、検証セットで大きな誤差が生じる場合、これは過学習の兆候です。

新しいデータが入手可能になった場合、既存のモデルがその新しいデータを予測できるかどうかを評価することで、モデルの妥当性を検証できます。もし新しいデータが既存のモデルで予測できない場合、そのモデルは研究者の目的に対して有効ではない可能性があります。
これを踏まえて、ニューラルネットワークを検証する現代的なアプローチは、ドメインシフトされたデータでその性能をテストすることです。これにより、モデルがドメイン不変の特徴を学習したかどうかが確認できます。[ 1 ]
モデルは、あるアプリケーション領域に関してのみ検証できます。[ 2 ] [ 3 ]あるアプリケーションで有効なモデルが、他のアプリケーションでは無効になる場合があります。例として、図 1の曲線を考えてみましょう。アプリケーションが区間[0, 2]からの入力のみを使用する場合、この曲線は許容できるモデルである可能性があります。
統計科学百科事典によると、検証を行う際に、潜在的に困難となる主な原因が 3 つあります。[ 4 ]その 3 つの原因とは、データの不足、入力変数の制御の不足、基礎となる確率分布と相関関係に関する不確実性です。検証における困難に対処する一般的な方法には、モデル構築時に行った仮定の確認、利用可能なデータと関連するモデル出力の調査、専門家の判断の適用などがあります。[ 2 ]なお、専門家の判断には、通常、適用分野における専門知識が必要となります。[ 2 ]
専門家の判断は、実際のデータを入手せずに予測の妥当性を評価するために使用できる場合があります。たとえば、図 1 の曲線の場合 、専門家は大幅な外挿が無効であると評価できる可能性があります。さらに、専門家の判断は、チューリング型のテストにも使用できます。チューリング型テストでは、専門家は実際のデータと関連するモデル出力の両方を提示され、その 2 つを区別するように求められます。[ 5 ]
統計モデルの種類によっては、検証を行うための専門的な手法が利用可能です。例えば、統計モデルが回帰分析によって得られた場合、回帰モデルの検証のための専門的な分析手法が存在し、一般的に用いられています。
残差診断とは、残差が実質的にランダムであるかどうかを判断するために残差を分析することです。このような分析には通常、残差の確率分布の推定値が必要です。残差の分布の推定値は、モデルを繰り返し実行すること、すなわち、モデル内のランダム変数に擬似乱数発生器を用いるなどして、繰り返し確率シミュレーションを行うことで得られることがよくあります。
統計モデルが回帰分析によって得られたものである場合、回帰残差診断が存在し、それを使用することができる。このような診断は十分に研究されている。
交差検証とは、データの一部をモデル構築プロセスから除外し、除外したデータがモデルによる予測値とどれだけ近いか遠いかを確認するサンプリング手法です。具体的には、交差検証では、データの一部を用いてモデルを何度も構築し、構築したモデルを、モデル構築に使用しなかったデータと比較します。モデルが学習に使用しなかったデータをほとんど説明できない場合、そのモデルはおそらく間違っていると考えられます。
医療統計学における最近の進展として、メタアナリシスにおける交差検証指標の使用が挙げられる。これは、メタアナリシスの要約推定値の統計的妥当性を検証するために使用される検証統計量Vnの基礎を形成する。[ 6 ] また、メタアナリシスの結果の予測誤差を推定するために、より従来的な意味でメタアナリシスで使用されている。[ 7 ]
{{citation}}: CS1 maint: 複数の名前: 著者リスト (リンク)。