
意思決定理論では、スコアリングルール[1]は確率予測または予報の評価基準を提供します。「通常の」損失関数 (平均二乗誤差など) は予測値と観測値に適合度スコアを割り当てますが、スコアリングルールは予測確率分布と観測値に適合度スコアを割り当てます。一方、スコアリング関数[2]は点予測の評価の要約尺度を提供します。つまり、期待値や中央値などの特性または関数 を予測します。


スコアリング ルールは、「予測された確率分布は観測値と比べてどの程度優れているか」という質問に答えます。 (厳密に) 適切なスコアリング ルールは、予測された分布がターゲット変数の基になる分布と等しい場合に、最も低い期待スコアを持つことが証明されています。これは個々の観測値によって異なる場合がありますが、「正しい」分布が予測される場合、期待スコアは最小化されるはずです。
スコアリング ルールとスコアリング関数は、確率予測モデルの「コスト関数」または「損失関数」としてよく使用されます。これらは、特定のサンプルの実験的平均である「スコア」として評価されます。次に、さまざまな予測またはモデルのスコアを比較して、どのモデルが最適かを結論付けることができます。たとえば、(入力 に基づいて) 平均と標準偏差を予測するモデルを考えてみましょう。これらの変数を組み合わせると、ガウス分布が定義され、本質的にはターゲット変数 を確率分布として予測します。確率モデルの一般的な解釈は、予測の不確実性を定量化することを目的としているというものです。この例では、観測されたターゲット変数が予測分布 と比較され、スコア が割り当てられます。スコアリング ルールをトレーニングする場合、確率モデルに、不確実性が低いときと高いときを予測するように「教え」、予測の不確実性を最小限に抑えながら、調整された予測が得られるようにする必要があります。
示されている例は、実数値のターゲット変数の確率予測に関するものですが、さまざまなターゲット変数を念頭に置いて、さまざまなスコアリング ルールが設計されています。スコアリング ルールは、バイナリおよびカテゴリの確率分類、および単変量および多変量確率回帰に対して存在します。
定義
標本空間 、の部分集合のσ-代数、上の確率測度の凸クラスを考えます。 上で定義され、拡張された実数直線 上の値を取る関数は、に関して測定可能であり、すべての に関して準積分可能である場合、 -準積分可能です。
確率予測
確率予測とは、あらゆる確率の尺度です。つまり、それは潜在的な将来の観測値の分布です。
得点ルール
スコアリングルールは、すべてのに対して-準積分可能な拡張実数値関数です。は、予測が発行され、観測が実現した場合の損失またはペナルティを表します。
ポイント予測
ポイント予測は関数、つまり潜在的にセット値のマッピングです。
スコアリング機能
スコアリング関数は、ポイント予測が発行され、観測が実現した場合の損失またはペナルティを表す実数値関数です。
オリエンテーション
スコアリング ルールとスコアリング関数は、値が小さい (大きい) ほど良いことを意味する場合、負 (正) の方向になります。ここでは負の方向に従うため、「損失」と関連付けられます。
予想スコア
分布 から観測値をサンプリングする場合、における予測の期待スコアを、予測される分布 の期待スコアと書きます。
サンプル平均スコア
多くの確率予測モデルは、サンプル平均スコアを介してトレーニングされており、予測された分布のセットが観測のセットに対して評価されます。
適切さと一貫性
厳密に適切なスコアリングルールと厳密に一貫したスコアリング関数は、期待報酬を最大化することで正直な予測を促します。予測者に が実現した場合に報酬が与えられる場合(例: )、真の確率分布を報告することで最高の期待報酬(最低スコア)が得られます。 [1]
適切なスコアリングルール
スコアリング ルールは、予測分布が観測分布と一致するときに期待スコアが最小化される場合 (負の方向を想定)、 に対して適切です。
- すべてに対して。
上記の式が の場合にのみ等式として成立する場合、それは厳密に適切です。
一貫したスコアリング機能
スコアリング関数は、クラスに関連する関数に対して一貫性があるといえる。
- すべての人のために、すべての人のために。
矛盾がなく、上記の式の等式が を意味する場合、それは厳密に矛盾しません。
スコアリングルールの適用例

確率的予測の例としては、気象学で天気予報士が翌日の雨の確率を述べることがあります。長期間にわたって 25% の確率が引用された回数を記録し、これを雨が降った実際の割合と比較することができます。実際の割合が述べられた確率と大幅に異なる場合、予報士の校正が不十分であると言えます。校正が不十分な予報士は、ボーナス システムによって予報を改善するよう奨励される可能性があります。適切なスコア ルールに基づいて設計されたボーナス システムは、予報士が自分の個人的な信念に等しい確率を報告するよう動機付けます。[3]
「雨」または「雨なし」に確率を割り当てるなどの単純なバイナリ決定の場合に加えて、スコアリング ルールは、「雨」、「雪」、「晴れ」などの複数のクラス、または 1 日あたりの降雨量などの連続的な応答に対しても使用できます。
右の画像は、実際に発生したイベントについて報告された確率の関数としてのスコアリング ルール (対数スコアリング ルール) の例を示しています。このルールを使用する 1 つの方法は、予測者またはアルゴリズムが割り当てた確率に基づくコストとして使用し、どのイベントが実際に発生するかを確認することです。
適切なスコアリングルールの例
スコアリング ルールは無数に存在し、その中には厳密に適切なスコアリング ルールのパラメーター化されたファミリー全体も含まれます。以下に示すのは、単に一般的な例です。
カテゴリ変数
相互に排他的なイベントを持つカテゴリ応答変数の場合、確率予測器またはアルゴリズムは、各結果の確率を含む確率ベクトルを返します。
対数スコア

対数スコアリング規則は、局所的に厳密に適切なスコアリング規則です。これは、ベイズ推論のスコアリング基準としてよく使用される驚きの否定でもあり、その目標は、予想される驚きを最小限に抑えることです。このスコアリング規則は、情報理論にしっかりと根ざしています。
ここで、スコアは実際の結果の確率推定値の対数として計算されます。つまり、正しく正しいと証明された 80% の予測は、ln(0.8) = −0.22のスコアを受け取ります。この同じ予測では、反対のケースに 20% の確率も割り当てられているため、予測が誤っていると証明された場合は、20% に基づいてスコアが与えられます: ln(0.2) = −1.6。予測者の目標は、スコアを最大化し、スコアを可能な限り大きくすることであり、−0.22 は確かに −1.6 よりも大きくなります。
予測の真偽をそれぞれ値 1 または 0 を持つ変数xとして扱い、表現される確率をpとすると、対数スコアリング規則はx ln( p ) + (1 − x ) ln(1 − p )と書くことができます。厳密に適切なスコアリング規則は線形変換下でも厳密に適切なままであるため、任意の対数底を使用できることに注意してください。つまり、
は、すべての人にとって厳密に適切です。
ブライア/二次スコア
二次スコアリングルールは厳密に適切なスコアリングルールである
ここで、は正解に割り当てられる確率であり、はクラスの数です。
1950年にGlenn W. Brierによって最初に提案されたBrierスコア[4]は、 2次スコアリング規則からの アフィン変換によって得ることができます。
ここで、番目のイベントが正しい場合は、そうでない場合は および はクラスの数です。
これら 2 つのルールの重要な違いは、予測者は二次スコアを最大化し、ブライア スコアを最小化するよう努める必要があることです。これは、それらの間の線形変換に負の符号があるためです。
ヒュヴァリネンの得点ルール
ヒュヴァリネンスコアリング関数(密度p)は[5]で定義される。
ここで、 はヘッセ行列を表し、 は勾配を表す。このスコアリングルールは、パラメータ推論を計算的に簡素化し、任意の曖昧な事前分布を持つベイズモデルの比較に対処するために使用できる。[5] [6]また、既存の情報理論を超えた新しい情報理論的量を導入するためにも使用された。[7]
球状スコア
球面スコアリングルールも厳密に適切なスコアリングルールである。
ランク付けされた確率スコア
順位付け確率スコア[8](RPS)は厳密に適切なスコアリングルールであり、次のように表現できます。
ここで、番目のイベントが正しい場合は、それ以外の場合は 、および はクラスの数です。他のスコアリング ルールとは別に、ランク付けされた確率スコアではクラス間の距離が考慮されます。つまり、クラス 1 と 2 はクラス 1 と 3 よりも近いと見なされます。スコアは、正しいクラスに近いクラスに高い確率が割り当てられる確率予測に、より良いスコアを割り当てます。たとえば、確率予測と を考えると、 両方の確率予測が正しいクラスに同じ確率を割り当てているにもかかわらず、であるのに対し であることがわかります。
カテゴリカルな厳密なスコアリングルールの比較
下の左側は、バイナリ分類問題に対する対数、二次、球面スコアリング ルールのグラフ比較です。x軸は、実際に発生したイベントの報告された確率を示します。
それぞれのスコアは大きさと位置が異なることに注意することが重要です。ただし、スコアはアフィン変換下でも適切なままなので、大きさの違いは関係ありません。したがって、異なるスコアを比較するには、それらを共通のスケールに移動する必要があります。すべてのスコアがポイント (0.5,0) と (1,1) と交差する右側の図に、適切な正規化の選択が示されています。これにより、均一分布 (それぞれ 0.5 の確率が 2 つ) に対して 0 が生成されることが保証され、ベースライン分布となることが多いものを報告するコストや報酬がないことを反映しています。以下のすべての正規化スコアも、真のクラスに確率 1 が割り当てられている場合は 1 になります。
一変量連続変数
以下にリストされているスコアリング ルールは、予測分布が単変量連続確率分布である場合、つまり、予測分布が単変量ターゲット変数に対して定義され、確率密度関数を持つ場合に、確率予測を評価 することを目的としています。
連続変数の対数スコア
対数スコアは局所的に厳密に適切なスコアリングルールであり、次のように定義されます。
ここで、は予測分布の確率密度関数を表します。これは局所的かつ厳密に適切なスコアリングルールです。連続変数の対数スコアは、最大尤度推定と密接な関係があります。しかし、多くのアプリケーションでは、対数スコアは予測分布の裾の密度のわずかな偏差に大きく影響される可能性があるため、連続ランク付けされた確率スコアが対数スコアよりも好まれることがよくあります。[9]
連続ランク付け確率スコア

連続順位確率スコア(CRPS)[10]は気象学でよく使われる厳密なスコアリングルールである。それは次のように定義される。
ここで、は予測分布の累積分布関数、はヘヴィサイドステップ関数、は観測値である。有限第一モーメントを持つ分布の場合、連続順位付け確率スコアは次のように表される。[1]
ここで、およびは分布からサンプリングされた独立した確率変数である。さらに、累積確率関数が連続である場合、連続順位付け確率スコアは次のようにも表される[11]。
連続ランク付け確率スコアは、ランク付け確率スコアの連続拡張と、分位回帰の両方として見ることができます。順序付けられたセットポイントの経験的分布 (つまり、すべてのポイントが発生する確率)上の連続ランク付け確率スコアは、均等に分散した分位数を持つポイントに適用される平均分位損失の2倍に等しい:[12]
多くの一般的な分布族について、連続ランク付け確率スコアの閉形式の表現が導出されている。連続ランク付け確率スコアは人工ニューラルネットワークの損失関数として使用され、天気予報はガウス確率分布に後処理される。[13] [14]
CRPSは、打ち切りイベントをカバーするために生存解析にも適応されました。[15]
多変量連続変数
以下にリストされているスコアリング ルールは、予測分布が単変量連続確率分布である場合、つまり、予測分布が多変量ターゲット変数に対して定義され、確率密度関数を持つ場合に、確率予測を評価 することを目的としています。
多変量対数スコア
多変量対数スコアは単変量対数スコアに似ています。
ここで、 は予測される多変量分布の確率密度関数を表します。これは、局所的で厳密に適切なスコアリング規則です。
エネルギースコア
エネルギースコアは連続順位確率スコアの多変量拡張である: [1]
ここで、、は次元ユークリッド距離を表し、は確率分布 から独立にサンプリングされたランダム変数です。エネルギースコアは、 が有限である分布に対して厳密に適切です。エネルギースコアは、予測された多変量分布の変数間依存構造を評価するときにあまり効果的ではないことが示唆されています。[16]エネルギースコアは、予測された分布と観測値の経験的分布間のエネルギー距離の2倍に等しくなります。
バリオグラムスコア
バリオグラムの順序スコアは次のように与えられる: [17]
ここで、は重みであり、多くの場合 1 に設定され、任意に選択できますが、または がよく使用されます。は、 の' 番目の周辺ランダム変数を表します。 バリオグラム スコアは、 '番目のモーメントがすべてのコンポーネントに対して有限である分布に適していますが、厳密に適しているわけではありません。 エネルギー スコアと比較すると、バリオグラム スコアは、予測される相関構造に関してより識別的であると言われています。
条件付き連続順位確率スコア
条件付き連続順位付け確率スコア(条件付きCRPSまたはCCRPS)は、(厳密に)適切なスコアリングルールのグループです。条件付きCRPSは、予測された多変量分布の単変量条件付き確率分布の規定セットに対してCRPSを評価することで、予測された多変量分布を評価します。[18]
ここで、はの 番目の周辺変数、は条件付き仕様を定義する組の集合(および を使用)、およびのすべての変数がそれぞれの観測値に等しいという条件付き確率分布を表します。 が適切に定義されていない場合(つまり、その条件付きイベントの尤度が 0 の場合)、この分布上の CRPS スコアは無限大として定義されます。条件付き CRPS は、条件付き仕様に連鎖律が含まれている場合、つまりすべての に対して となるの順列が存在する場合、有限 の第 1 モーメントを持つ分布に対して厳密に適切です。
適切なスコアリングルールの解釈
すべての適切なスコアリング ルールは、確率予測を使用する一連の単純な 2 択決定問題における損失の加重合計 (非負の重み関数による積分) に等しく、このような各決定問題には、偽陽性決定と偽陰性決定の関連コスト パラメーターの特定の組み合わせがあります。厳密に適切なスコアリング ルールは、すべての可能な決定しきい値に対して非ゼロの重み付けを持つことに対応します。任意の適切なスコアリング ルールは、決定しきい値上の特定の確率分布に関する期待損失に等しくなります。したがって、スコアリング ルールの選択は、予測確率が最終的に使用される決定問題の確率分布に関する仮定に対応します。たとえば、2 次損失 (または Brier) スコアリング ルールは、決定しきい値が 0 から 1 の間の任意の場所にある均一な確率に対応します。分類精度スコア(正しく分類された割合)は、予測された確率が0.5の適切な側にあるかどうかに応じて0または1になる単一閾値スコアリングルールであり、適切なスコアリングルールではあるが、真の確率を予測するだけでなく、真の確率と同じ0.5の側にある任意の確率を予測することによって(期待値で)最適化されるため、厳密には適切なスコアリングルールではない。[19] [20] [21] [22] [23] [24]
特徴
アフィン変換
厳密に適切なスコアリング規則は、バイナリクラスであろうとマルチクラスであろうと、アフィン変換後も厳密に適切なスコアリング規則のままです。[3]つまり、が厳密に適切なスコアリング規則である場合、も厳密に適切なスコアリング規則ですが、の場合は、スコアリング規則の最適化の意味は最大化と最小化の間で切り替わります。
地域
適切なスコアリング ルールは、特定のイベントの確率の推定がそのイベントの確率のみに依存する場合、ローカルであると言われます。この記述はほとんどの説明ではあいまいですが、ほとんどの場合、これは「特定のイベント」でのスコアリング問題の最適解が、そのイベントの確率を変えない観測分布のすべての変化に対して不変であると考えることができます。発生しなかったイベントに割り当てられた確率は決定されており、変化する柔軟性がないため、すべてのバイナリ スコアはローカルです。
対数スコアリング規則のアフィン関数は、バイナリではない有限集合上の唯一の厳密に適切なローカルスコアリング規則です。
分解
適切なスコアリングルールの期待値は、不確実性、信頼性、解像度と呼ばれる3つの要素の合計に分解することができ、[25] [26]これらは確率予測のさまざまな属性を特徴付けます。
スコアが適切で負の方向である場合 (Brier スコアなど)、3 つの項はすべて正定値です。不確実性コンポーネントは、平均イベント頻度を常に予測する予測の予想スコアに等しくなります。信頼性コンポーネントは、予測された確率がイベント頻度と一致しない、調整が不十分な予測にペナルティを課します。
個々の要素の式は、特定のスコアリングルールによって異なります。ブライアースコアの場合、次の式で表されます。
ここで、はバイナリイベントの発生の平均確率であり、 はが与えられた場合の条件付きイベント確率、すなわち
参照
文学
- 厳密に適切なスコアリング ルール、予測、および推定。Tilmann Gneiting &Adrian E Raftery、359-378 ページ、https://doi.org/10.1198/016214506000001437、pdf
参考文献
- ^ abcd Gneiting, Tilmann; Raftery, Adrian E. (2007). 「厳密に適切なスコアリングルール、予測、および推定」(PDF) . Journal of the American Statistical Association . 102 (447): 359–378. doi :10.1198/016214506000001437. S2CID 1878582.
- ^ Gneiting, Tilmann (2011). 「ポイント予測の作成と評価」.アメリカ統計協会誌. 106 (494): 746–762. arXiv : 0912.0902 . doi :10.1198/jasa.2011.r10138. S2CID 88518170.
- ^ ab Bickel, EJ (2007). 「二次、球面、対数スコアリングルールの比較」(PDF) . Decision Analysis . 4 (2): 49–65. doi :10.1287/deca.1070.0089.
- ^ Brier, GW (1950). 「確率で表現された予報の検証」(PDF) . Monthly Weather Review . 78 (1): 1–3. Bibcode :1950MWRv...78....1B. doi :10.1175/1520-0493(1950)078<0001:VOFEIT>2.0.CO;2.
- ^ ab Hyvärinen, Aapo (2005). 「スコアマッチングによる非正規化統計モデルの推定」。機械学習研究ジャーナル。6 (24): 695–709。ISSN 1533-7928 。
- ^ Shao, Stephane; Jacob, Pierre E.; Ding, Jie; Tarokh, Vahid (2019-10-02). 「ベイジアンモデルとHyvärinenスコアの比較:計算と一貫性」。アメリカ 統計学会誌。114 (528):1826–1837。arXiv :1711.00136。doi:10.1080 / 01621459.2018.1518237。ISSN 0162-1459。S2CID 52264864 。
- ^ Ding, Jie; Calderbank, Robert; Tarokh, Vahid (2019). 「表現とモデリングのための勾配情報」.ニューラル情報処理システムの進歩. 32 : 2396–2405.
- ^ Epstein, Edward S. (1969-12-01). 「ランク付けされたカテゴリーの確率予測のためのスコアリングシステム」。応用気象学および気候学ジャーナル。8 ( 6)。アメリカ気象学会: 985–987。doi :10.1175/1520-0450(1969)008<0985:ASSFPF>2.0.CO; 2。2024-05-02に閲覧。
- ^ ビェレゴード、マティアス・ブリッヒャー;モーラー、ヤン・クロッペンボルグ。ヘンリック・マドセン(2021)。 「多変量確率予測評価入門」。エネルギーとAI。4. Elsevier BV: 100058. doi : 10.1016/j.egyai.2021.100058。ISSN 2666-5468。
- ^ Zamo, Michaël; Naveau, Philippe (2018-02-01). 「限定情報による連続ランク付け確率スコアの推定とアンサンブル天気予報への応用」. Mathematical Geosciences . 50 (2): 209–234. doi : 10.1007/s11004-017-9709-7 . ISSN 1874-8953. S2CID 125989069.
- ^ Bröcker, Jochen (2012). 「連続ランク付け確率スコアによる生のアンサンブルの評価」Quarterly Journal of the Royal Mediterranean Society . 138 (667): 1611–1617. doi :10.1002/qj.1891. ISSN 0035-9009.
- ^ Rasp, Stephan; Lerch, Sebastian (2018-10-31). 「ニューラルネットワークによるアンサンブル天気予報の後処理」. Monthly Weather Review . 146 (11). American Mediterranean Society: 3885–3900. arXiv : 1805.09091 . doi :10.1175/mwr-d-18-0187.1. ISSN 0027-0644.
- ^ Grönquist, Peter; Yao, Chengyuan; Ben-Nun, Tal; Dryden, Nikoli; Dueben, Peter; Li, Shigang; Hoefler, Torsten (2021-04-05). 「後処理アンサンブル天気予報のためのディープラーニング」. Philosophical Transactions of the Royal Society A: Mathematical, Physical and Engineering Sciences . 379 (2194): 20200092. arXiv : 2005.08748 . doi :10.1098/rsta.2020.0092. ISSN 1364-503X. PMID 33583263.
- ^ カウントダウン回帰:シャープで較正された生存予測、https://arxiv.org/abs/1806.08324
- ^ Pinson, Pierre; Tastu, Julija (2013). 「エネルギースコアの識別能力」。デンマーク工科大学。 2024年5月11日閲覧。
- ^ Scheuerer, Michael; Hamill, Thomas M. (2015-03-31). 「多変量量の確率的予報のためのバリオグラムベースの適切なスコアリングルール」*. Monthly Weather Review . 143 (4). American Mediterranean Society: 1321–1334. doi :10.1175/mwr-d-14-00269.1. ISSN 0027-0644.
- ^ Roordink, Daan; Hess, Sibylle (2023). 「スコアリングルールネット:多変量回帰における平均ターゲット予測を超えて」。データベースにおける機械学習と知識発見:研究トラック。第14170巻。Cham:Springer Nature Switzerland。p. 190–205。doi : 10.1007 / 978-3-031-43415-0_12。ISBN 978-3-031-43414-3。
- ^ レナード・J・サベージ。個人的確率と期待の引き出し。アメリカ統計協会誌、66(336):783–801、1971年。
- ^ シェルビッシュ、マーク J. (1989) 「確率評価者を比較するための一般的な方法」Annals of Statistics 17 (4) 1856–1879、https://projecteuclid.org/euclid.aos/1176347398
- ^ Rosen, David B. (1996). 「それらの確率予測はどれほど優れていたか? 期待推奨損失 (ERL) スコアリングルール」Heidbreder, G. (編)「最大エントロピーとベイジアン法」(第 13 回国際ワークショップ議事録、1993 年 8 月)。Kluwer、ドルドレヒト、オランダ。CiteSeerX 10.1.1.52.1557。
- ^ Roulston, MS, & Smith, LA (2002). 情報理論を用いた確率予測の評価。Monthly Weather Review、130、1653–1660。付録「スキルスコアとコスト損失」を参照。[1]
- ^ 「バイナリクラス確率推定および分類のための損失関数: 構造と応用」、Andreas Buja、Werner Stuetzle、Yi Shen (2005) http://citeseerx.ist.psu.edu/viewdoc/summary?doi=10.1.1.184.5203
- ^ Hernandez-Orallo, Jose; Flach, Peter; Ferri, Cesar (2012)。「パフォーマンス メトリックの統一ビュー: しきい値選択を予測分類損失に変換する」Journal of Machine Learning Research 13 2813–2869。http://www.jmlr.org/papers/volume13/hernandez-orallo12a/hernandez-orallo12a.pdf
- ^ Murphy, AH (1973). 「確率スコアの新しいベクトル分割」. Journal of Applied Meteorology . 12 (4): 595–600. Bibcode :1973JApMe..12..595M. doi : 10.1175/1520-0450(1973)012<0595:ANVPOT>2.0.CO;2 .
- ^ Bröcker, J. (2009). 「信頼性、十分性、および適切なスコアの分解」(PDF) . Quarterly Journal of the Royal Mediterranean Society . 135 (643): 1512–1519. arXiv : 0806.0813 . Bibcode :2009QJRMS.135.1512B. doi :10.1002/qj.456. S2CID 15880012.
外部リンク
- 球面、二次、対数のスコアリングルールを比較するビデオ
- ローカルの適切なスコアリングルール
- スコアリングルールと意思決定分析教育
- 厳密なスコアリングルール
- スコアリングルールと不確実性
- 分類精度およびその他の不連続な不適切な精度スコアリングルールによって生じる損害
- 連続順位確率スコアの閉形式表現
