サンプルのRMSD サンプル の RMSD は、観測値と予測値の差の二乗平均 です。これらの偏差 は、推定に使用されたデータ サンプルに対して計算が行われる場合 (したがって常に推定値を参照する場合)は残差 と呼ばれ、サンプル外 (つまり、推定値ではなく真の値を参照する完全なセット) で計算される場合は誤差 (または予測誤差) と呼ばれます。RMSD は、さまざまなデータ ポイントの予測における誤差の大きさを単一の予測力の尺度に集約するために使用されます。RMSD は、スケールに依存するため、データセット間ではなく、特定のデータセットに対する異なるモデルの予測誤差を比較するための精度 の尺度です。[ 1 ]
RMSDは常に非負の値であり、0(実際にはほとんど達成されない)はデータへの完全な適合を示します。一般的に、RMSDは低いほど良いとされます。ただし、この指標は使用する数値のスケールに依存するため、異なる種類のデータ間での比較は無効となります。
RMSDは、二乗誤差の平均の平方根です。各誤差がRMSDに与える影響は、二乗誤差の大きさに比例します。したがって、大きな誤差はRMSDに不釣り合いに大きな影響を与えます。結果として、RMSDは外れ値 に敏感です。[ 2 ] [ 3 ]
見積担当者 推定量 のRMSDθ ^ {\displaystyle {\hat {\theta }}} 推定パラメータに関してθ {\displaystyle \theta } は、平均二乗誤差 の平方根として定義されます。 RMSD ( θ ^ ) = MSE ( θ ^ ) = E ( ( θ ^ − θ ) 2 ) 。 \displaystyle \operatorname {RMSD} ({\hat {\theta }})={\sqrt {\operatorname {MSE} ({\hat {\theta }})}}={\sqrt {\operatorname {E} {\big (}({\hat {\theta }}-\theta )^{2}{\big )}}}.}
不偏推定量 の場合、RMSDは分散 の平方根であり、標準偏差 として知られています。
正規化 RMSDを正規化することで、異なるスケールのデータセットやモデル間の比較が容易になります。文献には一貫した正規化の方法はありませんが、一般的な選択肢としては、測定データの平均値または範囲(最大値から最小値を引いた値として定義される)があります。[ 4 ]
N R M S D = R M S D y 最大 − y ミニ {\displaystyle \mathrm {NRMSD} ={\frac {\mathrm {RMSD} }{y_{\max }-y_{\min }}}} またはN R M S D = R M S D y ¯ {\displaystyle \mathrm {NRMSD} ={\frac {\mathrm {RMSD} }{\bar {y}}}} 。この値は一般的に正規化二乗平均平方根偏差 または誤差 (NRMSDまたはNRMSE)と呼ばれ、多くの場合パーセンテージで表され、値が低いほど残差分散が小さいことを示します。これは変動係数 またはパーセントRMS とも呼ばれます。多くの場合、特にサンプルが小さい場合、サンプル範囲はサンプルのサイズによって影響を受ける可能性が高く、比較が困難になります。
RMSDをより有用な比較指標にするためのもう一つの方法は、RMSDを四分位範囲 (IQR)で割ることです。RMSDをIQRで割ると、正規化された値は対象変数の極端な値に対する感度が低下します。
R M S D 私 Q R = R M S D 私 Q R {\displaystyle \mathrm {RMSDIQR} ={\frac {\mathrm {RMSD} }{IQR}}} どこ私 Q R = Q 3 − Q 1 {\displaystyle IQR=Q_{3}-Q_{1}} とQ 1 = CDF − 1 ( 0.25 ) {\displaystyle Q_{1}={\text{CDF}}^{-1}(0.25)} そしてQ 3 = CDF − 1 ( 0.75 ) 、 {\displaystyle Q_{3}={\text{CDF}}^{-1}(0.75),} ここで、CDF −1は 分位関数 です。
測定値の平均値で正規化する場合、曖昧さを避けるために、RMSD の変動係数 CV(RMSD) という 用語を使用することができます。[ 5 ] これは、標準偏差 の代わりに RMSD を使用した変動係数 に類似しています。
C V ( R M S D ) = R M S D y ¯ 。 {\displaystyle \mathrm {CV(RMSD)} ={\frac {\mathrm {RMSD} }{\bar {y}}}.}
参考文献 ↑ Hyndman, Rob J.; Koehler, Anne B. ( 2006). "予測精度の尺度に関する別の考察". International Journal of Forecasting . 22 (4): 679–688 . CiteSeerX 10.1.1.154.9771 . doi : 10.1016/j.ijforecast.2006.03.001 . S2CID 15947215 . ↑ Pontius, Robert; Thontteh, Olufunmilayo; Chen, Hao (2008). "実変数を共有するマップ間の複数解像度比較のための情報コンポーネント" (PDF) . Environmental Ecological Statistics . 15 (2): 111– 142. Bibcode : 2008EnvES..15..111P . doi : 10.1007/s10651-007-0043-y . S2CID 21427573 . ↑ Willmott, Cort; Matsuura, Kenji (2006). "空間補間器の性能評価における次元付き誤差尺度の使用について". International Journal of Geographical Information Science . 20 (1): 89–102 . Bibcode : 2006IJGIS..20...89W . doi : 10.1080/13658810500286976 . S2CID 15407960 . ↑ 「沿岸入り江研究プログラム(CIRP)Wiki - 統計」 。 2015年 2月4日 取得 。 ↑ 「FAQ: 変動係数とは何ですか?」 。 2019年 2月19日 取得 。 ↑ Armstrong, J. Scott; Collopy, Fred (1992). "予測方法の一般化のための誤差尺度:経験的比較" (PDF) . International Journal of Forecasting . 8 (1): 69– 80. CiteSeerX 10.1.1.423.508 . doi : 10.1016/0169-2070(92)90008-w . S2CID 11034360 . ↑ Anderson, MP; Woessner, WW (1992). 応用地下水モデリング:流れと移流輸送のシミュレーション (第2 版)。Academic Press。 ↑ アンサンブルニューラルネットワークモデル ↑ ANSI/BPI-2400-S-2012: エネルギー使用履歴への較正による住宅全体のエネルギー節約予測の標準化された評価のための標準実施方法 ↑ https://kalman-filter.com/root-mean-square-error