確率論と統計学において、変動係数( CV ) は、正規化二乗平均平方根偏差 (NRMSD)、パーセント RMS、相対標準偏差( RSD ) とも呼ばれ、確率分布または頻度分布の分散の標準化された尺度です。これは、標準偏差と平均値(またはその絶対値)の比として定義され、多くの場合、パーセント ("%RSD") で表されます。 CV または RSD は、分析化学において、アッセイの精度と再現性を表すために広く使用されています。また、工学や物理学などの分野で品質保証研究やANOVA ゲージ R&R を行う際によく使用され、[要出典] 、経済学者や投資家が経済モデルや心理学/神経科学の分野でも使用されています。
意味
変動係数(CV)は標準偏差と平均値の比として定義される。[1]
これは、母集団の平均に対する変動の程度を示します。変動係数は、意味のあるゼロを持つスケール(比率スケール)で測定されたデータに対してのみ計算する必要があります。これにより、2つの測定値の相対的な比較(つまり、一方の測定値を他方の測定値で割る)が可能になります。変動係数は、間隔スケールのデータに対しては意味を持たない場合があります。[2]たとえば、ほとんどの温度スケール(摂氏、華氏など)は任意のゼロを持つ間隔スケールであるため、計算される変動係数は使用するスケールによって異なります。一方、 ケルビン温度には意味のあるゼロ、つまり熱エネルギーがまったく存在しないため、比率スケールです。平易な言葉で言えば、20ケルビンは10ケルビンの2倍熱いと言うことは意味がありますが、それは真の絶対ゼロを持つこのスケールの場合のみです。標準偏差(SD)はケルビン、摂氏、または華氏で測定できますが、計算された値はそのスケールにのみ適用できます。有効な変動係数を計算するには、ケルビン スケールのみを使用できます。
対数正規分布する測定値は定常 CV を示します。対照的に、SD は測定値の期待値に応じて変化します。
より堅牢な可能性は、四分位分散係数、つまり四分位範囲の 半分を四分位の平均(中間ヒンジ)で割った値です。
ほとんどの場合、CVは、従属変数(製造工程のエラーなど)の多数の反復測定を使用して、単一の独立変数(たとえば、単一の工場製品)に対して計算されます。ただし、線形または対数的に非線形であり、各値にわたってまばらな測定値を持つ独立変数の連続範囲を含むデータ(散布図など)は、最大尤度推定アプローチを使用した単一のCV計算に適している場合があります。[3]
例
以下の例では、より大きな値の集団からランダムに選択された値を使用します。
- データセット[100, 100, 100]は定数値を持ちます。その標準偏差は0で平均は100なので、変動係数は0 / 100 = 0となります。
- データセット[90, 100, 110]は変動性が高い。標準偏差は10、平均は100で、変動係数は10 / 100 = 0.1となる。
- データ セット [1, 5, 6, 8, 10, 40, 65, 88] はさらに変動性があります。標準偏差は 32.9、平均は 27.9 で、変動係数は 32.9 / 27.9 = 1.18 となります。
これらの例では、与えられた値を値の全体の母集団として扱います。
- データセット[100, 100, 100]の母集団標準偏差は0、変動係数は0 / 100 = 0である。
- データセット[90, 100, 110]の母集団標準偏差は8.16、変動係数は8.16 / 100 = 0.0816である。
- データセット[1, 5, 6, 8, 10, 40, 65, 88]の母集団標準偏差は30.8、変動係数は30.8 / 27.9 = 1.10です。
推定
母集団からのデータのサンプルのみが利用可能な場合、母集団のCVはサンプル標準偏差 とサンプル平均の比を使用して推定できます。
しかし、この推定値は、小規模または中規模のサンプルに適用すると、低すぎる傾向があり、偏りのある推定値となります。正規分布データの場合、サイズnのサンプルに対する偏りのない推定値[4]は次のようになります。
対数正規分布データ
多くのデータセットは、ほぼ対数正規分布に従います。[5]このような場合、対数正規分布の特性から導かれるより正確な推定値[ 6 ] [7] [8]は次のように定義されます。
ここで、は自然対数変換後のデータの標本標準偏差です。(測定値が他の対数底bを使用して記録された場合、その標準偏差はを使用して底eに変換され、の式は同じままです。[9])この推定値は、上記の単純な推定値と区別するために、「幾何変動係数」(GCV)[10] [11]と呼ばれることもあります。ただし、「幾何変動係数」はKirkwood [12]によって次のように定義されています。
この用語は、対数正規データにおける乗法変動を記述するための変動係数に類似したものとして意図されていましたが、この GCV の定義には、それ自体の推定値としての理論的根拠がありません。
多くの実用的な目的(サンプルサイズの決定や信頼区間の計算など)では、対数正規分布データのコンテキストで最も使用されるのは です。必要に応じて、対応する式を逆転させることで、 または GCV の推定値からこれを導き出すことができます。
標準偏差との比較
利点
変動係数は、データの標準偏差が常にデータの平均の文脈で理解される必要があるため便利です。対照的に、変動係数の実際の値は、測定が行われた単位に依存しないため、無次元数です。異なる単位または大幅に異なる平均値を持つデータ セットを比較する場合は、標準偏差の代わりに変動係数を使用する必要があります。
デメリット
- 平均値がゼロに近い場合、変動係数は無限大に近づくため、平均値の小さな変化に敏感になります。値が比率スケールから発生していない場合は、このような状況になることがよくあります。
- 標準偏差とは異なり、平均値の信頼区間を構築するために直接使用することはできません。
アプリケーション
変動係数は、再生理論、待ち行列理論、信頼性理論などの応用確率分野でも一般的です。これらの分野では、指数分布が正規分布よりも重要になることがよくあります。指数分布の標準偏差は平均に等しいため、変動係数は1に等しくなります。CV < 1の分布(アーラン分布など)は低分散であると見なされ、CV > 1の分布(超指数分布など)は高分散であると見なされます[要出典] 。これらの分野の一部の式は、変動係数の二乗(SCVと略されることが多い)を使用して表現されます。モデリングでは、CVのバリエーションがCV(RMSD)です。基本的に、CV(RMSD)は標準偏差の項を二乗平均平方根偏差(RMSD)に置き換えます。実際、多くの自然プロセスでは平均値とその周囲の変動量の間に相関関係が見られますが、正確なセンサー デバイスは変動係数がゼロに近くなるように、つまり動作範囲全体で絶対誤差が一定になるように設計する必要があります。
保険数理学では、CVはユニット化リスクとして知られています。[13]
工業用固体処理において、CVは粉末混合物の均質性の度合いを測定するために特に重要です。計算されたCVを仕様と比較することで、十分な混合度が達成されているかどうかを判断できます。[14]
流体力学において、CV はパーセント RMS、%RMS、%RMS 均一性、または速度 RMSとも呼ばれ、工業プロセスにおける流れの均一性を判断するのに役立ちます。この用語は、静電集塵機 (ESP) [15] 、選択触媒還元 (SCR)、スクラバー、および同様のデバイスなどの汚染制御装置の設計で広く使用されています。米国大気浄化会社協会 (ICAC) は、ファブリック フィルターの設計において速度の RMS 偏差を参照しています (ICAC 文書 F-7)。[16] 指針となる原則は、これらの汚染制御装置の多くは、制御ゾーンに出入りする「均一な流れ」を必要とするということです。これは、速度プロファイルの均一性、温度分布、ガス種 (SCR の場合はアンモニア、水銀吸収の場合は活性炭注入など)、およびその他の流れに関連するパラメーターに関係します。パーセントRMS は、燃焼システム、HVAC システム、ダクト、ファンとフィルターの入口、空気処理ユニットなど、機器のパフォーマンスが流入流量の分布によって影響を受ける場所における流量の均一性を評価するためにも使用されます。
検査内および検査間のCVの検査室測定
CV 測定は、定量的実験室アッセイの品質管理としてよく使用されます。アッセイ内 CV とアッセイ間 CV は、1 つのアッセイ内の複数のサンプルの CV 値を単純に平均するか、複数のアッセイ間 CV 推定値を平均することによって計算されると想定されるかもしれませんが、これらの方法は正しくなく、より複雑な計算プロセスが必要であることが示唆されています。[17]また、サンプル間で反復回数が異なる場合、CV 値は測定の確実性の理想的な指標ではないことも指摘されています。この場合は、パーセントでの標準誤差の方が優れていることが示唆されています。[18]測定に自然なゼロ点がない場合、CV は有効な測定ではなく、クラス内相関係数などの代替測定が推奨されます。[19]
経済格差の尺度として
変動係数は、経済格差を測る尺度としての要件を満たしている。[20] [21] [22] x(エントリx i)が経済指標(例えば富)の値のリストであり、x i がエージェントiの富である場合、次の要件が満たされる。
- 匿名性 – c v はリストxの順序に依存しません。これは、分散と平均がxの順序に依存しないという事実から生じます。
- スケール不変性:c v ( x ) = c v (α x ) ここでαは実数である。[22]
- 母集団の独立性 – { x , x } がリストxに自身を追加したものである場合、c v ({ x , x }) = c v ( x ) となります。これは、分散と平均の両方がこの原則に従うという事実から導き出されます。
- ピグー・ドルトン移転原理:富がより裕福なエージェントiからより貧しいエージェントjに順位を変えずに移転すると(つまりx i > x j )、 c v は減少し、その逆も同様である。[22]
c v は、完全な等式(すべてのx iが等しい)に対して最小値 0 を想定しています。 [22]最も顕著な欠点は、上限が定められていないため、固定範囲内に正規化できないことです(たとえば、0 から 1 の間に制約されているジニ係数など)。 [22]ただし、ジニ係数よりも数学的に扱いやすいです。
考古学的遺物の標準化の手段として
考古学者は、古代の遺物の標準化の程度を比較するために、しばしばCV値を使用します。[23] [24] CVの変動は、新しい技術の採用に関する異なる文化伝達の文脈を示すと解釈されてきました。[25]変動係数は、社会組織の変化に関連する陶器の標準化を調査するためにも使用されてきました。[26]考古学者は、CV値を比較するために、たとえば、CVの平等性を調べるための修正符号尤度比(MSLR)テストなど、いくつかの方法を使用します。[27] [28]
誤用の例
相対単位を使用してパラメータ間の変動係数を比較すると、実際とは異なる差異が生じる可能性があります。同じ温度セットを摂氏と華氏で比較すると(どちらも相対単位ですが、ケルビンとランキン スケールは関連する絶対値です)、 次のようになります。
摂氏: [0、10、20、30、40]
華氏: [32, 50, 68, 86, 104]
サンプルの標準偏差はそれぞれ 15.81 と 28.46 です。最初のセットの CV は 15.81/20 = 79% です。2 番目のセット (同じ温度) では 28.46/68 = 42% です。
たとえば、データ セットが 2 つの異なるセンサー (摂氏センサーと華氏センサー) からの温度測定値であり、分散が最も少ないセンサーを選択してどちらのセンサーが優れているかを知りたい場合、CV を使用すると誤った判断を下すことになります。ここでの問題は、絶対値ではなく相対値で除算していることです。
同じデータセットを絶対単位で比較します。
ケルビン: [273.15、283.15、293.15、303.15、313.15]
ランキン: [491.67, 509.67, 527.67, 545.67, 563.67]
標準偏差は定数オフセットの影響を受けないため、 サンプル標準偏差はそれぞれ 15.81 と 28.46 のままです。ただし、変動係数は両方とも 5.39% になります。
数学的に言えば、変動係数は完全に線形ではありません。つまり、ランダム変数 の場合、 の変動係数はの場合にのみの変動係数に等しくなります。上記の例では、 の形式を線形変換することによってのみ摂氏を華氏に変換できますが、 の形式を変換することによってケルビンをランキンに変換できます。
分布
標本平均値の負の値や小さな正の値が無視できる頻度で発生すると仮定すると、 IID正規確率変数の標本サイズの変動係数の確率分布は、ヘンドリックスとロビーによって次のように示されている[29]。
ここで、記号は、合計が の偶数値に対してのみ行われることを示します。つまり、が奇数の場合、 の偶数値に対して合計し、が偶数の場合、 の奇数値に対してのみ合計します。
これは、例えば仮説検定や信頼区間の構築に役立ちます。正規分布データの変動係数の統計的推論は、変動係数のマッケイのカイ二乗近似に基づいています。 [30] [31] [32] [33] [34] [35]
代替
Liu (2012)は、変動係数の信頼区間の構築方法についてレビューしています。[36]特に、Lehmann (1986)は、非心t分布を使用して変動係数の標本分布を導き、CIの正確な構築方法を示しました。[37]
同様の比率
標準化モーメントは、平均に関するk番目のモーメントである相似比であり、これも無次元かつスケール不変です。分散対平均比、は別の相似比ですが、無次元ではないためスケール不変ではありません。その他の比率については、 「正規化 (統計)」を参照してください。
信号処理、特に画像処理においては、逆比(またはその二乗)は一般に信号対雑音比、特に 信号対雑音比(イメージング)と呼ばれます。
その他の関連比率は次のとおりです。
参照
参考文献
- ^ エヴェリット、ブライアン (1998)。ケンブリッジ統計辞典。ケンブリッジ、イギリス、ニューヨーク:ケンブリッジ大学出版局。ISBN 978-0521593465。
- ^ 「順序変数、間隔変数、比率変数の違いは何ですか? なぜ気にする必要があるのですか?」GraphPad Software Inc. 2008 年 12 月 15 日時点のオリジナルよりアーカイブ。2008年2 月 22 日閲覧。
- ^ Odic, Darko; Im, Hee Yeon; Eisinger, Robert; Ly, Ryan; Halberda, Justin (2016年6月). 「PsiMLE: 心理物理学的スケーリングと変動性をより信頼性、効率性、柔軟性をもって推定する最大尤度推定アプローチ」.行動研究方法. 48 (2): 445–462. doi : 10.3758/s13428-015-0600-5 . ISSN 1554-3528. PMID 25987306.
- ^ ソカル RR & ロルフ FJ.バイオメトリクス(第3版). ニューヨーク:フリーマン、1995年、p. 58. ISBN 0-7167-2411-1
- ^ Limpert, Eckhard; Stahel, Werner A.; Abbt, Markus (2001). 「科学分野における対数正規分布:鍵と手がかり」. BioScience . 51 (5): 341–352. doi : 10.1641/0006-3568(2001)051[0341:LNDATS]2.0.CO;2 .
- ^ Koopmans, LH; Owen, DB; Rosenblatt, JI (1964). 「正規分布と対数正規分布の変動係数の信頼区間」Biometrika . 51 (1–2): 25–32. doi :10.1093/biomet/51.1-2.25.
- ^ Diletti, E; Hauschke, D; Steinijans, VW (1992). 「信頼区間による生物学的同等性評価のためのサンプルサイズの決定」。国際臨床薬理学、治療、毒性学ジャーナル。30 (Suppl 1): S51–8。PMID 1601532 。
- ^ Julious, Steven A.; Debarnot, Camille AM (2000). 「なぜ薬物動態データは算術平均でまとめられるのか?」Journal of Biopharmaceutical Statistics . 10 (1): 55–71. doi :10.1081/BIP-100101013. PMID 10709801. S2CID 2805094.
- ^ Reed, JF; Lynn, F; Meade, BD (2002). 「定量的アッセイの変動性評価における変動係数の使用」Clin Diagn Lab Immunol . 9 (6): 1235–1239. doi :10.1128/CDLI.9.6.1235-1239.2002. PMC 130103. PMID 12414755 .
- ^ Sawant, S.; Mohan, N. (2011)「FAQ: SAS を使用した臨床試験データの有効性分析に関する問題」 Wayback Machineに 2011 年 8 月 24 日にアーカイブ、PharmaSUG2011、論文 PO08
- ^ Schiff, MH; et al. (2014). 「関節リウマチ患者におけるメトトレキサートの経口投与と皮下投与の直接比較ランダム化クロスオーバー試験:15 mg以上の用量での経口メトトレキサートの薬剤曝露限界は皮下投与で克服できる可能性がある」Ann Rheum Dis . 73 (8): 1–3. doi :10.1136/annrheumdis-2014-205228. PMC 4112421. PMID 24728329 .
- ^カークウッド、TBL ( 1979)。「幾何平均と分散の測定」バイオメトリクス。35 (4): 908–9。JSTOR 2530139 。
- ^ ブローバーマン、サミュエル A. (2001)。Actex 学習マニュアル、コース 1、保険数理士協会試験、損害保険数理協会試験 1 (2001 版)。ウィンステッド、コネチカット州: Actex Publications。p. 104。ISBN 9781566983969. 2014年6月7日閲覧。
- ^ 「混合度の測定 - 粉末混合物の均質性 - 混合物の品質 - PowderProcess.net」www.powderprocess.net。 2017年11月14日時点のオリジナルよりアーカイブ。2018年5月2日閲覧。
- ^ Banka, A; Dumont, B; Franklin, J; Klemm, G; Mudry, R (2018). 「ESP の正確な CFD と物理モデリングのための改良された方法論」(PDF)。国際静電集塵学会 (ISESP) 会議 2018。
- ^ 「F7 - ファブリック フィルター ガス フロー モデル研究」(PDF)。Institute of Clean Air Companies (ICAC)。1996 年。
- ^ Rodbard, D (1974年10月). 「放射免疫測定法および免疫放射測定法の統計的品質管理と日常的なデータ処理」.臨床化学. 20 (10): 1255–70. doi : 10.1093/clinchem/20.10.1255 . PMID 4370388.
- ^ Eisenberg, Dan (2015). 「qPCRテロメア長アッセイの改善:ウェル位置の影響を制御することで統計的検出力が向上する」。American Journal of Human Biology . 27 (4): 570–5. doi :10.1002/ajhb.22690. PMC 4478151. PMID 25757675 .
- ^ Eisenberg, Dan TA (2016年8月30日). 「テロメア長測定の妥当性: 変動係数は無効であり、定量的ポリメラーゼ連鎖反応法とサザンブロット法のテロメア長測定法の比較には使用できません」. International Journal of Epidemiology . 45 (4): 1295–1298. doi : 10.1093/ije/dyw191 . ISSN 0300-5771. PMID 27581804.
- ^ チャンパーノーン、DG; コーウェル、FA (1999)。経済不平等と所得分配。ケンブリッジ大学出版局。
- ^ カンパーノ、F.サルバトーレ、D. (2006)。所得分配。オックスフォード大学出版局。
- ^ abcde Bellu, Lorenzo Giovanni; Liberati, Paolo (2006). 「不平等に対する政策の影響 – 単純な不平等測定法」(PDF)。EASYPol 、分析ツール。FAO政策支援部、政策支援サービス。 2016年8月5日時点のオリジナルよりアーカイブ(PDF) 。2016年6月13日閲覧。
- ^ Eerkens , Jelmer W.; Bettinger, Robert L. (2001 年 7 月)。「遺物の集合における標準化を評価するための技術: 物質のばらつきをスケールできるか?」American Antiquity。66 ( 3): 493–504。doi :10.2307/2694247。JSTOR 2694247。S2CID 163507589 。
- ^ Roux, Valentine (2003). 「陶磁器の標準化と生産の強度: 専門化の程度の定量化」. American Antiquity . 68 (4): 768–782. doi :10.2307/3557072. ISSN 0002-7316. JSTOR 3557072. S2CID 147444325.
- ^ Bettinger, Robert L.; Eerkens, Jelmer (1999 年 4 月)。「先史時代のグレートベースン におけるポイント類型、文化の伝達、弓矢技術の普及」。American Antiquity。64 ( 2): 231–242。doi :10.2307/2694276。JSTOR 2694276。S2CID 163198451 。
- ^ Wang, Li-Ying; Marwick, Ben (2020年10月). 「陶器の形状の標準化:台湾北東部の鉄器時代の陶器の事例研究」. Journal of Archaeological Science: Reports . 33 : 102554. Bibcode :2020JArSR..33j2554W. doi :10.1016/j.jasrep.2020.102554. S2CID 224904703.
- ^ Krishnamoorthy, K.; Lee, Meesook (2014 年 2 月). 「正規分布の変動係数の等式に関する改良検定」.計算統計. 29 (1–2): 215–232. doi :10.1007/s00180-013-0445-2. S2CID 120898013.
- ^ Marwick, Ben; Krishnamoorthy, K (2019). cvequality: 複数グループの変動係数の等価性を検定する。R パッケージ バージョン 0.2.0。
- ^ Hendricks, Walter A.; Robey, Kate W. (1936). 「変動係数の標本分布」.数理統計年報. 7 (3): 129–32. doi : 10.1214/aoms/1177732503 . JSTOR 2957564.
- ^ Iglevicz, Boris; Myers, Raymond (1970). 「サンプル変動係数のパーセンテージポイントへの近似値の比較」Technometrics . 12 (1): 166–169. doi :10.2307/1267363. JSTOR 1267363.
- ^ Bennett, BM (1976)。「変動係数の均一性の近似テストについて」。応用統計学への貢献。Experientia Supplementum。第 22 巻。pp. 169–171。doi : 10.1007 / 978-3-0348-5513-6_16。ISBN 978-3-0348-5515-0。
- ^ Vangel, Mark G. (1996). 「正規分布の変動係数の信頼区間」.アメリカ統計学者. 50 (1): 21–26. doi :10.1080/00031305.1996.10473537. JSTOR 2685039.。
- ^ Feltz, Carol J; Miller, G. Edward (1996). 「k 個の母集団からの変動係数の等式に関する漸近検定」.医学統計. 15 (6): 647. doi :10.1002/(SICI)1097-0258(19960330)15:6<647::AID-SIM184>3.0.CO;2-P. PMID 8731006.
- ^ Forkman, Johannes (2009). 「正規分布における一般的な変動係数の推定量と検定」(PDF) . Communications in Statistics – Theory and Methods . 38 (2): 21–26. doi :10.1080/03610920802187448. S2CID 29168286. 2013年12月6日時点のオリジナルより アーカイブ(PDF) . 2013年9月23日閲覧。
- ^ Krishnamoorthy, K; Lee, Meesook (2013). 「正規分布の変動係数の等式に関する改良検定」.計算統計. 29 (1–2): 215–232. doi :10.1007/s00180-013-0445-2. S2CID 120898013.
- ^ Liu, Shuang (2012). 変動係数の信頼区間推定(論文). ジョージア州立大学. p.3. 2014年3月1日時点のオリジナルよりアーカイブ。2014年2月25日閲覧。
- ^ Lehmann, EL (1986).統計的仮説の検定。第2版。ニューヨーク: Wiley。
外部リンク
- cvequality:複数の変動係数間の有意差をテストするためのRパッケージ
