
正確さと精度は観測誤差の尺度であり、正確さとは一連の測定値が真の値にどれだけ近いかを示し、精度とは測定値同士がどれだけ近いかを示す。
国際標準化機構(ISO)は、関連する尺度として真度を定義しています。[ 1 ]真度とは、「多数の試験結果の算術平均と真の値または許容される基準値との一致の近さ」です。

精度はランダム誤差(統計的変動性の尺度) を表すものであるのに対し、正確さには2つの異なる定義がある。
より簡単に言うと、同じ量を繰り返し測定した統計的サンプルまたはデータ点の集合が与えられた場合、そのサンプルまたは集合の平均値が測定対象の量の真の値に近い場合、そのサンプルまたは集合は正確であると言えます。また、その集合の標準偏差が比較的小さい場合、その集合は精密であると言えます。
科学および工学の分野では、測定システムの精度とは、ある量の測定値がその量の真の値にどれだけ近いかを示す度合いです。[ 3 ]再現性と繰り返し性に関連する測定システムの精密さとは、条件を変えずに繰り返し測定を行ったときに同じ結果が得られる度合いです。[ 3 ] [ 4 ] 精密さと精度は口語では同義語として使われることもありますが、科学的方法の文脈では意図的に対比されます。
統計学の分野では、測定値の解釈が中心的な役割を果たすため、正確さや精度の代わりに、バイアスや変動性という用語が好んで用いられる。バイアスは不正確さの度合いであり、変動性は不正確さの度合いである。
測定システムは、正確ではあるが精密ではない、精密ではあるが精密ではない、どちらでもない、あるいは両方である、といった場合があり得る。例えば、実験に系統誤差が含まれている場合、一般的にサンプルサイズを増やすと精密度は向上するが、正確度は向上しない。その結果、欠陥のある実験から一貫性はあるものの不正確な結果が連続して得られることになる。系統誤差を取り除けば正確度は向上するが、精密度は変わらない。
測定システムは、正確かつ精密である場合に有効であるとみなされます。関連する用語には、バイアス(独立変数とは無関係な要因によって引き起こされる、非ランダムまたは方向性のある影響)と誤差(ランダムな変動)があります。
この用語は間接的な測定値、つまり観測データから計算手順によって得られる値にも適用される。
測定には、正確さや精度に加えて、測定分解能という要素も含まれる。これは、測定において反応を生じる、基礎となる物理量の最小変化量である。
数値解析において、精度とは計算結果が真の値にどれだけ近いかを示すものであり、一方、精密度とは表現の分解能を指し、通常は10進数または2進数の桁数によって定義される。
軍事用語では、精度とは主に射撃の精度(justesse de tir)を指し、標的の中心付近での弾痕の密集度によって表される射撃の精密さを意味します。[ 5 ]
これらの用語の意味の変化は、1994年にISO 5725シリーズ規格が発行されたことで現れ、これはBIPM国際計量用語集(VIM)の2008年版の項目2.13および2.14にも反映されている。[ 3 ]
ISO 5725-1 [ 1 ]によると、「精度」という一般的な用語は、測定値が真の値にどれだけ近いかを表すために使用されます。この用語が同じ測定対象の測定値のセットに適用される場合、ランダム誤差の成分と系統誤差の成分が含まれます。この場合、真度は、一連の測定結果の平均が実際の(真の)値、つまり系統誤差にどれだけ近いかであり、精度は、一連の結果間の一致度、つまりランダム誤差の近さです。
ISO 5725-1とVIMは、BS 5497-1で以前規定されていた「バイアス」という用語の使用も避けています[ 6 ]。これは、医学や法律など、科学や工学の分野以外では異なる意味合いを持つためです。
産業計測機器において、精度とは計測機器の測定許容誤差または伝送であり、機器が通常の動作条件下で使用されたときに発生する誤差の限界を定義するものである。[ 7 ]
理想的な測定装置は、正確性と精密性を兼ね備え、測定値はすべて真の値に近く、かつその周囲に密集しているべきである。測定プロセスの正確性と精密性は、通常、トレーサブルな基準値を繰り返し測定することによって確立される。このような基準値は、国際単位系(フランス語のSystème international d'unitésから略してSI )で定義され、米国国立標準技術研究所( NIST)などの国家標準化機関によって維持されている。
これは、測定を繰り返して平均する場合にも当てはまります。その場合、標準誤差という用語が適切に適用されます。平均の精度は、測定プロセスの既知の標準偏差を、平均化された測定回数の平方根で割った値に等しくなります。さらに、中心極限定理によれば、平均化された測定値の確率分布は、個々の測定値の確率分布よりも正規分布に近くなります。
精度に関して言えば、以下のように区別できます。
科学技術分野では、精度や正確さを暗黙のうちに有効数字で表すのが一般的な慣習です。明示的に示されていない場合、誤差範囲は最後の有効数字の半分とみなされます。例えば、843.6 m、843.0 m、または800.0 mという記録は、0.05 mの誤差範囲を意味します (最後の有効数字は小数点以下第1位)。一方、843 mという記録は、 0.5 mの誤差範囲を意味します (最後の有効数字は単位を表します)。
末尾にゼロが付いていて小数点がない8,000 m という読み取り値は曖昧です。末尾のゼロが有効数字として意図されている場合とそうでない場合があります。この曖昧さを避けるために、数値を科学的記数法で表すことができます。8.0 × 10 3 m は最初のゼロが有効数字であることを示し (したがって、50 m のマージン)、8.000 × 10 3 m は 3 つのゼロすべてが有効数字であることを示し、0.5 m のマージンを与えます 。同様に、基本測定単位の倍数を使用することもできます。8.0 km は 8.0 × 10 3 mに相当します。これは 0.05 km (50 m)のマージンを示します。ただし、この慣例に頼ると、この慣例に従わないソースからのデータを受け入れるときに、誤った精度エラーにつながる可能性があります。たとえば、精度が +/- 5,000 である 153,753 のような数値を報告するソースは、精度が +/- 0.5 であるように見えます。慣例に従えば、15万に切り上げられていただろう。
あるいは、科学的な文脈では、誤差範囲をより正確に示したい場合は、7.54398(23) × 10 −10 m のような表記を使用できます。これは、7.54375 から 7.54421 × 10 −10 mの範囲を意味します。
精度には以下が含まれます。
工学分野では、精度は測定値の標準偏差の3倍として定義されることが多く、これは測定値の99.73%が収まる範囲を表します。[ 8 ] 例えば、人間工学者が人体を測定する場合、GRYPHON処理システムを使用する場合は、抽出した測定値の99.73%が±0.7cmの範囲内に収まると確信できます。 未処理データを使用する場合は、±13cmの範囲内に収まります。[ 9 ]
精度は、二値分類テストが状態を正しく識別または除外する能力を統計的に測定する指標としても使用されます。つまり、精度とは、検査した症例の総数に対する正しい予測(真陽性と真陰性の両方)の割合です。 [ 10 ]そのため、事前確率と事後確率の推定値を比較します。意味を明確にするために、「ランド精度」[ 11 ]または「ランド指数」 [ 12 ] [ 13 ]と呼ばれることがよくあります。これはテストのパラメータです。二値精度を定量化する式は次のとおりです。 ここで、TP = 真陽性、FP = 偽陽性、TN = 真陰性、FN = 偽陰性
この文脈では、ISO 5725-1で定義されている真度と精度の概念は適用できません。その理由の一つは、量の「真の値」は一つではなく、あらゆる場合において二つの可能性のある真の値が存在するのに対し、精度はすべての場合における平均値であり、したがって両方の値を考慮に入れるからです。ただし、この文脈では精度という用語は、情報検索の分野に由来する別の指標を意味します(§ 情報システムにおいてを参照)。
多クラス分類で精度を計算する場合、精度は正しく分類された割合です。[ 14 ] [ 15 ] これは通常、パーセンテージで表されます。例えば、分類器が10個の予測を行い、そのうち9個が正しかった場合、精度は90%となります。
精度は、データセット内の特定のクラスの出現頻度や分類器のバイアスに大きく影響されることを強調するために、マイクロメトリックとして捉えられることもあります。[ 14 ]
さらに、畳み込みニューラルネットワークの評価でよく用いられるトップ5精度と区別するために、トップ1精度とも呼ばれます。トップ5精度を評価するには、分類器は各クラスの相対尤度を提供する必要があります。これらをソートすると、正しい分類がネットワークによる上位5つの予測のいずれかに含まれる場合、その分類は正しいとみなされます。トップ5精度はImageNetチャレンジで広く知られるようになりました。2位から5位までの正しい予測はトップ1スコアを向上させませんが、トップ5スコアを向上させるため、通常はトップ1精度よりも高くなります。
心理測定学および精神物理学において、 「精度」という用語は「妥当性」および「一定誤差」とほぼ同義で用いられます。「精密度」は「信頼性」および「変動誤差」の同義語です。測定機器または心理テストの妥当性は、実験または行動との相関によって確立されます。信頼性は、さまざまな統計的手法を用いて確立されます。古典的な手法としては、クロンバックのアルファ係数などの内的整合性テストを用いて、関連する質問群の回答が関連していることを確認し、その後、参照集団と対象集団の間で関連する質問を比較します。

論理シミュレーションにおいて、正確なモデルを評価する際によくある間違いは、論理シミュレーションモデルをトランジスタ回路シミュレーションモデルと比較することです。これは精度の違いを比較しているだけで、正確さを比較しているわけではありません。精度は詳細に関して測定され、正確さは現実に関して測定されます。[ 16 ] [ 17 ]
データベースやウェブ検索エンジンなどの情報検索システムは、さまざまな指標で評価されます。これらの指標の中には、結果を真陽性(正しく取得された文書)、真陰性(正しく取得されなかった文書)、偽陽性(誤って取得された文書)、偽陰性(誤って取得されなかった文書)に分類する混同行列から導き出されたものもあります。一般的に使用される指標には、精度と再現率の概念があります。この文脈では、精度は、人間が選択した一連の正解関連結果を使用して、取得された文書(真陽性÷真陽性+偽陽性)と比較した、正しく取得された文書の割合として定義されます。再現率は、関連文書(真陽性÷真陽性+偽陰性)と比較した、正しく取得された文書の割合として定義されます。あまり一般的ではありませんが、正確度という指標も使用されます。正確度は、文書(真陽性+真陰性÷真陽性+真陰性+偽陽性+偽陰性)と比較した、正しく分類された文書の割合として定義されます。
これらの指標はいずれも検索結果のランキングを考慮していません。ウェブ検索エンジンにとってランキングは非常に重要です。なぜなら、読者は検索結果の最初のページ以降を見ることはほとんどなく、ウェブ上には膨大な数のドキュメントが存在するため、それらすべてを手動で分類して、特定の検索に含めるべきか除外すべきかを判断することは不可能だからです。特定の検索結果数でカットオフを設定することで、ランキングをある程度考慮に入れることができます。たとえば、 k における精度という指標は、上位 10 件 (k=10) の検索結果のみを対象とした精度の指標です。割引累積利得などのより高度な指標は、個々のランキングを考慮に入れており、ランキングが重要な場合によく使用されます。
認知システムでは、認知プロセスがデータ、情報、知識、または知恵をより価値の高い形式に変換するものである場合、正確性と精度は、生物学的または人工的な実体によって実行される認知プロセスの結果を特徴付け、測定するために使用されます。(DIKWピラミッド)認知プロセスは、意図または望ましい出力を正確に生成する場合もあれば、意図または望ましい出力から大きくかけ離れた出力を生成する場合もあります。さらに、認知プロセスの繰り返しは、常に同じ出力を生成するとは限りません。認知精度(C A)は、認知プロセスが意図または望ましい出力を生成する傾向です。認知精度(C P)は、認知プロセスが同じ出力を生成する傾向です。[ 18 ] [ 19 ] [ 20 ] 1人以上の人間が1つ以上の認知システム(コグ)と共同で作業する人間/コグアンサンブルでの拡張された認知を測定するには、認知精度と認知精度の向上は、認知拡張の度合いを測定するのに役立ちます。