統計学において、加法平滑化(ラプラス平滑化[ 1 ]またはリッドストーン平滑化とも呼ばれる)は、カウントデータを平滑化し、特定の値が0回出現することによって生じる問題を解消するために使用される手法である。観測カウントのセットが与えられた場合、から次元多項分布試行では、カウントの「平滑化」バージョンが推定器に
平滑化されたカウントまた、「擬似カウント」α > 0 は平滑化パラメータであり、α = 0 は平滑化なしに対応します (このパラメータについては、以下の§ 擬似カウントで説明します)。加法平滑化は収縮推定量の一種であり、結果として得られる推定値は経験的確率(相対頻度)と の間になります。および一様確率αの一般的な選択肢は0 (平滑化なし)、+ 1 ⁄ 2 (ジェフリーズ事前分布)、または 1 (ラプラスの継承規則) ですが、[ 2 ] [ 3 ]パラメータは観測データに基づいて経験的に設定することもできます。
ベイズの観点から見ると、これは、パラメータαを持つ対称ディリクレ分布を事前分布として使用した場合の事後分布の期待値に相当します。カテゴリ数が2の特殊なケースでは、これは二項分布のパラメータの共役事前分布としてベータ分布を使用することと同等です。
ラプラスはこの平滑化手法を、明日太陽が昇る確率を推定しようとした際に考案しました。彼の論理は、太陽が昇る日のサンプルが多数与えられたとしても、明日太陽が昇るかどうかを完全に確信することはできない(日の出問題として知られている)というものでした。[ 4 ]
擬似カウントとは、観測されたケース数に加算される量(その名前にもかかわらず、一般的には整数ではない)であり、そのデータがゼロでない場合に、そのデータのモデルにおける期待確率を変更するために使用されます。擬似カウントは、おおまかに言えば、値が 1 のときに、その値が 1 のときに、その値各カテゴリが追加のカウントを持つのと同様に、事後分布に重み付けされます。各項目の出現回数はからサンプル、イベントの経験的確率は
しかし、加法的に平滑化した場合の事後確率は
それぞれのカウントを増やすかのようにによる先験的に。
事前知識(時には主観的な値)に応じて、擬似カウントは任意の非負の有限値をとることができます。定義上不可能な場合(例えば、πの10進数桁が文字である可能性)、またはπの有効なプログラムを実行したときにコンピュータが文字を出力するなど、物理的に拒否されてカウントされない可能性、あるいは0と1のみに関心がある場合など、関心がないため除外されてカウントされない場合にのみ、擬似カウントはゼロ(または可能性が無視される)になります。一般に、有限時間内に計算または観測可能な値がない可能性もあります(停止問題を参照)。しかし、少なくとも1つの可能性はゼロ以外の擬似カウントを持つ必要があります。そうでなければ、最初の観測前に予測を計算することはできません。擬似カウントの相対値は、それらの可能性の相対的な事前期待確率を表します。擬似カウントの合計(非常に大きくなる可能性があります)は、期待確率を決定する際に、すべての実際の観測(それぞれ1つずつ)と比較した事前知識の推定重みを表します。
観測されたデータセットやサンプルには、特に発生確率の低い事象やデータセットが小さい場合、起こりうる事象が発生しない可能性があります。そのため、観測された頻度はゼロとなり、確率もゼロであるように見えます。しかし、このような単純化は不正確であり、特に人工ニューラルネットワークや隠れマルコフモデルなどの確率ベースの機械学習手法においては、しばしば役に立ちません。まれな(ただし不可能ではない)事象の確率を人為的に調整し、その確率が厳密にはゼロにならないようにすることで、ゼロ頻度の問題を回避できます。クロムウェルのルールも参照してください。
一般的なアプローチの一つは、観測された事象の数(ゼロの場合も含む)にそれぞれ1を加えることです。これはラプラスの継承法則と呼ばれることもあります。このアプローチは、各事象の確率に対して一様事前分布を仮定することと同等です(各確率が0から1の間であり、それらの合計がすべて1になる単体を網羅します)。
ジェフリーズ事前分布を用いる場合、考えられる各結果に1/2の擬似カウントを追加する必要がある。
擬似カウントは、事前知識がまったくない場合にのみ、1 または 1/2 に設定する必要があります(無差別原理を参照)。ただし、適切な事前知識がある場合は、反証があるにもかかわらず、事前確率が正しいとみなされるべきであるという期待に比例して合計を調整する必要があります(さらなる分析を参照)。真の値に関する事前知識がある限り (たとえば、ミントコンディションのコインの場合)、高い値が適切です。バイアスが存在する可能性が高いが程度が不明な事前知識がある限り (たとえば、曲がったコインの場合)、低い値が適切です。
特に二項データの場合、擬似カウントを動機付ける方法の1つは、区間推定値、特に二項比率信頼区間の中点の式を用いることです。最もよく知られているのは、エドウィン・ビッドウェル・ウィルソンによるもので、ウィルソン(1927)の式です。ウィルソンスコア区間の中点は、次のようになります。両側の標準偏差は
取95%信頼区間を近似するための標準偏差( ) は各結果に対して擬似カウント 2 を生成し、合計 4 となり、これは俗に「プラス 4 ルール」として知られています。
これは、Agresti-Coull 区間 の中間点でもあります( Agresti & Coull 1998 )。
未知の試験対象集団のバイアスは、既知のパラメータ(発生率)を持つ対照集団と比較して検証されることが多い。この場合、一様確率対照群の既知の発生率に置き換えるべきである平滑化推定量を計算するには:
一貫性チェックとして、経験的推定値がたまたま発生率と等しい場合、つまり平滑化推定量は独立しているまた、発生率にも等しい。
加法平滑化は、ナイーブベイズ分類器の構成要素としてよく用いられます。
自然言語処理および情報検索の単語バッグモデルでは、データは文書内の各単語の出現回数で構成されます。加算平滑化により、サンプルに出現しない単語にゼロ以外の確率を割り当てることができます。研究によると、加算平滑化は、言語モデルベースの擬似関連性フィードバックやレコメンダーシステムなどのいくつかの検索タスクにおいて、他の確率平滑化方法よりも効果的であることが示されています。[ 5 ] [ 6 ]