アルゴリズム推論は、あらゆるデータアナリストが利用できる強力なコンピューティングデバイスによって可能になった統計的推論手法の新たな発展を集約したものです。この分野の基盤となるのは、計算学習理論、粒度コンピューティング、バイオインフォマティクス、そしてはるか昔に確立された構造確率論(Fraser 1966 )です。主な焦点は、ランダム現象の研究の根幹となる統計量を計算するアルゴリズムと、信頼できる結果を得るためにアルゴリズムが処理しなければならないデータ量にあります。これにより、数学者の関心は分布法則の研究から統計量の関数的特性へと移り、コンピュータ科学者の関心はデータ処理アルゴリズムからアルゴリズムが処理する情報へと移ります。
分布法則のパラメータの特定に関して、熟練した読者は、20世紀半ばに、その変動性を信頼分布(Fisher 1956 )、構造確率(Fraser 1966 )、事前確率/事後確率(Ramsey 1925 )などの観点から解釈することに関する長きにわたる論争を思い出すかもしれない。認識論的な観点から言えば、これは確率の本質に関する付随的な論争を伴った。確率は、確率変数によって記述されるべき現象の物理的特徴なのか、それとも現象に関するデータを統合する方法なのか。後者を選択したFisherは、与えられた確率変数の仕様のサンプルから推論した、そのパラメータの信頼分布法則を定義した。この法則を用いて、彼は例えば「μ(ガウス変数の平均)が任意の割り当て値より小さい確率、またはμが任意の割り当て値の間にある確率、つまり、観測された標本に基づいてその確率分布を計算する」。
フィッシャーは、ベイズの事後分布、フレーザーの構成的確率、ネイマンの信頼区間といった類似の概念と比較して、自身のパラメータ分布の概念の相違点と優位性を擁護するために懸命に戦った。半世紀にわたり、ネイマンの信頼区間は、確率の現象論的性質を理由に、あらゆる実際的な目的において勝利を収めた。この観点から、ガウス変数を扱う場合、その平均μは、観測対象の現象の物理的特徴によって固定される。ここで、観測はランダム演算子であり、したがって、観測値はランダムサンプルの仕様である。ランダム性のため、サンプルから、固定されたμを含む特定の区間を、信頼度を表す特定の確率で計算することができる。
X をパラメータを持つガウス変数とする[ 1 ]そしてそしてそこから抽出したサンプル。統計学の活用
そして
は標本平均であり、
は、パラメータ(自由度)m - 1のスチューデントのt分布(Wilks 1962 )に従うので、
2 つの分位点間のTを測定し、その式を関数として反転する信頼区間を取得する。
サンプル仕様は以下のとおりです。
サイズm = 10 の場合、統計を計算しますそして、そして、0.90の信頼区間を得る。極値(3.03、5.65 )を含む。
モデリングの観点から見ると、この論争全体は鶏と卵のジレンマのように見えます。つまり、まずデータを固定し、その結果として特性の確率分布を求めるか、あるいはまず特性を固定し、その結果として観測データの確率分布を求めるかのどちらかです。古典的な解決策には、利点と欠点がそれぞれ1つずつあります。前者は、人々がまだ紙と鉛筆で計算をしていた時代には特に高く評価されていました。固定パラメータθのネイマン信頼区間を計算する作業自体は困難です。θはわかりませんが、おそらく失敗する確率が非常に低い区間をθの周りに配置する必要があります。解析解は、非常に限られた数の理論的なケースにのみ適用可能です。 逆に、ガウス分布の周りの信頼区間に関して中心極限定理を用いることで、さまざまなインスタンスを近似的に迅速に解決できます。これが利点です。欠点は、中心極限定理はサンプルサイズが十分に大きい場合にのみ適用可能であることです。したがって、現代の推論インスタンスに関わるサンプルでは、適用可能性がますます低くなっています。問題はサンプルサイズ自体にあるのではありません。むしろ、推論問題の複雑さを考えると、このサイズでは十分ではない。
大規模な計算設備が利用可能になったことで、科学者たちは孤立したパラメータの推論から複雑な関数の推論、つまり関数を識別する高度にネストされたパラメータの集合へと焦点を移しました。このような場合、私たちは情報量の多いサンプルに基づいて関数を学習すること(例えば、回帰、ニューロファジーシステム、または計算学習の観点から)について語ります。データをリンクする複雑な構造を持つことの最初の効果は、サンプルの自由度の数の減少、つまりサンプルポイントの一部が焼却されることであり、中心極限定理で考慮される有効なサンプルサイズが小さすぎます。与えられた信頼水準で学習誤差が限定されることを保証するサンプルサイズに焦点を当てると、結果として、このサイズの下限は、VC次元や学習したい関数が属するクラスの詳細などの複雑性指標とともに増加します。
1,000 個の独立したビットのサンプルがあれば、基礎となるベルヌーイ変数のパラメータpの推定における絶対誤差を、少なくとも0.99 の信頼度で最大 0.081 に抑えるのに十分です。同じサイズでは、ニューヨークに住む 20 歳の男性が 1,000 人のニューヨーク市民の身長、体重、ウエストラインの範囲に当てはまらない確率を誤差として特定する場合、同じ 0.99 の信頼度で 0.088 未満の閾値を保証することはできません。精度不足は、VC 次元と、1,000 人の市民の範囲から観測されたものが含まれる平行六面体のクラスの詳細の両方が 6 に等しいために発生します。
サンプルサイズが不十分な場合、固定サンプル-ランダム特性というアプローチでは、推論手順を3つのステップで提案します。
例:Xがパラメータaとkを持つパレート分布に従う 場合、
サンプリング機構シードUを持つXの場合、 以下のように読み取れます。
または同等に、例。上記のマスター方程式から、2つのパラメータを導き出すことができます。以下の連立方程式を解くことにより、観測されたサンプルと互換性のある結果を得る。
どこそして観測統計と均一なシードのセットを用意します。シードに影響を与える確率(密度)をパラメータに伝達することで、観測された統計と一致するランダムパラメータAとKの分布法則が得られます。
互換性とは、互換性のある母集団のパラメータ、すなわち、観測された統計値を生み出すサンプルを生成できた可能性のある母集団のパラメータを指します。この概念は次のように定式化できます。確率変数とそこから抽出されたサンプルについて互換性のある分布とは、同じサンプリングメカニズムを持つ分布のことである。値を持つXランダムパラメータの良好な性質を持つ統計量sに基づくマスター方程式から導出される。


左の図に示すように、パレートパラメータA とKの分布法則は、母集団ブートストラップ 法の実装例として見つけることができます。
ねじり引数法を実装すると 、分布法則が得られます。 統計量に基づくガウス変数Xの平均 Mについて いつ に等しいことが知られています (アポロニ、マルキオディ、ガイト 2006 )。その表現は次のとおりです。

分布関数が与えられた場合のMの信頼区間を計算するのは簡単です。2つの分位数を見つけるだけで済みます(例えば そして 統計量s mの異なる値に対する 2 つの境界の挙動を示す図の左側に示されているように、レベル δ の信頼区間 (裾の確率に関して対称) に関心がある場合の分位数。
フィッシャーのアプローチの弱点は、ガウス分布の平均と分散など、複数のパラメータの同時分布にあります。一方、最後のアプローチ(および前述の方法:母集団ブートストラップとツイスト引数)では、多くのパラメータの同時分布を学習できます。たとえば、2つ以上のパラメータの分布に焦点を当てると、以下の図では、学習する関数が90%の信頼度で収まる2つの信頼領域を示しています。前者は、拡張サポートベクターマシンがバイナリラベル1を点に割り当てる確率に関するものです。平面。2 つの表面は、特定の分布法則に従ってラベル付けされた一連のサンプル点に基づいて描画されます( Apolloni et al. 2008 )。後者は、打ち切りサンプルから計算された乳がん再発のハザード率の信頼領域に関するものです( Apolloni、Malchiodi & Gaito 2006 )。
アドバンスト・ナレッジ・インターナショナル