ヒルベルグの仮説(ヒルベルグの法則とも呼ばれる)は、量的言語学における仮説、あるいは情報理論における統計法則である。この法則によれば、自然言語テキストや特定の確率過程のサンプルにおける情報量は、サンプル長の劣線形べき乗に比例して増加する。場合によっては、線形項に加えて、別の項も存在する可能性がある。これは、ジップの法則や大規模言語モデルにおけるニューラルスケーリング法則と密接に関連している。
ヒルベルクの仮説は、ドイツの通信技術者ヴォルフガング・ヒルベルク[ 1 ]によって1990年に提唱された[ 2 ] 。これは、クロード・シャノンが1951年に発表した英語テキストの予測可能性に関するデータに基づいている[ 3 ] 。ヒルベルクは、文字あたりの新しい情報量が文脈の長さとともにべき乗則に従って減少するように見えることを観察した。彼の分析は、シャノンエントロピーが長さのテキストブロックおよそ
パラメータはプロセスのエントロピー率であり、パラメータである。はヒルベルグ指数と呼ばれます。[ 4 ]に比例する項これは記憶効果を表しており、人間の言語が大量の情報を反復的に伝達することを示唆している。ヒルバーグは当初、そして視覚的に乏しい証拠に基づいて仮説を立てた。[ 2 ]ヒルバーグの論文は地元の電気通信ジャーナルに掲載され、当初は複雑系を研究している物理学者たちの目に留まった。[ 5 ] [ 6 ] [ 7 ] [ 8 ]
ヒルバーグの仮説は、書き言葉や話し言葉には、有限状態の隠れマルコフモデルでは捉えられない、潜在的に無限の記憶または長距離の統計的依存関係が存在することを示唆している。ヒルバーグの仮説に基づく有限状態モデルの反駁は、暗記して覚えなければならない無制限の任意語彙に関するジップの法則と精神的に近い。 [ 9 ]このメカニズムは、自然言語の構文を処理するプッシュダウンオートマトンによる無制限のスタックに基づく有限状態モデルの反駁とは異なり、後者の議論は、1957年にノーム・チョムスキーが『構文構造』で展開したものである。
「ヒルベルグの仮説」とは対照的に、「ヒルベルグの法則」または「ヒルベルグの条件」という用語は、べき乗則スケーリングを満たすあらゆる定常過程に適用されることが多い。[ 9 ]数量は、シャノンエントロピー、(リソース制約のある)コルモゴロフ複雑度[ 10 ]、またはユニバーサルコードの長さ[ 11 ]など、さまざまな情報尺度を表す可能性があります。ディープラーニングの文脈では、ニューラルスケーリング法則という用語は、クロスエントロピーで測定される大規模言語モデルのパフォーマンスが、データサイズ、モデルパラメータ、または計算によってどのように向上するかを記述する類似のべき乗則関係に使用されます[ 12 ] 。また別の表現では、長さの隣接する2つのテキストブロック間の相互情報量が含まれます。、
この概念を用いると、ヒルベルグの法則は以下と同等である。
このバージョンはエントロピー率の正確な値に依存しないため、理論研究で使用されます。[ 13 ]
ヒルベルグ指数の値適用された情報尺度、あるいはユニバーサルコードの場合は圧縮アルゴリズムに大きく依存する。同時に、特定の言語や表記体系を超えて ある程度の普遍性を示し、英語、フランス語、ロシア語、韓国語、中国語、日本語のニュースコーパスで実行される部分一致コードによる予測について。 [ 11 ] [ 14 ]
ヒルベルグの仮説の直感的な意味は、ヒルベルグの法則とジップの法則を結びつける定常過程のいくつかのおもちゃのモデルによって動機づけられる。この法則は、暗記する必要のある無制限の任意の語彙に対して適用される。同様に、次の例は、無制限の量のアルゴリズム的にランダムな知識を繰り返し伝える理想化された情報源とみなすことができる。[ 13 ]この知識は、不変である場合もあれば、非エルゴード的または周縁的プロセスを生み出す場合もあり、[ 15 ] [ 16 ]あるいは、ゆっくりと進化し、混合プロセスを生み出す場合もある。[ 17 ]先験的に、この知識は、特定の語彙の知識とは異なる事実も符号化する可能性がある。[ 15 ]
ヒルベルグの法則を満たす確率過程の単純なモデルサンタフェ過程によって与えられる。サンタフェ過程は定常非エルゴード過程である。ペアで構成される、 どこは、ジップの法則に従って分布する独立したランダムな自然数の列である。そしては一様ベルヌーイ過程、すなわち公平なコイン投げの連続である。[ 15 ] [ 18 ]過程物語とプロセスと呼ばれる知識と呼ばれる。[ 9 ] 個々の変数これらは(独立した基本的な)事実と呼ばれます。[ 15 ]
一般に、ヒルバーグの法則は、情報尺度としてシャノンエントロピーまたはコルモゴロフ複雑性のどちらを考慮するかによって、非エルゴード過程またはペリグラフィック過程のどちらにも適用できる。ペリグラフィック過程は、非原子不変シグマ代数を持つ非エルゴード過程のアルゴリズム的にランダムなエルゴード成分とほぼ同義である。ペリグラフィック過程の一例として、修正サンタフェ過程が挙げられる。ペアで構成されるどこは、停止確率などの固定されたアルゴリズム的にランダムなバイナリシーケンスです。[ 16 ]
ヒルバーグの法則は、一部の混合プロセスにも当てはまる可能性がある。そのようなプロセスの例として、改良型サンタフェプロセスが挙げられる。ペアで構成されるどこは独立したバイナリマルコフ過程の集合であり、反転確率は言及されている確率よりも小さい[ 17 ]
サンタフェプロセスのデフォルトの例では、エントロピー率は正です。ヒルバーグの法則に従うエントロピー率がゼロになるプロセスの例もあり、これらは多周期プロセスと呼ばれます。[ 19 ]
ヒルベルグの仮説は、量的言語学、情報理論、そしてスケーリング挙動に関する現代の機械学習研究を結びつけるものです。数学的定理を用いることで、ヒルベルグの法則は、有限集合、可算無限集合、または非可算集合上の定常過程におけるいくつかの類似条件と関連付けることができます。
ヒルバーグの法則は、 文法に基づくコードと部分一致による予測、非エルゴード過程、相互情報量のデータ処理不等式によって、単語のような部分語またはチャンクに対するジップの法則とヒープスの法則に演繹的に結び付けることができる。[ 15 ] [ 16 ] [ 13 ]定常過程に関する一般的な結果があり、事実と単語に関する定理と呼ばれ、隣接する 2 つのテキスト ブロック間の相互情報は、連結されたテキスト ブロックで表現される独立した基本事実の数と異なる単語のような文字列の数によって挟まれると述べている。[ 15 ] [ 16 ] [ 13 ]
ヒルベルグの法則と神経スケーリング法則の間の演繹的な関連性は、現在も研究が続けられているテーマである。[ 18 ] [ 10 ] [ 20 ]
ヒルバーグの仮説は、言語生成が無限の記憶を伴うという証拠として議論されており、有限状態マルコフモデルや隠れマルコフモデルとは対照的である。[ 9 ]一般に、ヒルバーグの法則は有限状態隠れマルコフモデルとは相容れない。過去と未来の間の相互情報量過剰エントロピー[ 8 ]または予測情報[ 7 ] [ 21 ]と呼ばれる。有限状態隠れマルコフモデル[ 8 ]および非退化自己回帰移動平均ガウス過程[ 22 ]に対しては、条件が成り立つ。非原子不変シグマ代数を持つ非エルゴード過程に対して成り立つ。[ 13 ]また、条件を満たす可算無限状態の隠れマルコフモデルも存在する。[ 23 ]およびヒルベルグの法則。 [ 24 ] [ 9 ]
ヒルバーグの法則と、自然言語で経験的に観察される最大反復長のべき乗則対数スケーリングとの関連性は、より間接的である。 [ 25 ]これは、シャノンエントロピーではなく、レニーエントロピーのべき乗則成長を伴うためである。[ 26 ]
可算アルファベット上の定常過程の場合、ヒルバーグの法則(緩やかな条件下)が2点相互情報量の緩やかな減衰を意味するかどうかは不明である。これは自然言語にも当てはまるようだ。[ 27 ] [ 28 ]非エルゴード的なサンタフェ過程についても、のために。
実数値非退化ガウス過程の場合、条件と同等、 どこは偏自己相関関数である。[ 29 ]さらに、ガウス過程が正かつ連続的なスペクトル密度を持つ場合、条件と同等、 どこは自己相関関数である。[ 30 ]対照的に、長距離依存性条件は[ 31 ]これは、自己相関関数が減衰はべき乗則に厳密に従う。したがって、ヒルバーグの法則は、過程がガウス分布に従い、スペクトル密度が正かつ連続であり、自己相関関数がべき乗則に従う場合、長距離依存性を意味する。