Loading article…
損失カウントアルゴリズムは、データストリーム内の要素のうち、出現頻度がユーザー指定の閾値を超える要素を識別するアルゴリズムです。このアルゴリズムは、データストリームを頻繁に出現する要素ごとにバケットに分割しますが、メインメモリには可能な限り多くのバケットを一度に書き込みます。このアルゴリズムで計算される頻度は必ずしも正確ではありませんが、ユーザーが指定できる誤差閾値が存在します。アルゴリズムの実行時間とメモリ使用量は、指定された誤差閾値に反比例します。つまり、誤差が大きいほど、フットプリントは小さくなります。
このアルゴリズムは、コンピュータ科学者のラジーブ・モトワニ氏とグルミート・シン・マンク氏によって開発されました。ネットワークトラフィック測定、ウェブサーバーログ、クリックストリームなど、データが有限のデータセットではなく連続的なデータストリームの形式をとる計算処理に応用されています。
一般的なアルゴリズムは以下のとおりです[ 1 ]