ベクトル量子化(VQ)は、信号処理における古典的な量子化手法であり、プロトタイプベクトルの分布によって確率密度関数をモデル化することを可能にします。1980年代初頭にロバート・M・グレイによって開発され、当初はデータ圧縮に用いられていました。この手法は、多数の点(ベクトル)を、互いに最も近い点の数がほぼ同じになるようにグループに分割することで機能します。各グループは、 k-means法やその他のクラスタリングアルゴリズムと同様に、その中心点によって表されます。簡単に言えば、ベクトル量子化は、より大きな点の集合を表すために、点の集合を選択する手法です。
ベクトル量子化の密度マッチング特性は強力で、特に大規模かつ高次元データの密度を特定するのに有効です。データ点は最も近い重心のインデックスで表されるため、頻繁に出現するデータは誤差が少なく、まれにしか出現しないデータは誤差が大きくなります。これが、VQが非可逆データ圧縮に適している理由です。また、非可逆データの補正や密度推定にも使用できます。
ベクトル量子化は競合学習パラダイムに基づいているため、自己組織化マップモデルや、オートエンコーダなどの深層学習アルゴリズムで使用されるスパースコーディングモデルと密接に関連しています。
ベクトル量子化のためのシンプルなトレーニングアルゴリズムの1つは次のとおりです。[ 1 ]
より高度なアルゴリズムでは、感度パラメータを追加することで、密度マッチング推定におけるバイアスを低減し、すべての点が確実に使用されるようにします。
収束を促すために冷却スケジュールを用いることが望ましい(シミュレーテッドアニーリングを参照)。もう一つの簡単な方法は、 k-meansに基づくLBGである。
このアルゴリズムは、データセットからランダムに点を選択するのではなく、「ライブ」データを用いて反復的に更新することができるが、データが多数のサンプルにわたって時間的に相関している場合は、何らかのバイアスが生じる可能性がある。
ベクトル量子化は、非可逆データ圧縮、非可逆データ補正、パターン認識、密度推定、クラスタリングなどに用いられる。
損失データ補正、または予測は、一部の次元で欠落しているデータを復元するために使用されます。これは、利用可能なデータ次元を持つ最も近いグループを見つけ、欠落している次元の値に基づいて結果を予測することによって行われます。この予測では、欠落している次元の値はグループの重心と同じ値を持つと仮定します。
密度推定においては、特定の重心に最も近い面積/体積は、他のどの重心よりも近い面積/体積は、密度に反比例します(アルゴリズムの密度マッチング特性による)。
ベクトル量子化は、「ブロック量子化」または「パターンマッチング量子化」とも呼ばれ、非可逆データ圧縮でよく用いられます。これは、多次元ベクトル空間の値を、より低次元の離散部分空間の有限個の値に符号化することで機能します。低次元ベクトルは必要な記憶容量が少なくなるため、データが圧縮されます。ベクトル量子化の密度マッチング特性により、圧縮されたデータのエラーは密度に反比例します。
変換は通常、射影またはコードブックを用いて行われます。場合によっては、コードブックを用いて離散値をエントロピー符号化し、プレフィックス符号化された可変長の値を出力として生成することも可能です。
離散的な振幅レベルのセットは、各サンプルを個別に量子化するのではなく、まとめて量子化されます。k次元ベクトルを考えてみましょう。振幅レベルの集合。n次元ベクトルの集合から最も近い一致するベクトルを選択することによって圧縮される。n < kの場合。
n次元ベクトルのすべての可能な組み合わせ量子化されたすべてのベクトルが属するベクトル空間を形成する。
量子化された値の代わりに、コードブック内のコードワードのインデックスのみが送信されます。これにより、スペースが節約され、より高い圧縮率が実現されます。
ツインベクトル量子化(VQF)は、時間領域重み付きインターリーブベクトル量子化を扱うMPEG-4規格の一部です。
ベクトル量子化に基づくビデオコーデックの使用は、ベクトル量子化の復号化の複雑さが低いという利点が薄れてきたため、モーション補償予測と変換符号化を組み合わせたコーデック(例えばMPEG規格で定義されているもの)の使用に比べて大幅に減少している。
VQは80年代には音声[ 5 ] や話者認識[ 6 ]にも使用されていました。最近では、効率的な最近傍探索[ 7 ] やオンライン署名認識[ 8 ]に も使用されています。パターン認識アプリケーション では、各クラス(生体認証アプリケーションでは各クラスがユーザー)ごとに、そのユーザーの音響ベクトルを使用して1つのコードブックが構築されます。テストフェーズでは、トレーニングフェーズで取得したコードブックの全セットを使用して、テスト信号の量子化歪みが計算されます。最小のベクトル量子化歪みを提供するコードブックが、識別されたユーザーを示します。
パターン認識における VQ の主な利点は、動的時間伸縮(DTW) や隠れマルコフモデル(HMM)などの他の手法と比較して計算負荷が低いことです。DTW や HMM と比較した場合の主な欠点は、すべてのベクトルが混ざり合っているため、信号 (音声、署名など) の時間的変化を考慮しないことです。この問題を克服するために、マルチセクションコードブックアプローチが提案されています。[ 9 ]マルチセクションアプローチは、信号を複数のセクション (たとえば、最初の部分用のコードブック、中央用のコードブック、最後の部分用のコードブック) でモデル化することから成ります。
VQは、近くにあるサンプルの密度点として重心を探すため、プロトタイプベースのクラスタリング手法としても直接使用できます。各重心は1つのプロトタイプに関連付けられます。期待される二乗量子化誤差[ 10 ]を最小化することを目指し、Robbins-Monro条件を満たす減少学習ゲインを導入することで、具体的な固定数のプロトタイプを使用してデータセット全体に対して複数回の反復を行うことで、 k-meansクラスタリングアルゴリズムの解に段階的に収束します。
VQは、敵対的生成ネットワークの識別器の特徴表現層を量子化するために使用されてきました。特徴量子化(FQ)技術は、暗黙的な特徴マッチングを実行します。[ 11 ]これはGANのトレーニングを改善し、画像生成用のBigGAN、顔合成用のStyleGAN、教師なし画像間変換用のU-GAT-ITなど、さまざまな人気のあるGANモデルでパフォーマンスを向上させます。
サブトピック
関連トピック
この記事の一部は、もともとFree On-line Dictionary of Computingの資料に基づいており、GFDLの許可を得て使用しています。