ニューラルネットワークにおいて、プーリング層は、多数のベクトルに分散している情報をダウンサンプリングして、より少ないベクトルに集約するネットワーク層の一種です。 [1]プーリング層にはいくつかの用途があります。冗長な情報を削除して、必要な計算量とメモリの量を減らし、入力の小さな変化に対してモデルをより堅牢にし、ネットワークの後の層のニューロンの受容野を拡大します。
畳み込みニューラルネットワークプーリング
プーリングは、畳み込みニューラル ネットワーク(CNN)で最もよく使用されます。以下は、2 次元 CNN でのプーリングの説明です。n 次元への一般化はすぐに行えます。
表記として、テンソル を考えます。ここで、は高さ、は幅、 はチャネル数です。プーリング層はテンソル を出力します。
「フィルタ サイズ」(別名「カーネル サイズ」) と「ストライド」という2 つの変数を定義します。水平方向と垂直方向で異なるフィルタ サイズとストライドを使用する必要がある場合もあります。そのような場合は、4 つの変数を定義します。
出力テンソル内のエントリの受容フィールドは、そのエントリに影響を与える可能性のあるすべてのエントリです。
最大プーリング

最大プーリング (MaxPool) は、特徴マップの空間次元を削減するために CNN でよく使用されます。
を定義します。ここで、 は範囲 を意味します。off -by-one エラー を避ける必要があることに注意してください。次の入力は となり、以下同様に続きます。 の受容野はであるため、一般に、水平フィルタ サイズと垂直フィルタ サイズおよびストライドが異なる場合は、一般に、 となります。より簡潔に言えば、 と書くことができます。

が整数として表現できない場合、境界上の出力テンソルのエントリを計算するために、最大プーリングはテンソルから変数を入力として取得しようとします。この場合、存在しない変数がどのように処理されるかは、右側に示すように、 パディング条件によって異なります。
グローバル最大プーリング (GMP) は、出力テンソルが の形状を持ち、 の受容野が のすべてである特殊な種類の最大プーリングです。つまり、各チャネル全体の最大値を取得します。これは、CNN 分類ヘッドの最後の完全接続層の直前でよく使用されます。
平均プーリング
平均プーリング(AvgPool)も同様に定義されます。グローバル平均プーリング(GAP)はGMPと同様に定義されます。これはNetwork-in-Networkで最初に提案されました。[2] GMPと同様に、CNN分類ヘッドの最後の完全接続層の直前で使用されることがよくあります。
補間
最大プーリングと平均プーリングの補間がいくつかあります。
混合プーリングは、最大プーリングと平均プーリングの線形和である。[3]つまり、
ここで、はハイパーパラメータ、学習可能なパラメータ、または毎回ランダムに新たにサンプリングされるパラメータのいずれかです。
Lpプーリングは平均プーリングに似ていますが、平均の代わりにLpノルム平均を使用します。ここで、は受容野のサイズ、はハイパーパラメータです。すべての活性化が非負の場合、平均プーリングは の場合であり、最大プーリングは の場合です。平方根プーリングは の場合です。[4]
確率的プーリングは受容野からランダムな活性化を確率でサンプリングする。これは期待値における平均プーリングと同じである。[5]
ソフトマックスプーリングはマックスプーリングに似ていますが、ソフトマックスを使用します。つまり、の場合です。平均プーリングは の場合であり、マックスプーリングは の場合です[4]
ローカル重要度ベースプーリングは、学習可能な関数であるソフトマックスプーリングを一般化します。[ 6 ]

その他のプーリング
空間ピラミッドプーリングは、最大プーリング(または他の形式のプーリング)をピラミッド構造で適用します。つまり、グローバル最大プーリングを適用し、次に4等分、16等分などの画像に最大プーリングを適用します。結果は連結されます。これはグローバルプーリングの階層形式であり、グローバルプーリングと同様に、分類ヘッドの直前で使用されることがよくあります。[7]
関心領域プーリング(RoIプーリングとも呼ばれる)は、 R-CNNで物体検出に。 [8]任意のサイズの入力行列を受け取り、固定サイズの出力行列を出力するように設計されています。
共分散プーリングはベクトルの共分散行列を計算し、それを次元ベクトルに平坦化します。グローバル共分散プーリングはグローバル最大プーリングと同様に使用されます。平均プーリングは平均を計算しますが、これは一次統計であり、共分散は二次統計であるため、共分散プーリングは「二次プーリング」とも呼ばれます。これは高次のプーリングに一般化できます。[9] [10]
ブラープーリングとは、ダウンサンプリングの前にブラー処理を施すことを意味します。例えば、Rect-2ブラープーリングは、平均プーリングを行い、次に2つおきのピクセル( と同一)を取ることを意味します。[11]
ビジョントランスフォーマープーリング
Vision Transformers (ViT)には、次のような一般的な種類のプーリングがあります。
BERTのようなプーリングはダミー[CLS]トークン(「分類」)を使用します。分類の場合、出力は[CLS]分類トークンであり、 LayerNormフィードフォワードソフトマックスモジュールによって確率分布に処理され、ネットワークのクラス確率分布の予測になります。これは、オリジナルのViT [12]とMasked Autoencoder [13]で使用されているものです。
グローバル平均プーリング(GAP)はダミートークンを使用せず、単純にすべての出力トークンの平均を分類トークンとして採用します。これは元のViTでも同様に優れていると言及されていました。[12]
マルチヘッドアテンションプーリング(MAP)は、プーリングにマルチヘッドアテンションブロックを適用します。具体的には、入力としてベクトルのリストを受け取ります。これは、ViTの層の出力ベクトルと考えることができます。次に、各ベクトルにフィードフォワード層を適用し、行列 を生成します。次に、これがマルチヘッドアテンションに送信され、 が生成されます。ここで、はトレーニング可能なパラメータの行列です。[14]これは、Set Transformerアーキテクチャで最初に提案されました。[15]
その後の論文では、GAPとMAPはどちらもBERTのようなプーリングよりも優れたパフォーマンスを発揮することが実証されました。[14] [16]
グラフニューラルネットワークプーリング
グラフ ニューラル ネットワーク(GNN)にも、グローバルとローカルの 2 つの形式のプーリングがあります。グローバル プーリングは、受容野が出力全体となるローカル プーリングに縮小できます。
- ローカルプーリング:ローカルプーリング層は、ダウンサンプリングによってグラフを粗くします。ローカルプーリングは、畳み込みニューラルネットワークのプーリング層と同様に、GNNの受容野を拡大するために使用されます。例としては、k近傍プーリング、トップkプーリング[17]、自己注意プーリング[18]などがあります。
- グローバルプーリング:グローバルプーリング層(読み出し層とも呼ばれる)は、グラフ全体の固定サイズの表現を提供します。グローバルプーリング層は、グラフのノードとエッジの順序の順列によって最終出力が変更されないように、順列不変である必要があります。[19]例としては、要素ごとの合計、平均、最大値などがあります。
ローカルプーリング層は、ダウンサンプリングによってグラフを粗くします。ここでは、提案されているいくつかの学習可能なローカルプーリング戦略を紹介します。[19]それぞれの場合、入力はノード特徴の行列で表される初期グラフと、グラフ隣接行列です。出力は、ノード特徴の新しい行列と、新しいグラフ隣接行列です。
トップkプーリング
まず最初に
ここで、は学習可能な投影ベクトルです。投影ベクトルは、各グラフ ノードのスカラー投影値を計算します。
トップkプーリング層[17]は以下のように形式化できる。
ここで、は上位k個の最高投影スコアを持つノードのサブセット、は要素ごとの行列乗算、はシグモイド関数です。言い換えれば、上位k個の最高投影スコアを持つノードは新しい隣接行列に保持されます。この操作により、投影ベクトルはバックプロパゲーションによって学習可能になります。そうでなければ、離散出力が生成されます。[17]
自己注意プーリング
まず最初に
ここで、は汎用順列等変 GNN レイヤー (例: GCN、GAT、MPNN) です。
自己注意プーリング層[18]は以下のように形式化できる。
ここで、は上位k個の最高の投影スコアを持つノードのサブセットであり、要素ごとの行列乗算を表します。
自己注意プーリング層は、トップ k プーリング層の拡張として考えることができます。トップ k プーリングとは異なり、自己注意プーリングで計算される自己注意スコアは、グラフの特徴とグラフ トポロジの両方を考慮します。
歴史
20 世紀初頭、神経解剖学者は、複数のニューロンが同じニューロンにシナプス結合する特定のモチーフに注目しました。これは、視覚を並進不変にする「局所プーリング」として機能的に説明されました。 (Hartline、1940) [20] は、網膜神経節細胞の受容野に関する電気生理学的実験によって理論を裏付ける証拠を示しました。HubelとWiesel の実験では、猫の視覚システムは畳み込みニューラル ネットワークに似ており、一部の細胞が下層からの入力を合計していることが示されました。[21] : 図 19、20 これらの初期の文献の引用については、 (Westheimer、1965) [22]を参照してください。
1970年代には、奥行き知覚の効果を説明するために、( Julesz and Chang, 1976) [23]などの研究者は、視覚システムがグローバルプーリングによって視差選択メカニズムを実装し、両眼の網膜領域の対応するペアからの出力を高次の細胞にプールすることを提案しました。これらの初期の文献の引用については [24]を参照してください。
人工ニューラルネットワークでは、最大プーリングは1990年に音声処理(1次元畳み込み)に使用されました。[25]
参照
参考文献
- ^ Zhang, Aston; Lipton, Zachary; Li, Mu; Smola, Alexander J. (2024). 「7.5. プーリング」。ディープラーニングへの挑戦。ケンブリッジ、ニューヨーク、ポートメルボルン、ニューデリー、シンガポール:ケンブリッジ大学出版局。ISBN 978-1-009-38943-3。
- ^ リン、ミン;チェン、チャン。ヤン・シュイチェン (2013)。 「ネットワークインネットワーク」。arXiv : 1312.4400 [cs.NE]。
- ^ Yu, Dingjun; Wang, Hanli; Chen, Peiqiu; Wei, Zhihua (2014). 「畳み込みニューラル ネットワークの混合プーリング」。 Miao, Duoqian; Pedrycz, Witold; Ślȩzak, Dominik; Peters, Georg; Hu, Qinghua; Wang, Ruizhi (編)。ラフ セットと知識技術。 コンピューター サイエンスの講義ノート。 Vol. 8818。 Cham: Springer International Publishing。 pp. 364–375。doi :10.1007/978-3-319-11740-9_34。ISBN 978-3-319-11740-9。
- ^ ab Boureau, Y-Lan; Ponce, Jean; LeCun, Yann (2010-06-21). 「視覚認識における特徴プーリングの理論的分析」。第 27 回国際機械学習会議議事録。ICML'10。マディソン、ウィスコンシン州、米国: Omnipress : 111–118。ISBN 978-1-60558-907-7。
- ^ Zeiler, Matthew D.; Fergus, Rob (2013-01-15). 「Deep Convolutional Neural Networks の正規化のための確率的プーリング」arXiv : 1301.3557 [cs.LG].
- ^ 高子滄;王、立民。江山呉市(2019)。 「LIP: ローカル重要度ベースのプーリング」: 3355 ~ 3364。arXiv : 1908.04156。
{{cite journal}}:ジャーナルを引用するには|journal=(ヘルプ)が必要です - ^ He, Kaiming; Zhang, Xiangyu; Ren, Shaoqing; Sun, Jian (2015-09-01). 「視覚認識のための深層畳み込みネットワークにおける空間ピラミッドプーリング」. IEEE Transactions on Pattern Analysis and Machine Intelligence . 37 (9): 1904–1916. arXiv : 1406.4729 . doi :10.1109/TPAMI.2015.2389824. ISSN 0162-8828. PMID 26353135.
- ^ Zhang, Aston; Lipton, Zachary; Li, Mu; Smola, Alexander J. (2024). 「14.8. 領域ベース CNN (R-CNN)」。ディープラーニングへの挑戦。ケンブリッジ、ニューヨーク、ポートメルボルン、ニューデリー、シンガポール: ケンブリッジ大学出版局。ISBN 978-1-009-38943-3。
- ^ Tuzel, Oncel; Porikli, Fatih; Meer, Peter (2006)。「領域共分散: 検出と分類のための高速記述子」。Leonardis, Aleš; Bischof, Horst; Pinz, Axel (編)。Computer Vision – ECCV 2006 。Vol. 3952。ベルリン、ハイデルベルク: Springer Berlin Heidelberg。pp. 589–600。doi : 10.1007/11744047_45。ISBN 978-3-540-33834-5. 2024年9月9日閲覧。
- ^ Wang, Qilong; Xie, Jiangtao; Zuo, Wangmeng; Zhang, Lei; Li, Peihua (2020). 「Deep CNN と Global Covariance Pooling の融合: より優れた表現と一般化」. IEEE Transactions on Pattern Analysis and Machine Intelligence . 43 (8): 2582–2597. arXiv : 1904.06836 . doi :10.1109/TPAMI.2020.2974833. ISSN 0162-8828. PMID 32086198.
- ^ Zhang, Richard (2018-09-27). 「畳み込みネットワークを再びシフト不変にする」. arXiv : 1904.11486 .
{{cite journal}}:ジャーナルを引用するには|journal=(ヘルプ)が必要です - ^ ab ドソヴィツキー、アレクセイ;バイエル、ルーカス。コレスニコフ、アレクサンダー。ヴァイセンボルン、ディルク。ザイ、シャオファ。ウンターティナー、トーマス。デガニ、モスタファ。ミンデラー、マティアス;ハイゴールド、ゲオルク。ジェリー、シルヴァン。ウシュコレイト、ヤコブ(2021-06-03)。 「画像は 16x16 ワードの価値があります: 大規模な画像認識のためのトランスフォーマー」。arXiv : 2010.11929 [cs.CV]。
- ^ He, Kaiming; Chen, Xinlei; Xie, Saining; Li, Yanghao; Dollar, Piotr; Girshick, Ross (2022 年 6 月)。「マスクされたオートエンコーダーはスケーラブルなビジョン学習者です」。2022 IEEE /CVF コンピュータービジョンとパターン認識に関する会議 (CVPR)。IEEE。pp. 15979–15988。arXiv : 2111.06377。doi : 10.1109 / cvpr52688.2022.01553。ISBN 978-1-6654-6946-3。
- ^ ab Zhai, Xiaohua; Kolesnikov, Alexander; Houlsby, Neil; Beyer, Lucas (2022年6月). 「Scaling Vision Transformers」. 2022 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) . IEEE. pp. 1204–1213. arXiv : 2106.04560 . doi :10.1109/cvpr52688.2022.01179. ISBN 978-1-6654-6946-3。
- ^ Lee, Juho; Lee, Yoonho; Kim, Jungtaek; Kosiorek, Adam; Choi, Seungjin; Teh, Yee Whye (2019-05-24). 「Set Transformer: Attention-based Permutation-Invariant Neural Networks のフレームワーク」。第 36 回国際機械学習会議の議事録。PMLR: 3744–37 53。arXiv : 1810.00825。
- ^ Karamcheti, Siddharth; Nair, Suraj; Chen, Annie S.; Kollar, Thomas; Finn, Chelsea; Sadigh, Dorsa; Liang, Percy (2023-02-24). 「ロボット工学のための言語駆動型表現学習」. arXiv : 2302.12766 [cs.RO].
- ^ abc 高、紅陽;季、水王季(2019)。 「グラフユーネット」。arXiv : 1905.05178 [cs.LG]。
- ^ ab Lee, Junhyun; Lee, Inyeop; Kang, Jaewoo (2019). 「Self-Attention Graph Pooling」. arXiv : 1904.08082 [cs.LG].
- ^ ab Liu, Chuang; Zhan, Yibing; Li, Chang; Du, Bo; Wu, Jia; Hu, Wenbin; Liu, Tongliang; Tao, Dacheng (2022). 「グラフニューラルネットワークのグラフプーリング:進歩、課題、機会」。arXiv : 2204.07321 [ cs.LG]。
- ^ Hartline, HK (1940-09-30). 「視神経線維の受容野」. American Journal of Physiology. Legacy Content . 130 (4): 690–699. doi :10.1152/ajplegacy.1940.130.4.690. ISSN 0002-9513.
- ^ Hubel, DH; Wiesel, TN (1962年1月). 「猫の視覚皮質における受容野、両眼相互作用および機能的構造」. The Journal of Physiology . 160 (1): 106–154.2. doi :10.1113/jphysiol.1962.sp006837. ISSN 0022-3751. PMC 1359523. PMID 14449617 .
- ^ Westheimer, G (1965年12月). 「暗所視中のヒト網膜における空間的相互作用」. The Journal of Physiology . 181 (4): 881–894. doi :10.1113/jphysiol.1965.sp007803. ISSN 0022-3751. PMC 1357689. PMID 5881260 .
- ^ Julesz , Bela; Chang, Jih Jie (1976 年 3 月)。「異なる視差に調整された両眼視差検出器のプール間の相互作用」。生物 サイバネティクス。22 ( 2): 107–119。doi :10.1007/BF00320135。ISSN 0340-1200。PMID 1276243 。
- ^ Schumer, Robert; Ganz, Leo (1979-01-01). 「空間プーリングの異なる範囲に対する独立した立体チャンネル」. Vision Research . 19 (12): 1303–1314. doi :10.1016/0042-6989(79)90202-5. ISSN 0042-6989. PMID 532098.
- ^ 山口 耕一; 坂本 健二; 赤羽 俊夫; 藤本 善司 (1990 年 11 月). 話者に依存しない孤立単語認識のためのニューラルネットワーク。第一回国際音声言語処理会議 (ICSLP 90). 神戸、日本。2021 年 3 月 7 日時点のオリジナルよりアーカイブ。2019年 9 月 4 日閲覧。
