小型物体検出は、さまざまな技術を使用してデジタル画像やビデオ内の小型物体を検出する特殊な物体検出のケースです。「小型物体」とは、入力画像内のピクセル フットプリントが小さい物体のことです。航空写真などの分野では、小型物体のために最先端の物体検出技術が十分に機能しません。
用途
小型物体検出は、ビデオ監視(交通ビデオ監視)、[1] [2] 小型物体検索、[3] [4] 異常検出、[5] 海上監視、ドローン調査、交通流解析、[6]物体追跡など、さまざまな分野に応用されています。
小さな物体に関する問題
- You Only Look Once [7] [8] [9] [10] [11] [12] [13]などの現代の物体検出アルゴリズムは、特徴を学習するために畳み込み層を多用します。物体が畳み込み層を通過すると、そのサイズは縮小します。そのため、小さな物体は数層後には消えてしまい、検出できなくなります。
- 時には、物体の影が物体自体の一部として検出されることがあります。[14]そのため、境界ボックスの配置は物体ではなく影を中心にする傾向があります。車両検出の場合、歩行者や二輪車の検出にこの影響が出ます。
- 現在、ドローンは航空写真撮影に広く使用されています。[15]ドローンには、飛行中に特定の安定した位置を維持するのに役立つハードウェア(センサー)とソフトウェア(アルゴリズム)が搭載されています。風の強い状況では、ドローンは自動的に位置を維持するために細かい動きをし、境界付近の視界が変わります。画像の境界付近に新しい物体が現れる可能性もあります。全体として、これらは分類、検出、そして最終的には追跡精度に影響を与えます。

方法
小さな物体を検出するには様々な方法[16]があり、それらは3つのカテゴリーに分類されます。
.jpg/500px-Yolov5_(Ariel_top_view_of_Ahmedabad,_Gujarat,_India,_2022).jpg)
.jpg/500px-YOLOv5_and_SAHI_interface_(Ariel_top_view_of_Ahmedabad,_Gujarat,_India,_2022).jpg)
.jpg/500px-Yolov7_(Ariel_top_view_of_Ahmedabad,_Gujarat,_India,_2022).jpg)
既存の技術を改良する
既存の技術では小さな物体を検出する方法が様々あります。そのいくつかを以下に示します。
小さなオブジェクトを含むデータセットを選択する
機械学習モデルの出力は、「どれだけよく訓練されているか」に依存します。[17]そのため、データセットには小さなオブジェクトが含まれていなければなりません。また、YOLOなどの現代の検出器はアンカーに依存しています。YOLOの最新バージョン(YOLOv5 [18]以降)は、自動アンカーアルゴリズムを使用して、データセット内のオブジェクトのサイズの性質に基づいて適切なアンカーを見つけます。したがって、データセットには小さなオブジェクトを含めることが必須です。
必要に応じて拡張によりより多くのデータを生成する
ディープラーニングモデルには数十億のニューロンがあり、トレーニング後に一定の重みに落ち着きます。そのため、より良いトレーニングには十分な量の定量的および定性的なデータが必要です。[19] データ拡張は、既存のデータセットから より多様なデータを生成するための有用な技術です[17] 。
画像キャプチャ解像度とモデルの入力解像度の向上
これらは、オブジェクトからより多くの特徴を取得し、最終的にそれらから最適なものを学習するのに役立ちます。たとえば、1280 x 1280解像度の画像の自転車オブジェクトには、640 x 640 解像度のものよりも多くの特徴があります。
自動学習アンカー
アンカーサイズの選択は、小さな物体の検出において重要な役割を果たします。[20]手で選択するのではなく、データセットに基づいてアンカーサイズを識別するアルゴリズムを使用します。YOLOv5はK平均アルゴリズムを使用してアンカーサイズを定義します。
トレーニングと推論中のタイリングアプローチ
最先端の物体検出器は、固定サイズの画像のみを許可し、それに応じて入力画像のサイズを変更します。この変更により、画像内の小さな物体が変形する可能性があります。タイリングアプローチ[21]は、画像の解像度がモデルの固定入力サイズよりも高い場合に役立ちます。画像を縮小する代わりに、画像をタイルに分割してからトレーニングに使用します。同じアプローチが推論時にも使用されます。
フィーチャーピラミッドネットワーク (FPN)
特徴ピラミッドネットワーク[22]を使用して、マルチスケールで特徴を学習します。例:ツイン特徴ピラミッドネットワーク(TFPN)[23] 、拡張特徴ピラミッドネットワーク(EFPN)。[24] FPNは、畳み込み層に対して小さなオブジェクトの特徴を維持するのに役立ちます。
アドオンテクニック
既存の方法を変更する代わりに、いくつかのアドオン技術があり、それらを既存のアプローチの上に直接配置して、より小さなオブジェクトを検出できます。そのような技術の1つが、Slicing Aided Hyper Inference(SAHI)です。[25]画像は、異なるサイズの複数の重なり合うパッチにスライスされます。ハイパーパラメータがそれらの寸法を定義します。次に、微調整中にアスペクト比を維持しながらパッチのサイズを変更します。これらのパッチは、モデルのトレーニング用に提供されます。
小型物体検出のための最適化された技術
このような物体検出の問題に焦点を当てたさまざまなディープラーニング技術が利用可能です。たとえば、Feature-Fused SSD、[26]、 YOLO-Z [27]などです。このような方法は、「畳み込みネットワークを通過する際に小さな物体の特徴をどのように維持するか」に取り組んでいます。
その他のアプリケーション
- 群衆カウント[28] [29] [30] [31]
- 車両の再識別[32]
- 動物検出[33] [34] [35] [36]
- 魚類検出[37]
参照
参考文献
- ^ Saran KB; Sreelekha G (2015). 「交通ビデオ監視: 車両の検出と分類」。2015 International Conference on Control Communication & Computing India (ICCC)。インド、ケララ州、トリバンドラム: IEEE。pp. 516–521。doi : 10.1109 / ICCC.2015.7432948。ISBN 978-1-4673-7349-4. S2CID 14779393。
- ^ Nemade, Bhushan (2016-01-01). 「ビデオ追跡を使用した自動交通監視」。Procedia Computer Science 。国際通信・コンピューティング・仮想化会議 ( ICCCV ) 2016 の議事録。79 : 402–409。doi : 10.1016 /j.procs.2016.03.052。ISSN 1877-0509。
- ^ Guo, Haiyun; Wang, Jinqiao; Xu, Min; Zha, Zheng-Jun; Lu, Hanqing (2015-10-13)。「監視シナリオにおける小型物体検索のためのマルチビューディープフィーチャの学習」。第23回ACM国際マルチメディア会議議事録。MM '15。ニューヨーク、ニューヨーク州、米国:Association for Computing Machinery。pp. 859–862。doi : 10.1145 /2733373.2806349。ISBN 978-1-4503-3459-4. S2CID 9041849。
- ^ Galiyawala, Hiren; Raval, Mehul S.; Patel, Meet (2022-05-20). 「属性認識を使用した監視ビデオ内の人物検索」。Journal of Ambient Intelligence and Humanized Computing . doi :10.1007/s12652-022-03891-0. ISSN 1868-5145. S2CID 248951090.
- ^ Ingle, Palash Yuvraj; Kim, Young-Gab (2022-05-19). 「スマートシティのビデオ監視のためのリアルタイム異常物体検出」.センサー. 22 (10): 3862. Bibcode :2022Senso..22.3862I. doi : 10.3390 /s22103862 . ISSN 1424-8220. PMC 9143895. PMID 35632270.
- ^ 坪井 勉、吉川 典明 (2020-03-01). 「アフマダーバード(インド)の交通流分析」.交通政策のケーススタディ. 8 (1): 215–228. doi : 10.1016/j.cstp.2019.06.001 . ISSN 2213-624X. S2CID 195543435.
- ^ Redmon, Joseph; Divvala, Santosh; Girshick, Ross; Farhadi, Ali (2016-05-09). 「一度だけ見る: 統合されたリアルタイムの物体検出」. arXiv : 1506.02640 [cs.CV].
- ^ Redmon, Joseph; Farhadi, Ali (2016-12-25). 「YOLO9000: より良く、より速く、より強く」. arXiv : 1612.08242 [cs.CV].
- ^ Redmon, Joseph; Farhadi, Ali (2018-04-08). 「YOLOv3: 漸進的な改善」. arXiv : 1804.02767 [cs.CV].
- ^ Bochkovskiy, Alexey; Wang, Chien-Yao; Liao, Hong-Yuan Mark (2020-04-22). 「YOLOv4: 物体検出の最適速度と精度」. arXiv : 2004.10934 [cs.CV].
- ^ Wang, Chien-Yao; Bochkovskiy, Alexey; Liao, Hong-Yuan Mark (2021-02-21). 「Scaled-YOLOv4: クロスステージ部分ネットワークのスケーリング」. arXiv : 2011.08036 [cs.CV].
- ^ リー、チューイ;リー、ルル。江、紅梁。ウェン、カイヘン。ゲン、イーフェイ。李、梁。ケ、ザイダン。李清源。チェン、メン。聶、維強。リー、イードゥオ。張、博。リャン、ユーフェイ。周、林源。徐暁明(2022-09-07)。 「YOLOv6: 産業アプリケーション向けの単一段階の物体検出フレームワーク」。arXiv : 2209.02976 [cs.CV]。
- ^ Wang, Chien-Yao; Bochkovskiy, Alexey; Liao, Hong-Yuan Mark (2022-07-06). 「YOLOv7: トレーニング可能な bag-of-freebies がリアルタイム物体検出器の新たな最先端技術を確立」. arXiv : 2207.02696 [cs.CV].
- ^ Zhang, Mingrui; Zhao, Wenbing; Li, Xiying; Wang, Dan (2020-12-11). 「交通監視ビデオにおける移動物体の影検出」。2020 IEEE第9回国際情報技術・人工知能会議 (ITAIC)。第9巻。中国重慶: IEEE。pp. 1983–1987。doi :10.1109/ ITAIC49862.2020.9338958。ISBN 978-1-7281-5244-8. S2CID 231824327。
- ^ 「インタラクティブ ワークショップ「ドローンは私たちの住む世界をどのように変えているのか」」。2016統合通信ナビゲーションおよび監視 (ICNS)。ハーンドン、バージニア州: IEEE。2016 年。pp. 1–17。doi : 10.1109 / ICNSURV.2016.7486437。ISBN 978-1-5090-2149-9. S2CID 21388151。
- ^ Nguyen, Nhat-Duy; Do, Tien; Ngo, Thanh Duc; Le, Duy-Dinh (2020). 「小さな物体検出のためのディープラーニング手法の評価」。電気・コンピュータ工学ジャーナル。2020 :1–18。doi : 10.1155 / 2020/3189691。
- ^ ab Gong, Zhiqiang; Zhong, Ping; Hu, Weidong (2019). 「機械学習における多様性」. IEEE Access . 7 :64323–64350. arXiv : 1807.01477 . doi : 10.1109/ACCESS.2019.2917620 . ISSN 2169-3536. S2CID 206491718.
- ^ Jocher, Glenn; Chaurasia, Ayush; Stoken, Alex; Borovec, Jirka; NanoCode012; Kwon, Yonghye; TaoXie; Michael, Kalen; Fang, Jiacong (2022-08-17). 「ultralytics/yolov5: v6.2 - YOLOv5分類モデル、Apple M1、再現性、ClearMLおよびDeci.ai統合」。doi : 10.5281/zenodo.3908559 。2022年9月14日閲覧。
{{cite journal}}:ジャーナルを引用するには|journal=(ヘルプ)が必要ですCS1 maint: 数値名: 著者リスト (リンク) - ^ 「データセットのサイズと品質 | 機械学習」。Google Developers 。 2022年9月14日閲覧。
- ^ 鍾、元儀;王建峰。ペン、ジアン。張、雷 (2020-01-26)。 「物体検出のためのアンカー ボックスの最適化」。arXiv : 1812.00469 [cs.CV]。
- ^ Unel, F. Ozge; Ozkalayci, Burak O.; Cigla, Cevahir (2019). 「小さな物体検出におけるタイリングの威力」。2019 IEEE/CVF コンピュータービジョンおよびパターン認識ワークショップ会議 (CVPRW) 。ロングビーチ、カリフォルニア州、米国: IEEE。pp. 582–591。doi :10.1109/ CVPRW.2019.00084。ISBN 978-1-7281-2506-0. S2CID 198903617。
- ^ Lin, Tsung-Yi; Dollár, Piotr; Girshick, Ross; He, Kaiming; Hariharan, Bharath; Belongie, Serge (2017-04-19). 「物体検出のための特徴ピラミッドネットワーク」. arXiv : 1612.03144 [cs.CV].
- ^ Liang, Yi; Changjian, Wang; Fangzhao, Li; Yuxing, Peng; Qin, Lv; Yuan, Yuan; Zhen, Huang (2019). 「TFPN: 物体検出のためのツインフィーチャピラミッドネットワーク」。2019 IEEE 31st International Conference on Tools with Artificial Intelligence (ICTAI)。ポートランド、オレゴン州、米国: IEEE。pp. 1702–1707。doi : 10.1109 / ICTAI.2019.00251。ISBN 978-1-7281-3798-8. S2CID 211211764。
- ^ 鄧、春芳;王、孟夢。劉、梁。劉永(2020-04-09)。 「小さな物体検出のための拡張機能ピラミッド ネットワーク」。arXiv : 2003.07021 [cs.CV]。
- ^ Akyon, Fatih Cagatay; Altinuc, Sinan Onur; Temizel, Alptekin (2022-07-12). 「スライシング支援ハイパー推論と微調整による小型物体検出」2022 IEEE 国際画像処理会議 (ICIP) . pp. 966–970. arXiv : 2202.06934 . doi :10.1109/ICIP46576.2022.9897990. ISBN 978-1-6654-9620-9. S2CID 246823962。
- ^ Cao, Guimei; Xie, Xuemei; Yang, Wenzhe; Liao, Quan; Shi, Guangming; Wu, Jinjian (2018-04-10). 「Feature-fused SSD: Fast detection for small objects」. Dong, Junyu; Yu, Hui (eds.). Ninth International Conference on Graphic and Image Processing (ICGIP 2017) . Vol. 10615. SPIE. pp. 381–388. arXiv : 1709.05054 . Bibcode :2018SPIE10615E..1EC. doi :10.1117/12.2304811. ISBN 9781510617414. S2CID 20592770。
- ^ Benjumea, Aduen; Teeti, Izzeddin; Cuzzolin, Fabio; Bradley, Andrew (2021-12-23). 「YOLO-Z: 自律走行車向けYOLOv5の小型物体検出の改善」. arXiv : 2112.11798 [cs.CV].
- ^ Rajendran, Logesh; Shyam Shankaran, R (2021). 「人工知能とディープラーニングを使用したビッグデータ対応のリアルタイム群衆監視」。2021 IEEE国際ビッグデータおよびスマートコンピューティング会議 (BigComp)。済州島、韓国 (南): IEEE。pp. 129–132。doi :10.1109/BigComp51126.2021.00032。ISBN 978-1-7281-8924-6. S2CID 232236614。
- ^ Sivachandiran, S.; Mohan, K. Jagan; Nazer, G. Mohammed (2022-03-29). 「ディープ トランスファー ラーニングにより航空写真を使用した高密度群衆の検出と分類が可能に」。2022第 6 回国際コンピューティング方法論および通信会議 (ICCMC)。Erode、インド: IEEE。pp. 1313–1317。doi : 10.1109 / ICCMC53470.2022.9753982。ISBN 978-1-6654-1028-1. S2CID 248131806。
- ^ Santhini, C.; Gomathi, V. (2018). 「ディープラーニングネットワークを使用した群衆シーン分析」。2018 International Conference on Current Trends toward Converging Technologies (ICCTCT) 。pp . 1–5。doi :10.1109 / ICCTCT.2018.8550851。ISBN 978-1-5386-3702-9.S2CID 54438440 。
- ^ Sharath, SV; Biradar, Vidyadevi; Prajwal, MS; Ashwini, B. (2021-11-19). 「ディープ畳み込みニューラルネットワークを使用した高密度画像での群衆カウント」。2021 IEEE国際会議 分散コンピューティング、VLSI、電気回路、ロボティクス (DISCOVER)。ニッテ、インド: IEEE。pp. 30–34。doi :10.1109 / DISCOVER52564.2021.9663716。ISBN 978-1-6654-1244-5. S2CID 245707782。
- ^ Wang, Hongbo; Hou, Jiaying; Chen, Na (2019). 「ディープラーニングに基づく車両再識別の調査」. IEEE Access . 7 : 172443–172469. doi : 10.1109/ACCESS.2019.2956172 . ISSN 2169-3536. S2CID 209319743.
- ^ サンタナム、サンジェイ; B、スディール・シダールタン。パニグラヒ、サイ・スダ。カシャップ、スーリヤカント・クマール。ドゥリセティ、バルガフ・クリシュナ(2021-11-26)。 「ディープラーニングを使用した交通安全のための動物検出」。2021 年計算知能およびコンピューティング アプリケーションに関する国際会議 (ICCICA)。インド、ナーグプール:IEEE。 1 ~ 5 ページ。土井:10.1109/ICCICA52458.2021.9697287。ISBN 978-1-6654-2040-2. S2CID 246663727。
- ^ Li, Nopparut; Kusakunniran, Worapan; Hotta, Seiji (2020). 「畳み込みニューラルネットワークを使用したケージの後ろにいる動物の検出」。2020第17回電気工学/電子工学、コンピューター、通信、情報技術に関する国際会議 (ECTI-CON) 。プーケット、タイ: IEEE。pp. 242–245。doi :10.1109/ECTI- CON49241.2020.9158137。ISBN 978-1-7281-6486-1. S2CID 221086279。
- ^ 大石 優; 松永 恒夫 (2010). 「航空機リモートセンシング画像における野生動物の移動の自動検出」2010 IEEE 国際地質科学およびリモートセンシングシンポジウムpp. 517–519. doi :10.1109/IGARSS.2010.5654227. ISBN 978-1-4244-9565-8. S2CID 16812504。
- ^ Ramanan, D.; Forsyth, DA; Barnard, K. (2006). 「ビデオからの動物モデルの構築」. IEEE Transactions on Pattern Analysis and Machine Intelligence . 28 (8): 1319–1334. doi :10.1109/TPAMI.2006.155. ISSN 0162-8828. PMID 16886866. S2CID 1699015.
- ^ 崔、淑夏;周、裕。王永輝。ザイ、ルージュン(2020)。 「ディープラーニングを利用した魚探知」。応用計算知能とソフト コンピューティング。2020 : 1 ~ 13。土井:10.1155/2020/3738108。
外部リンク
- 中国天津大学機械学習およびデータマイニング研究所の AISKYEYE チームによる VisDrone データセット。
