ImageNetプロジェクトは、視覚オブジェクト認識ソフトウェアの研究で使用するために設計された大規模なビジュアルデータベースです。1400万枚以上の画像[ 1 ] [ 2 ]がプロジェクトによって手作業で注釈付けされ、写っているオブジェクトが示されており、少なくとも100万枚の画像にはバウンディングボックスも提供されています[ 3 ] 。ImageNetには2万以上のカテゴリがあり[ 2 ]、「風船」や「イチゴ」などの典型的なカテゴリは数百枚の画像で構成されています[ 4 ] 。サードパーティの画像URLの注釈データベースはImageNetから直接無料で入手できますが、実際の画像はImageNetが所有していません[ 5 ] 。 2010年以来、ImageNetプロジェクトは、ソフトウェアプログラムがオブジェクトやシーンを正しく分類および検出するために競うImageNet大規模ビジュアル認識チャレンジ(ILSVRC)というソフトウェアコンテストを毎年開催しています。このチャレンジでは、重複しない1000のクラスの「トリミングされた」リストが使用されます[ 6 ] 。
AI 研究者のFei-Fei Li は2006 年に ImageNet の構想に取り組み始めました。当時、ほとんどの AI 研究はモデルとアルゴリズムに焦点を当てていましたが、Li は AI アルゴリズムのトレーニングに利用できるデータを拡大および改善したいと考えていました。[ 7 ] 2007 年に、Li はWordNetの作成者の 1 人であるプリンストン大学のChristiane Fellbaum教授と会い、このプロジェクトについて話し合いました。この会談の結果、Li は WordNet の約 22,000 の名詞を基に ImageNet を構築し、その多くの機能を活用しました。[ 8 ]彼女はまた、平均的な人が約 30,000 種類の物体を認識するという1987 年の推定[ 9 ]にも触発されました。 [ 10 ]
プリンストン大学の助教授として、リーはImageNetプロジェクトに取り組む研究者チームを編成した。彼らは画像の分類を支援するためにAmazon Mechanical Turkを使用した。ラベル付けは2008年7月に開始され、2010年4月に終了した。167か国から49,000人の作業員が1億6,000万枚以上の候補画像をフィルタリングしてラベル付けした。 [ 11 ] [ 8 ] [ 12 ] 1,400万枚の画像それぞれに3回ラベル付けするのに十分な予算があった。[ 10 ]
当初の計画では、カテゴリごとに1万枚の画像、40,000のカテゴリで4億枚の画像が必要で、それぞれ3回検証されることになっていました。人間は最大で1秒間に2枚の画像を分類できることがわかりました。このペースでは、19人年分の労働(休憩なし)が必要になると推定されました。[ 13 ]
彼らは、フロリダで開催された2009年のコンピュータビジョンおよびパターン認識に関する会議(CVPR)で、「ImageNet: 大規模階層型データセットのプレビュー」と題したポスターとして、初めてデータベースを発表しました。 [ 14 ] [ 8 ] [ 15 ] [ 16 ]このポスターは、2009年のビジョンサイエンス学会でも再利用されました。[ 17 ]
2009年、Alex Bergはタスクとしてオブジェクトの位置特定を追加することを提案した。Liは2009年にPASCAL Visual Object Classesコンテストに協力を持ちかけた。その結果、 2010年に開始されたImageNet Large Scale Visual Recognition Challengeが誕生した。これは、20クラスと19,737枚の画像(2010年時点)しかなかったPASCAL VOCと比較して、1000クラスとオブジェクトの位置特定を伴う。[ 6 ] [ 8 ]
2012年9月30日、AlexNet [ 18 ]と呼ばれる畳み込みニューラルネットワーク(CNN) がImageNet 2012 Challenge でトップ 5 エラー 15.3% を達成し、次点のエラー率より 10.8 パーセント ポイント以上低い結果となりました。畳み込みニューラルネットワークの使用が可能になったのは、トレーニング中にグラフィックス処理ユニット(GPU) [ 18 ]を使用したためであり、これはディープラーニング革命の重要な要素です。エコノミスト誌によると、「突然、AI コミュニティ内だけでなく、テクノロジー業界全体で注目が集まり始めました。」[ 4 ] [ 19 ] [ 20 ]
2015年、AlexNetはMicrosoftの100層を超える非常に深いCNNに性能で劣り、ImageNet 2015コンテストで優勝し、テストセットで3.57%のエラーを記録した。[ 21 ]
Andrej Karpathy は2014 年に、集中した努力で 5.1% のエラー率を達成できると推定し、彼の研究室の約 10 人がより少ない努力で約 12〜13% を達成したと推定した。[ 22 ] [ 23 ]最大限の努力をすれば、人間は 2.4% を達成できると推定された。[ 6 ]
ImageNet は、アノテーション プロセスをクラウド ソーシングしています。画像レベルのアノテーションは、画像内にオブジェクト クラスが存在するか存在しないかを示します。たとえば、「この画像にはトラがいます」または「この画像にはトラはいません」などです。オブジェクト レベルのアノテーションは、指定されたオブジェクト (の可視部分) の周囲にバウンディング ボックスを提供します。ImageNet は、広範なWordNetスキーマのバリアントを使用してオブジェクトを分類し、きめ細かい分類を示すために120 種類の犬種カテゴリを追加しています。 [ 6 ]
2012年、ImageNetはMechanical Turkの世界最大の学術ユーザーでした。平均的な作業者は1分間に50枚の画像を識別しました。[ 2 ]
ImageNet全体の当初の計画では、約50,000万枚のクリーンで多様なフル解像度の画像が約50,000のシノセットに分散される予定でした。[ 15 ]これは実現しませんでした。
2010年4月30日に示された要約統計: [ 24 ]
ImageNetのカテゴリはWordNetの概念から抽出されました。各概念は複数の同義語(例えば「kitty」と「young cat」)を含むことができるため、各概念は「同義語セット」または「synset」と呼ばれます。WordNet 3.0には10万を超えるsynsetがあり、その大部分は名詞(8万以上)です。ImageNetデータセットはこれらを、視覚的に表現できる可算名詞である21,841のsynsetに絞り込みました。
WordNet 3.0 の各シノセットには「WordNet ID」(wnid)があり、これは品詞と「オフセット」(一意の識別番号)を連結したものです。ImageNet には名詞しか含まれていないため、すべての wnid は「n」で始まります。たとえば、シノセット「dog, domestic dog, Canis familiaris」の wnid は「n02084071」です。[ 25 ]
ImageNetのカテゴリは、レベル1(「哺乳類」など)からレベル9(「ジャーマンシェパード」など)までの9つのレベルに分類されます。[ 13 ]
画像は、複数の言語の同義語を使用してオンライン画像検索(Google、Picsearch、MSN、Yahoo、Flickrなど)からスクレイピングされました。例:German shepherd、German police dog、German shepherd dog、Alsatian、ovejero alemán、pastore tedesco、德国牧羊犬。[ 26 ]
ImageNetは、解像度が異なるRGB形式の画像で構成されています。例えば、ImageNet 2012の「魚」カテゴリでは、解像度は4288×2848から75×56まで様々です。機械学習では、これらの画像は通常、ニューラルネットワークによる処理の前に、標準的な一定解像度に前処理され、白色化されます。
例えば、PyTorchでは、ImageNet画像はデフォルトで、ピクセル値を0から1の間に収まるように除算し、[0.485、0.456、0.406]を減算し、[0.229、0.224、0.225]で除算することによって正規化されます。これらはImageNetの平均値と標準偏差なので、入力データは白くなります。 [ 27 ]
各画像には、正確に1つのwnidがラベル付けされています。
ImageNet-1K 用の高密度SIFT 特徴(生の SIFT 記述子、量子化されたコードワード、および各記述子/コードワードの座標) がダウンロード可能で、視覚単語のバッグ用に設計されています。[ 28 ]
オブジェクトの境界ボックスは、約 3000 の人気シノセット[ 29 ]で利用可能であり、各シノセットには平均 150 枚の画像が含まれています。[ 30 ]
さらに、一部の画像には属性があります。彼らは約400の人気シノセットに対して25の属性を公開しました: [ 31 ] [ 32 ]
元のデータセット全体はImageNet-21Kと呼ばれています。ImageNet-21kには、21,841のクラスに分類された14,197,122枚の画像が含まれています。一部の論文ではこれを切り上げてImageNet-22kと呼んでいます。[ 33 ]
ImageNet-21k の完全版は 2011 年秋にリリースされましたfall11_whole.tar。ImageNet-21k には公式のトレーニング - 検証 - テストの分割はありません。一部のクラスには 1 ~ 10 個のサンプルしか含まれていませんが、他のクラスには数千個のサンプルが含まれています。[ 33 ]
ImageNetデータセットにはさまざまなサブセットがあり、さまざまなコンテキストで使用され、時には「バージョン」と呼ばれることもあります。[ 18 ]
ImageNet の最もよく使われるサブセットの 1 つは、「ImageNet Large Scale Visual Recognition Challenge (ILSVRC) 2012–2017 画像分類および位置特定データセット」です。これは、研究文献では ImageNet-1K または ILSVRC2017 とも呼ばれ、1,000 のクラスを含む元の ILSVRC チャレンジを反映しています。ImageNet-1K には、1,281,167 枚のトレーニング画像、50,000 枚の検証画像、および 100,000 枚のテスト画像が含まれています。[ 34 ]
ImageNet-1K の各カテゴリはリーフカテゴリであり、ImageNet-21K とは異なり、その下に子ノードはありません。たとえば、ImageNet-21K では単に「哺乳類」と分類された画像がいくつかありますが、ImageNet-1K では「ジャーマンシェパード」などのカテゴリに分類された画像のみがあり、「ジャーマンシェパード」の下に子ワードはありません。[ 26 ]
ImageNet の構築に使用された WordNet には、「person」サブツリーに 2832 個のシノセットがありました。2018~2020 年の間、これらの person のシノセットで広範囲にわたるフィルタリングを行ったため、ImageNet-21k のダウンロードが削除されました。これらの 2832 個のシノセットのうち、1593 個が「潜在的に不快」と判断されました。残りの 1239 個のうち、1081 個が実際には「視覚的」ではないと判断されました。その結果、残ったシノセットは 158 個のみでした。これらのうち、139 個のみが「さらに調査」するための 100 枚以上の画像を含んでいました。[ 12 ] [ 35 ] [ 36 ]
2021年の冬にImageNet-21kが更新されました。「person」サブツリーの2702のカテゴリが、トレーニングされたモデルでの「問題のある動作」を防ぐために削除されました。その結果、「person」サブツリーには130のsynsetしか残っていません。さらに、2021年にImageNet-1kが更新され、997の非人物カテゴリに現れる顔がぼかされました。ImageNet-1kの全1,431,093枚の画像のうち、243,198枚(17%)に少なくとも1つの顔が含まれていることがわかりました。顔の総数は562,626です。これらの顔がぼかされたデータセットでモデルをトレーニングしても、パフォーマンスの低下は最小限であることがわかりました。[ 37 ] [ 38 ]
ImageNet-Cは、2019年に構築されたImageNetの敵対的摂動バージョンです。[ 39 ]
ImageNetV2は、それぞれ10,000個のテストセットを含む3つの新しいデータセットであり、オリジナルのImageNetと同じ方法で構築されました。[ 40 ]
ImageNet-21K-PはImageNet-21Kのフィルタリングおよびクリーニングされたサブセットであり、11,221のカテゴリから12,358,688枚の画像が含まれています。すべての画像は224 x 224ピクセルにリサイズされました。[ 33 ]

ILSVRCは、2005年に設立された、約2万枚の画像と20種類のオブジェクトクラスのみを含む小規模なPASCAL VOCチャレンジの「足跡をたどる」ことを目指している。 [ 6 ] ImageNetを「民主化」するために、Fei-Fei Liは、2010年からPASCAL VOCチームに、研究チームが与えられたデータセットでアルゴリズムを評価し、いくつかの視覚認識タスクでより高い精度を達成するために競い合うコラボレーションを提案した。[ 8 ]
その結果として毎年開催されるコンテストは、現在ではImageNet大規模視覚認識チャレンジ(ILSVRC)として知られています。ILSVRCでは、ImageNetの完全なスキーマで分類されている120の犬種のうち90を含む、わずか1000の画像カテゴリまたは「クラス」の「絞り込み」リストを使用します。[ 6 ]
2010年代は、画像処理において劇的な進歩が見られた時代だった。
2010年の最初のコンペティションには11チームが参加しました。優勝チームは線形サポートベクターマシン(SVM)でした。特徴は、ローカル座標コーディングとプーリングによって疎化されたHoGとLBPの密なグリッドです。[ 41 ] 分類精度は52.9%、トップ5精度は71.8%でした。3台の8コアマシン(デュアルクアッドコア2GHz Intel Xeon CPU)で4日間トレーニングされました。 [ 42 ]
2011年の第2回大会では参加チーム数が少なく、別のSVMが上位5位のエラー率25%で優勝した。[ 10 ]優勝チームはFlorent PerronninとJorge SanchezによるXRCEだった。このシステムは量子化された[ 43 ]フィッシャーベクトル上で動作する別の線形SVMだった。[ 44 ] [ 45 ]上位5位の精度は74.2%だった。
2012年、 AlexNetと呼ばれる深層畳み込みニューラルネットワークがトップ5精度で84.7%を達成し、大きな飛躍を遂げた。[ 46 ] 2位は、SVM、SIFT、色統計、フィッシャーベクトルなどの従来の汎用アーキテクチャを使用するOxford VGGであった。[ 47 ]その後数年間で、トップ5精度は90%以上に上昇した。2012年のブレークスルーは「以前から存在していた要素を組み合わせた」ものであったが、劇的な量的改善は業界全体の人工知能ブームの始まりとなった。[ 4 ]
2013年には、上位入賞作品のほとんどが畳み込みニューラルネットワークを使用していた。物体位置特定部門の優勝作品は、物体分類と位置特定を同時に行うアーキテクチャであるOverFeatであった。 [ 48 ]分類部門の優勝作品は、Clarifaiによる複数のCNNのアンサンブルであった。[ 6 ]
2014 年までに 50 を超える機関が ILSVRC に参加しました。[ 6 ]分類部門の優勝はGoogLeNetでした。[ 49 ]位置特定部門の優勝はVGGNetでした。2017 年に、38 の競合チームのうち 29 チームが 95% を超える精度を達成しました。[ 50 ] 2017 年に ImageNet は、自然言語を使用して 3D オブジェクトを分類する、2018 年にはるかに難しい新しいチャレンジを展開すると発表しました。3D データの作成は、既存の 2D 画像に注釈を付けるよりもコストがかかるため、データセットは小さくなると予想されます。この分野の進歩の応用は、ロボット ナビゲーションから拡張現実まで多岐にわたります。[ 1 ]
2015年の優勝作品はResNetで、人間のパフォーマンスを上回った。[ 21 ] [ 51 ]しかし、チャレンジの主催者の一人であるオルガ・ルサコフスキーが2015年に指摘したように、ILSVRCは1000以上のカテゴリのみを対象としており、人間はより多くのカテゴリを認識でき、また(プログラムとは異なり)画像のコンテキストを判断できる。[ 52 ]
2016年の優勝作品は、Inception v3、Inception v4、Inception ResNet v2、ResNet 200、Wide ResNet 68、Wide ResNet 3の6つのネットワークのアンサンブルモデルであるCUImageでした。[ 53 ]次点は、InceptionモジュールとResNetを組み合わせたResNeXtでした。[ 54 ]
2017年には、スクイーズ・アンド・エキサイテーション・ネットワーク(SENet)が優勝し、トップ5エラーを2.251%にまで削減した。[ 55 ]
コンテストの主催者は2017年に、ベンチマークが解決され、もはや課題ではなくなったため、2017年のコンテストが最後になると発表した。また、3D画像に関する新しいコンテストを開催するとも発表した。[ 1 ]しかし、そのようなコンテストは実現しなかった。
ImageNet-1k検証セットのラベルの6%以上が間違っていると推定されています。[ 56 ]また、ImageNet-1kの約10%に曖昧または誤ったラベルが含まれていること、そしてモデルの予測と元のImageNetラベルが提示された場合、人間のアノテーターは元のImageNetでトレーニングされた2020年の最先端モデルの予測を好むことがわかっています。これはImageNet-1kが飽和状態にあることを示唆しています。[ 57 ]
2019年にImageNetとWordNetの複数のレイヤー(分類体系、オブジェクトクラス、ラベル付け)の歴史を調べた研究では、あらゆる種類の画像のほとんどの分類アプローチにバイアスが深く組み込まれていることが説明されています。[ 58 ] [ 59 ] [ 60 ] [ 61 ] ImageNetはさまざまなバイアス源に対処するために取り組んでいます。[ 62 ]
WordNetを使用する際の欠点の1つは、カテゴリがImageNetにとって最適なものよりも「格式高い」ものになりがちであることです。「ほとんどの人は、この珍しい種類のディプロドクスよりも、レディー・ガガやiPod miniに興味を持っています。」
2007年に助教授としてプリンストンに戻っていたリーがImageNetのアイデアを語ったとき、教員の協力を得るのに苦労した。最終的に、コンピュータアーキテクチャを専門とする教授が共同研究者として彼女に加わることに同意した。
はWordNetのアプローチについて読んだ後、2006年にプリンストンを訪れた際に、WordNetの継続的な研究に影響を与えた研究者であるChristiane Fellbaum教授と会った。
{{cite journal}}:ジャーナルを引用するには|journal=(ヘルプ)