
逆画像検索は、コンテンツベース画像検索(CBIR)クエリ技術であり、CBIRシステムにサンプル画像を提供し、それを基に検索を行います。情報検索の観点から、サンプル画像は非常に有用です。特に、逆画像検索の特徴は検索語がないことです。これにより、ユーザーが正しい結果を返すかどうかわからないキーワードや用語を推測する必要がなくなります。逆画像検索では、特定のサンプル画像[ 1 ]や画像の人気度に関連するコンテンツを発見したり、加工されたバージョンや派生作品を発見したりすることもできます[ 2 ] 。
ビジュアル検索エンジンとは、逆画像検索によってワールドワイドウェブ上の情報を検索するように設計された検索エンジンです。検索対象となる情報は、ウェブページ、場所、その他の画像、その他の種類の文書など多岐にわたります。この種の検索エンジンは、主にモバイルインターネット上で、未知の物体(未知の検索クエリ)の画像を使って検索を行う際に利用されます。例えば、外国の都市にある建物などが挙げられます。これらの検索エンジンは、コンテンツベースの画像検索技術をよく利用します。
ビジュアル検索エンジンは、認識可能なアルゴリズムに基づいて画像やパターンを検索し、選択的または適用的なパターンマッチング技術に基づいて関連情報を提供する。
逆画像検索は、次の目的で使用できます。[ 3 ]
一般的に使用される逆画像検索アルゴリズムには以下が含まれます。[ 4 ]

画像検索エンジンとは、画像を検索するために設計された検索エンジンです。検索は、キーワード、画像、または画像へのウェブリンクに基づいて行うことができます。検索結果は、メタデータ、色の分布、形状などの検索条件と、ブラウザが使用する検索手法によって異なります。

画像検索で現在使用されている2つの手法:
メタデータによる検索:画像検索は、キーワードやテキストなど、画像に関連付けられたメタデータを比較することに基づいており、関連性に基づいてソートされた一連の画像を用いることで実現されます。各画像に関連付けられたメタデータには、画像のタイトル、フォーマット、色などが含まれる場合があり、手動または自動で生成できます。このメタデータ生成プロセスは、オーディオビジュアルインデックス作成と呼ばれます。
例による検索:この手法は逆画像検索とも呼ばれ、コンテンツベースの画像検索コンピュータビジョン技術を用いて画像を比較することで検索結果を得ます。検索時には、色、形状、質感など、画像から抽出できるあらゆる視覚情報といった画像の内容が調べられます。このシステムは計算負荷は高くなりますが、メタデータによる検索よりも効率的で信頼性が高いと言えます。
両方の検索手法を組み合わせた画像検索エンジンも存在する。例えば、まずテキストを入力して検索を行い、得られた画像を使って検索結果を絞り込むといった方法がある。
動画検索エンジンとは、インターネット上の動画を検索するために設計された検索エンジンです。一部の動画検索エンジンはインターネット上で直接検索を実行しますが、他の検索エンジンは検索対象の動画をサーバー上に保存しています。また、動画の形式や長さを検索条件として指定できる検索エンジンもあります。通常、検索結果には動画の縮小版が表示されます。
現在、ほとんどすべての動画検索はキーワード(メタデータによる検索)に基づいて検索を実行します。これらのキーワードは、動画のタイトル、動画に付随するテキスト、または作成者によって定義されます。このタイプの検索の例としてYouTubeが挙げられます。
3Dモデル検索ツールは、データベースやネットワークから3Dモデリングオブジェクトのファイルを見つけることを目的としています。一見すると、このような検索ツールの実装は不要に思えるかもしれませんが、インターネット上のドキュメントが絶えず増加しているため、情報のインデックス化は日々ますます必要になっています。

これらは従来型のテキストベースの検索エンジン(キーワード/タグ)で使用されてきました。これらのタグやキーワードは、インデックス付けされた資料の著者やインターネットユーザーが提供したものです。しかし、常に効果的とは限らないため、近年では、テキスト検索と2D図面、3D図面、3Dモデルとの比較検索を組み合わせた検索エンジンの実装において、その有効性が検討されています。
プリンストン大学は、これらのパラメータをすべて組み合わせて検索を実行する検索エンジンを開発し、検索の効率を向上させた。[ 6 ]
モバイル画像検索は、携帯電話専用に設計された検索エンジンの一種で、自分の携帯電話で撮影した画像や特定の単語(キーワード)を使って、インターネット上のあらゆる情報を検索できます。モバイルビジュアル検索ソリューションを使用すると、画像認識ソフトウェアの機能を自社ブランドのモバイルアプリケーションに統合できます。モバイルビジュアル検索(MVS)は、オンラインメディアとオフラインメディアのギャップを埋め、顧客をデジタルコンテンツにリンクさせることを可能にします。
携帯電話は、高解像度カメラ、カラーディスプレイ、ハードウェアアクセラレーションによるグラフィックス機能を備えた、高性能な画像・動画処理デバイスへと進化を遂げました。また、GPS(全地球測位システム)を搭載し、ブロードバンド無線ネットワークに接続される機種も増えています。こうした進化により、カメラ付き携帯電話を使って、ユーザーの視覚的に近い対象物に関する検索クエリを開始する、新しいタイプのアプリケーションが実現可能になりました(図1)。このようなアプリケーションは、例えば、製品の識別、価格比較、映画、CD、不動産、印刷媒体、美術作品に関する情報の検索などに利用できます。
通常、この種の検索エンジンは、クエリ・バイ・サンプルまたは画像クエリ・バイ・サンプルという手法を使用します。これは、画像の内容、形状、質感、色を使用してデータベース内の画像と比較し、クエリに対する近似的な結果を返すものです。
携帯電話におけるこれらの検索に使用される手順は以下のとおりです。
まず、画像はサーバーアプリケーションに送信されます。サーバー上では、画像を構成するさまざまな分野を専門とする複数の分析チームによって画像が分析されます。そして、各チームは送信された画像にそれぞれの専門分野の領域が含まれているかどうかを判断します。
この一連の手順が完了すると、中央コンピュータがデータを分析し、各チームの効率に基づいて結果が一覧になったページを作成し、最終的に携帯電話に送信されます。
Yandex Imagesは、グローバルな画像および写真の逆検索を提供しています。このサイトは、他の多くのサイトで使用されている標準的なコンテンツベース画像検索(CBIR)技術を使用していますが、さらに人工知能ベースの技術を使用してクエリに基づいてより多くの結果を見つけます。[ 7 ]ユーザーは画像をツールバーにドラッグアンドドロップして、インターネット上で類似の画像を検索できます。Yandex Imagesは、より一般的なソーシャルメディアサイトに加えて、あまり知られていないソーシャルメディアサイトも検索し、コンテンツ所有者が画像や写真の知的財産の盗用を追跡する手段を提供します。
Google の画像検索は、逆画像検索を利用した機能で、画像をアップロードするか画像の URL をコピーすることで関連画像を検索できます。Google は、送信された画像を分析し、その数学的モデルを構築することでこれを実現します。その後、Google のデータベース内の他の画像と比較し、一致する結果や類似の結果を返します。利用可能な場合は、Google は説明などの画像に関するメタデータも使用します。2022 年に、この機能はGoogle レンズに置き換えられ、Google のデフォルトのビジュアル検索方法になりましたが、古い画像検索機能は Google レンズ内で引き続き利用できます。[ 8 ]
TinEyeは、画像逆検索に特化した検索エンジンです。画像を送信すると、TinEyeはその画像の「ユニークでコンパクトなデジタル署名または指紋」を作成し、他のインデックス化された画像と照合します。[ 9 ]この手順は、送信された画像を大幅に編集したバージョンでも照合できますが、通常は類似の画像は結果に返されません。[ 10 ]
Lenso.aiは、人工知能を使用して画像ソースを識別し、視覚的に類似した画像を検出するウェブベースの逆画像検索エンジンであり、 [ 11 ]顔認識検索を実行します。[ 12 ]
Pixsy の逆画像検索技術は、Pixsy プラットフォームにアップロードされた画像と一致する画像をパブリック インターネット上で検出します[ 13 ] 。 [ 14 ]新しい一致は自動的に検出され、ユーザーにアラートが送信されます。 不正使用の場合、Pixsy は画像所有者の作品の商用利用に対する補償回復サービスを提供します[ 15 ] [ 16 ]。 Pixsy は、著作権侵害の解決のために、世界中の 25 以上の法律事務所や弁護士と提携しています。 Pixsy は、Flickr プラットフォームおよびユーザー向けの戦略的な画像監視サービスです。[ 17 ]
eBay ShopBot は、ユーザーがアップロードした写真から商品を検索するために逆画像検索を使用します。eBay はカテゴリ認識に ResNet-50 ネットワークを使用し、画像ハッシュはGoogle Bigtableに保存されます。Apache Sparkジョブは、画像ハッシュ抽出のためにGoogle Cloud Platformの Dataprocによって実行され、画像ランキングサービスはKubernetesによってデプロイされます。[ 18 ]
SK Planetは、自社のECサイトで関連するファッションアイテムを見つけるために逆画像検索を使用しています。同社は、実用化に向けて収束速度と汎化性能に優れたTensorFlow inception-v3ベースのビジョンエンコーダーネットワークを開発しました。多クラス分類にはリカレントニューラルネットワークを使用し、ファッション製品の関心領域検出にはFaster R-CNNを使用しています。SK Planetの逆画像検索システムは、100人月未満で構築されました。[ 19 ]
Alibabaは2014年にPailitaoアプリケーションをリリースしました。Pailitao(中国語:拍立淘、文字通りカメラで買い物をするという意味)は、ユーザーがクエリ対象物の写真を撮ることで、Alibabaの電子商取引プラットフォームで商品を検索できるようにするものです。Pailitaoアプリケーションは、検出マスクと背景の妨害のない正確な識別特徴を発見するために、検出と特徴学習を共同で行うためのブランチを持つディープCNNモデルを使用しています。カテゴリ予測と特徴学習のベースモデルとしてGoogLeNet V1が採用されています。 [ 20 ] [ 21 ]
Pinterest は2014 年にスタートアップ企業のVisualGraphを買収し、プラットフォームにビジュアル検索を導入しました。[ 22 ] 2015 年に Pinterest は、 ACM知識発見およびデータマイニング会議で論文を発表し、システムのアーキテクチャを公開しました。パイプラインは、 Apache Hadoop、オープンソースのCaffe畳み込みニューラルネットワークフレームワーク、バッチ処理用のCascading 、メッセージング用のPinLater、ストレージ用のApache HBaseを使用しています。ローカル特徴、ディープ特徴、顕著な色シグネチャ、顕著なピクセルなどの画像特性が、ユーザーのアップロードから抽出されます。システムはAmazon EC2で運用され、Pinterest への毎日の画像アップロードを処理するために 5 つの GPU インスタンスのクラスタのみが必要です。逆画像検索を使用することで、Pinterest はファッションオブジェクト (靴、ドレス、メガネ、バッグ、時計、パンツ、ショートパンツ、ビキニ、イヤリングなど) から視覚的特徴を抽出し、類似した製品の推奨を提供できます。[ 23 ] [ 24 ]
JD.comは、Middleware '18カンファレンスでリアルタイムビジュアル検索システムの設計と実装を公開しました。査読済みの論文では、JDの分散型階層画像特徴抽出、インデックス作成、検索システムで使用されるアルゴリズムに焦点を当てており、このシステムは1日あたり3億人のアクティブユーザーを抱えています。このシステムは、2018年に本番環境に導入された際、1時間あたり8000万件のデータベース更新に対応できました。[ 25 ]
Microsoft Bing は、 KDD'18 カンファレンスで逆画像検索システムのアーキテクチャを発表しました。この論文では、ユーザーが送信したクエリ画像からさまざまな特徴を使用してその内容を記述すると述べており、これにはディープニューラルネットワークエンコーダ、カテゴリ認識機能、顔認識機能、色特徴、重複検出機能の使用が含まれます。[ 26 ]
Amazon.comは、KDD'22カンファレンスで発表した論文で、Amazon Shop the Lookというファッションおよび家庭用品向けのビジュアル検索エンジンのアーキテクチャを公開した。この論文では、Amazonが本番環境に展開した際に得た教訓について説明しており、検索パフォーマンスの最適化と精度の向上を目的とした画像合成に基づくデータ拡張などが含まれている。[ 27 ]
Microsoft Research Asiaの北京ラボは、Arista-SS(類似検索)およびArista-DS(重複検索)システムに関する論文をProceedings of the IEEEに発表しました。Arista-DSは、計算コストとメモリコストを削減するために、グローバル画像特徴に対する主成分分析などの重複検索アルゴリズムのみを実行します。Arista-DSは、10台のサーバーで20億枚の画像に対して重複検索を実行できますが、ほぼ重複している画像を検出できないというトレードオフがあります。[ 28 ]
2007年に、PuzzleライブラリがISCライセンスの下でリリースされました。Puzzleは、画像のサイズ変更、再圧縮、色変更、および/またはわずかな変更後でも、視覚的に類似した画像を逆画像検索するように設計されています。[ 29 ]
画像マッチングのオープンソースプロジェクトは2016年にリリースされました。Apacheライセンスの下でライセンスされているこのプロジェクトは、 Pythonで書かれた逆画像検索エンジンを実装しています。[ 30 ]
Puzzleライブラリと画像マッチングプロジェクトはどちらもIEEE ICIP会議で発表されたアルゴリズムを使用しています。[ 31 ]
2017年、FacebookはMITライセンスの下でFAISSライブラリを公開した。[ 32 ] FAISSは、逆画像検索エンジンや画像類似性検索エンジンで使用される密なベクトルの類似性検索とクラスタリングを実行するために使用できる。[ 33 ] [ 34 ]
2019年にO'Reillyから出版された書籍では、シンプルな逆画像検索システムを数時間で構築する方法が解説されています。この書籍では、画像の特徴抽出と類似性検索に加え、GPUを使用したスケーラビリティや検索精度向上のためのチューニングといったより高度なトピックも扱っています。[ 35 ]このシステムのコードはGitHubで無料で公開されています。[ 36 ]
{{cite book}}:|work=無視されました (ヘルプ){{cite book}}:|work=無視されました (ヘルプ){{cite book}}:|work=無視されました (ヘルプ){{cite book}}:|website=無視されました (ヘルプ){{cite book}}:|website=無視されました (ヘルプ)