LabelMeは、 MITコンピュータ科学・人工知能研究所(CSAIL)が作成したプロジェクトで、注釈付きデジタル画像のデータセットを提供しています。このデータセットは動的で、無料で利用でき、一般からの貢献も歓迎しています。LabelMeの最も実用的な用途は、コンピュータビジョン研究です。2010年10月31日現在、LabelMeには187,240枚の画像、62,197枚の注釈付き画像、658,992個のラベル付きオブジェクトが含まれています。
LabelMeの開発動機は、コンピュータビジョン研究者向けの公開データの歴史に由来します。利用可能なデータのほとんどは特定の研究グループの問題に合わせてカスタマイズされており、新しい研究者は自身の問題を解決するために追加のデータを収集する必要がありました。LabelMeは、利用可能なデータのいくつかの一般的な欠点を解決するために開発されました。以下は、LabelMeを従来の研究と区別する特徴のリストです。
LabelMe注釈ツールは、ユーザーがプロジェクトに貢献するための手段を提供します。このツールは匿名でアクセスすることも、無料アカウントにログインしてアクセスすることもできます。ツールにアクセスするには、JavaScriptをサポートする互換性のあるWebブラウザが必要です。ツールが読み込まれると、LabelMeデータセットからランダムに画像が選択され、画面に表示されます。画像に既にオブジェクトラベルが関連付けられている場合は、ポリゴン形式で画像の上に重ねて表示されます。各オブジェクトラベルは異なる色で表示されます。
画像にラベルが完全に付いていない場合、ユーザーはマウスを使って画像内のオブジェクトを含む多角形を描画できます。たとえば、隣の画像で、建物の前に人が立っている場合、ユーザーはその人の境界線上の点をクリックし、開始点に戻るまで外側の縁に沿ってクリックを続けることができます。多角形が閉じられると、画面に吹き出しが表示され、オブジェクトのラベルを入力できます。ユーザーは、オブジェクトを最もよく表していると思うラベルを自由に選択できます。画像の以前のラベル付けに同意できない場合は、オブジェクトの輪郭多角形をクリックして、多角形を完全に削除するか、テキストラベルを編集して新しい名前を付けることができます。
ユーザーが画像に変更を加えると、その変更内容は保存され、LabelMeデータセットから誰でもダウンロードできるようになります。このようにして、ツールを使用するユーザーコミュニティからの貢献により、データは常に変化し続けます。ユーザーが画像編集を終えたら、「別の画像を表示」リンクをクリックすると、ランダムに選ばれた別の画像が表示されます。
LabelMeデータセットにはいくつかの問題があります。その一部はデータ自体に内在する問題で、例えば画像内のオブジェクトがサイズや画像位置に関して均一に分布していないことなどが挙げられます。これは、画像が主に人間によって撮影されており、人間はシーン内の興味深いオブジェクトにカメラの焦点を合わせる傾向があるためです。しかし、画像をランダムに切り抜き、リサイズすることで均一な分布をシミュレートできます。[ 1 ]その他の問題は、アノテーションツールのユーザーに与えられた自由度の高さに起因します。発生する問題には以下のようなものがあります。
LabelMeの開発者は、これらの決定をアノテーターに任せることにしました。その理由は、人々は画像の自然なラベル付けと思われるものに従って画像にアノテーションを付ける傾向があると彼らが考えているからです。これによりデータに多少のばらつきが生じ、研究者はこのばらつきを考慮してアルゴリズムを調整するのに役立ちます。[ 2 ]
LabelMeで提供されるオブジェクトのテキストラベルはユーザー入力に基づいているため、使用されるラベルには大きなばらつきがあります(前述のとおり)。そのため、オブジェクトの分析が困難になる場合があります。たとえば、犬の画像には、 dog、canine、hound、pooch、animalなどのラベルが付けられている可能性があります。理想的には、データを使用する際には、抽象レベルのオブジェクトクラスdogにこれらのテキストラベルすべてを組み込むべきです。
WordNet は、構造的に整理された単語のデータベースです。これにより、単語をカテゴリ、つまり WordNet の用語でいうところの意味に割り当てることができます。意味の割り当ては自動的に行うのは容易ではありません。LabelMe の開発者が自動意味割り当てを試みたところ、エラー率が高いことがわかったため、代わりに単語を手動で意味に割り当てることにしました。LabelMe プロジェクトには新しいラベルが継続的に追加されるため、最初は大変な作業のように思えるかもしれません。右側には、ポリゴンの増加と単語 (説明) の増加を比較したグラフがあります。ご覧のとおり、単語の増加はポリゴンの継続的な増加に比べて小さいため、LabelMe チームが手動で最新の状態に保つのは十分に容易です。[ 3 ]
WordNetによるラベル付けが完了すると、LabelMeデータベースでの検索が格段に効率的になります。例えば、「動物」で検索すると、犬、猫、ヘビなどの画像が表示されるようになります。しかし、手動でラベル付けが行われていたため、 「マウス」とラベル付けされたコンピューターマウスの画像は、「動物」で検索しても表示されません。また、 「犬の散歩」のような複雑な用語でラベル付けされたオブジェクトであっても、WordNetでは「犬」で検索するとこれらのオブジェクトが検索結果として表示されます。WordNetはLabelMeデータベースの利便性を大幅に向上させます。
重複が許容されるオブジェクトの大規模なデータセットがあれば、オブジェクトを別のオブジェクトの一部として分類するのに十分なデータが得られます。たとえば、ホイールに割り当てられたラベルのほとんどは、車や自転車などの他のラベルに割り当てられたオブジェクトの一部である可能性があります。これらは部分ラベルと呼ばれます。ラベルPがラベルOの部分ラベルであるかどうかを判断するには、次のようになります。 [ 4 ]
このアルゴリズムは、部分オブジェクトが外側のオブジェクト内に頻繁に含まれている場合に、オブジェクトの部分を自動的に分類することを可能にする。
オブジェクトの重なりのもう 1 つの例は、一方のオブジェクトが実際にはもう 1 つのオブジェクトの上に重なっている場合です。たとえば、画像に建物の前に立っている人物が含まれている場合があります。人物は建物の一部ではないため、上記のように部分ラベルではありません。代わりに、それらはたまたま重なっている 2 つの別々のオブジェクトです。どのオブジェクトが前景で、どのオブジェクトが背景かを自動的に判断するために、LabelMe の開発者はいくつかのオプションを提案しています。[ 5 ]
LabelMeプロジェクトは、 MatlabからLabelMeデータセットを使用するためのツールセットを提供します。研究はMatlabで行われることが多いため、これによりデータセットを既存のコンピュータビジョンツールと統合することが可能になります。データセット全体をダウンロードしてオフラインで使用することも、ツールボックスを使用して必要に応じてコンテンツを動的にダウンロードすることもできます。