ラベル付きデータとは、1つ以上のラベルが付与されたサンプル群のことです。ラベル付けは通常、ラベルのないデータセットに対して、判断と呼ばれる情報的なタグを各データに付加する作業です。例えば、データラベルには、写真に馬が写っているか牛が写っているか、音声録音でどのような言葉が発せられたか、動画でどのような動作が行われているか、ニュース記事のトピックは何か、ツイートの全体的な感情は何か、X線写真の点が腫瘍かどうかなどを示すことができます。
ラベルは、ラベル付けされていない特定のデータについて人間が判断を下すことで取得できます。[ 1 ]ラベル付きデータは、ラベル付けされていない生データよりも取得コストがかなり高くなります。
ラベル付きデータの質は、教師あり機械学習モデルの動作性能に直接影響を与えます。これらのモデルは、提供されたラベルから学習するからです。[ 2 ]
2006年、スタンフォード人間中心AI研究所の共同所長であるFei-Fei Liは、トレーニングデータを大幅に拡大することで画像認識のための人工知能モデルとアルゴリズムを改善する研究を開始しました。研究者たちはワールドワイドウェブから数百万枚の画像をダウンロードし、学部生のチームが各画像にオブジェクトのラベルを付け始めました。2007年、Liはデジタル作業のオンラインマーケットプレイスであるAmazon Mechanical Turkでデータラベル付け作業をアウトソーシングしました。49,000人以上の作業員によってラベル付けされた320万枚の画像は、物体の輪郭認識のための最大規模の手動ラベル付けデータベースの1つであるImageNetの基礎となりました。[ 3 ]
ラベル付きデータセットを取得した後、機械学習モデルをデータに適用することで、新しいラベルなしデータをモデルに提示し、そのラベルなしデータに対して可能性のあるラベルを推測または予測することができます。[ 4 ]
アルゴリズムによる意思決定は、プログラマ主導のバイアスとデータ主導のバイアスの両方の影響を受けます。バイアスのあるラベル付きデータに依存するトレーニングデータは、機械学習アルゴリズムが正当であっても、予測モデルに偏見や欠落をもたらします。特定の機械学習アルゴリズムをトレーニングするために使用されるラベル付きデータは、結果にバイアスがかからないように、統計的に代表性のあるサンプルである必要があります。 [ 5 ]例えば、顔認識システムでは、トレーニングに使用できるラベル付きデータが人口を代表していない場合、過小評価されているグループがその後誤分類されることがよくあります。2018年にJoy BuolamwiniとTimnit Gebruによる研究では、顔認識アルゴリズムのトレーニングに使用された2つの顔分析データセット、IJB-AとAdienceは、それぞれ79.6%と86.2%の肌の色が薄い人間で構成されていることが示されました。[ 6 ]
人間のアノテーターは、データのラベル付けにおいてエラーやバイアスが生じやすい。これにより、ラベルに一貫性がなくなり、データセットの品質に影響を与える可能性がある。この一貫性の欠如は、機械学習モデルの汎化能力に影響を与える可能性がある。[ 7 ]
法律文書分析や医用画像処理などの特定の分野では、専門的なドメイン知識を持つアノテーターが必要です。専門知識がないと、アノテーションやラベル付きデータが不正確になり、実際のシナリオでの機械学習モデルのパフォーマンスに悪影響を与える可能性があります。[ 8 ]