分類とは、対象物を既存のクラスやカテゴリに割り当てる活動です。これは、クラス自体を確立する作業(例えば、クラスタ分析によるもの)とは異なります。[ 1 ]例としては、診断テスト、スパムメールの識別、運転免許証の交付の可否の決定などがあります。
「カテゴリー」の他に、「クラス」の同義語またはほぼ同義語には、「タイプ」、「種」、「形態」、「目」、「概念」、「分類群」、「グループ」、「識別」、「区分」などがあります。
「分類」(およびその類義語)という言葉の意味は、いくつかの関連する意味を持つ可能性があります。例えば、「Wikipedia のページを分類する作業」のように、分類とクラスの作成の両方を含む場合があり、この全体的な活動は分類体系(タクソノミー)に分類されます。また、分類体系の根底にあるスキーム(タクソノミーとも呼ばれる)のみを指す場合もあります。あるいは、分類者がオブジェクトに与えるラベルを指す場合もあります。
分類はさまざまな活動の一部であり、医学、哲学、[ 2 ]法学、人類学、生物学、分類学、認知、コミュニケーション、知識組織化、心理学、統計学、機械学習、数学など、さまざまな観点から研究されています。人間の意思決定の経済学的研究では、離散選択と呼ばれます。
分類器の精度を向上させることを目的とした方法論的研究は、一般的に、クラスがちょうど2つある場合(二値分類)と、クラスが3つ以上ある場合(多クラス分類)に分けられます。
決定理論とは異なり、分類器は分類タスクを何度も繰り返すと想定されます。また、宝くじとは異なり、各分類は正解か不正解かのどちらかであると想定されます。測定理論では、分類は名義尺度に対する測定として理解されます。したがって、分類器の精度を測定することが可能です。
分類器の精度を測定することで、2 つの代替分類器から選択することができます。これは、分類器を開発するときと、どの分類器を導入するかを選択するときの両方で重要です。しかし、分類器の精度を評価する方法は数多くあり、どの状況でどの方法を使用すべきかを決定する一般的な方法はありません。さまざまな分野では、バイナリ分類でさえも、さまざまなアプローチが取られています (バイナリ分類器の評価を参照)。パターン認識では、エラー率が一般的です。ジニ係数と KS 統計量は、信用スコアリング業界で広く使用されています。感度と特異度は、疫学と医学で広く使用されています。適合率と再現率は、情報検索で広く使用されています。[ 3 ]
分類器の精度は、分類対象データの特性に大きく依存します。あらゆる問題に対して最適な性能を発揮する単一の分類器は存在しません(この現象は「ノーフリーランチ定理」によって説明できるかもしれません)。