統制語彙は、知識を整理して後で検索するための方法を提供する。統制語彙は、主題索引体系、主題見出し、シソーラス[ 1 ] [ 2 ] 、分類体系、およびその他の知識組織システムで使用される。統制語彙体系では、体系の設計者によって事前に選択された定義済みの優先用語の使用が義務付けられているが、自然言語の語彙にはそのような制限はない[ 3 ] 。
図書館情報学において、統制語彙とは、情報単位(文書や作品)にタグを付けて検索しやすくするために用いられる、厳選された単語やフレーズのリストである。 [ 4 ] [ 5 ]統制語彙は、概念と優先用語との全単射によって、同形異義語、類義語、多義語の問題を解決する。つまり、統制語彙は、同じ概念に異なる名前が付けられる可能性がある通常の人間言語に内在する望ましくない曖昧さを減らし、一貫性を確保する。[ 3 ]
例えば、米国議会図書館件名標目表[ 6 ](統制語彙を使用する件名標目システム)では、同じ単語の異なる綴り(アメリカ式とイギリス式)、科学用語と一般用語(ゴキブリとアメリカゴキブリ)、同義語(自動車と車)の選択など、さまざまな難しい問題に対処するために、優先用語(この場合は件名標目)を選択する必要があります。
推奨用語の選択は、ユーザー妥当性(ユーザーが使用する可能性が高い用語)、文献妥当性(文献や文書で一般的に使用されている用語)、構造妥当性(統制語彙の構造や範囲を考慮して選択された用語)の原則に基づいています。
統制語彙では、通常、修飾語を用いて同形異義語の問題も処理します。たとえば、poolという用語は、 swimming poolまたは game poolのどちらかを指すように修飾する必要があります。これにより、各優先用語または見出しが 1 つの概念のみを指すことが保証されます。[ 7 ]
図書館で使用される統制語彙ツールには、主に2種類あります。件名標目[ 8 ]とシソーラスです。両者の違いは縮小しつつありますが、まだいくつかの小さな違いがあります。
用語は、その分野の専門知識を持つ訓練を受けた専門家(司書や情報科学者など)によって選定・整理されます。統制語彙を用いることで、文書本文中に用語自体が出現していなくても、文書の内容を正確に記述することができます。よく知られている主題見出しシステムには、米国議会図書館システム、米国国立医学図書館が作成した医学主題見出し(MeSH)、シアーズなどがあります。よく知られている類語辞典には、美術・建築類語辞典やERIC類語辞典などがあります。
統制語彙の用語を選択する際には、設計者は選択した用語の具体性、直接入力を使用するかどうか、用語間の整合性、および言語の安定性を考慮する必要がある。
最後に、システムにおける事前調整(この場合、列挙と統合の度合いが問題となる)と事後調整の量も重要な問題です。文書やその他の情報システムエンティティ(DBMS、Webサービスなど)のコンテンツ識別プロセスを支援するためにタグとして使用される統制語彙要素(用語/フレーズ)はメタデータに該当します。
インデックス作成言語には主に3つの種類があります。
文書に索引を作成する際、索引作成者は索引の網羅性、つまり文書をどの程度詳細に記述するかというレベルを選択する必要があります。例えば、索引の網羅性を低く設定すると、作品の細かい部分は索引語で記述されません。一般的に、索引の網羅性が高いほど、各文書に索引付けされる用語の数が増えます。
近年、文書へのアクセス手段として自由テキスト検索が普及している。これは、自然言語インデックスを使用し、インデックスを最大限まで網羅的に設定する(テキスト内のすべての単語がインデックス化される)。これらの方法は、2007年の論文「全文検索、概念ベース検索、および文脈依存検索の比較評価」 [ 9 ]など、いくつかの研究で比較されている。
統制語彙は、検索結果リスト内の無関係な項目を減らすなど、自由記述検索の精度を向上させるとよく言われます。これらの無関係な項目(偽陽性)は、自然言語に内在する曖昧さによって引き起こされることがよくあります。たとえば、英語の「football」という単語を考えてみましょう。 「football」は、さまざまなチームスポーツに付けられた名前です。世界的に最も人気のあるチームスポーツはアソシエーションフットボールで、いくつかの国ではサッカーとも呼ばれています。 「football」という単語は、ラグビーフットボール(ラグビーユニオンとラグビーリーグ)、アメリカンフットボール、オーストラリアンフットボール、ゲーリックフットボール、カナディアンフットボールにも使われます。したがって、 「football」で検索すると、まったく異なる複数のスポーツに関する文書が検索結果として表示されます。統制語彙は、曖昧さを排除するように文書にタグを付けることで、この問題を解決します。
自由記述検索と比較して、統制語彙を使用することで、情報検索システムのパフォーマンスを劇的に向上させることができます。ただし、パフォーマンスを精度(検索結果リスト内の文書のうち、実際に検索トピックに関連する文書の割合)で測定する場合に限ります。
場合によっては、統制語彙は記憶の想起を向上させることもあります。なぜなら、自然言語の検索方法とは異なり、適切な優先用語が検索された後は、その用語の同義語である可能性のある他の用語を検索する必要がないからです。
統制語彙を用いた検索では、検索クエリに実際に関連する文書の一部が見つからないため、不十分な結果につながる可能性がある。
これは、検索クエリに含まれる用語が主題分野と十分に関連性が低い場合、特に問題となります。なぜなら、索引作成者は別の用語でタグ付けすることを決定している可能性があるにもかかわらず、検索者は同じ用語を使用している可能性があるからです。基本的に、この問題を回避できるのは、語彙の理解が索引作成者の理解と一致する、統制語彙に精通したユーザーだけです。
別の可能性としては、インデックス作成の網羅性が低いため、記事にタグが付けられていないということが考えられます。例えば、記事の中でサッカーが副次的なテーマとして言及されていても、インデックス作成者は主要なテーマに比べて重要度が低いと判断し、「サッカー」というタグを付けないかもしれません。しかし、検索者にとってはその記事が関連性のある内容であるため、検索結果に表示されないという事態になりかねません。フリーテキスト検索であれば、いずれにしてもその記事は自動的に検索対象に含まれます。
一方、自由記述検索は網羅性が高く(すべての単語が検索される)、精度ははるかに低いものの、検索者が同義語の問題を克服してあらゆる組み合わせを入力すれば、高い再現率が得られる可能性がある。
急速に発展する知識分野では、優先用語を定期的に更新しない限り、統制語彙はすぐに時代遅れになる可能性がある。理想的な状況であっても、統制語彙は本文中の単語よりも具体性に欠けることが多い。索引作成者は適切な索引語を選択しようとする際、著者の意図を誤解する可能性があるが、自由記述文では著者自身の言葉が用いられるため、このような問題は生じない。
統制語彙の使用は、各項目を索引付けするために人間の専門家または高価な自動システムが必要となるため、自由記述検索に比べてコストがかかる場合があります。さらに、システムを最大限に活用するには、ユーザーは統制語彙体系に精通している必要があります。しかし、既に述べたように、同義語や同形異義語を統制することで、精度を高めることができます。
統制語彙の作成を支援するために、ファセット分類など、数多くの手法が開発されてきた。ファセット分類とは、特定のデータレコードや文書を複数の方法で記述することを可能にする手法である。
選択された語彙における言葉の選択は中立的ではなく、索引作成者は言葉の選択の倫理を慎重に検討しなければならない。例えば、先住民の問題について議論する際に、伝統的に植民地主義的な用語が選択された語彙で好んで使われることが多く、それが論争を引き起こしてきた。[ 10 ]
米国議会図書館件名標目表などの統制語彙は、書籍の研究と分類である書誌学の不可欠な要素です。これらは当初、図書館情報学で開発されました。1950年代には、政府機関が専門分野における急増する学術誌文献のための統制語彙の開発を開始しました。米国国立医学図書館が開発した医学主題標目表(MeSH)はその一例です。その後、あらゆる分野の急速に増加する文献を索引化するために、営利企業(抄録・索引サービスと呼ばれる)が登場しました。1960年代には、ダイヤルアップX.25ネットワークをベースとしたオンライン書誌データベース業界が発展しました。これらのサービスは使い方が難しかったため、一般にはほとんど公開されず、検索仲介者と呼ばれる専門の司書が検索業務を担当しました。1980年代には、最初の全文データベースが登場しました。これらのデータベースには、索引記事の全文と書誌情報が含まれています。オンライン書誌データベースはインターネット上に移行し、現在では一般に公開されていますが、そのほとんどは独自開発であり、利用料が高額になる場合があります。大学や高等教育機関に在籍する学生は、これらのサービスの一部を無料で利用できる場合があります。また、公共図書館でも無料で利用できるサービスがあります。
大規模組織では、技術コミュニケーションを改善するために統制語彙が導入されることがあります。統制語彙を使用することで、誰もが同じ意味で同じ単語を使用することが保証されます。このような用語の一貫性は、技術文書作成や知識管理において最も重要な概念の一つであり、文書や組織全体で同じ単語を使用するように努めることで、同じ事柄を指す際にわずかに異なる単語を使用することを防ぎます。
ウェブページを記述するための統制語彙を開発することで、ウェブ検索は劇的に改善される可能性があります。このような語彙の使用は、ウェブページの内容を機械可読なメタデータ体系を用いて記述するセマンティックウェブへと発展する可能性があります。このような体系の最初の提案の1つがダブリンコアイニシアチブです。ウェブページのインデックス作成に使用できる統制語彙の例として、PSHが挙げられます。
単一のメタデータ体系でウェブ全体のコンテンツを記述できる可能性は低い。[ 11 ]セマンティックウェブを作成するには、ウェブページのコンテンツを記述するために2つ以上のメタデータシステムから情報を取得する必要があるかもしれない。交換可能なファセットメタデータ言語(XFML)は、統制語彙の作成者がメタデータシステムを公開および共有できるように設計されている。XFMLはファセット分類の原則に基づいて設計されている。[ 12 ]
セマンティック Webの統制語彙は、関心のある分野や懸念事項を説明するために使用される概念と関係 (用語) を定義します。たとえば、機械可読形式で人物を宣言するには、「人物」の正式な定義を持つ語彙が必要です。たとえば、名前、敬称、所属、電子メール アドレス、ホームページなど、人物の典型的なプロパティを定義する Person クラスを持つFriend of a Friend ( FOAF ) 語彙、またはSchema.orgの Person 語彙[ 13 ]などです。同様に、書籍はSchema.orgの Book 語彙[ 14 ]とDublin Core語彙[ 15 ]の一般的な出版用語を使用して説明でき、イベントはSchema.orgの Event 語彙[ 16 ]などを使用して説明できます。
ウェブデザイナーは、任意の統制語彙から機械可読な用語を使用するために、マークアップ内でRDFa、 HTML5マイクロデータ、JSON-LDなどのさまざまな注釈形式を選択したり、外部ファイルでRDFシリアル化(RDF/XML、Turtle、N3、TriG、TriX)を選択したりできます。