自動インデックス作成は、大量の文書を統制語彙、分類体系、シソーラス、またはオントロジーに対してスキャンし、これらの統制用語を使用して大規模な電子文書リポジトリを迅速かつ効果的にインデックス化するコンピュータ化されたプロセスです。これらのキーワードまたは言語は、どの単語を一致させるかを決定するルールに基づいてシステムをトレーニングすることによって適用されます。これには、構文、使用法、近接性、およびシステムとインデックス作成に必要なその他のアルゴリズムなどの追加の部分があります。これは、テキストからインデックス情報を収集して取得するためにブールステートメントを使用して考慮されます。[ 1 ]インターネットの普及に伴い文書の数が指数関数的に増加するにつれて、自動インデックス作成は、無関係な情報の海から関連情報を見つける能力を維持するために不可欠になります。自然言語システムは、この無関係な情報の海を支援するために、7つの異なる方法に基づいてシステムをトレーニングするために使用されます。これらの方法は、形態論的、語彙的、構文的、数値的、句的、意味論的、および語用論的です。これらはそれぞれ、インデックス作成の対象となる特定の情報のためのドメインを構築するために、速度と用語の異なる部分を見ています。これは、インデックス作成の自動化プロセスで使用されます。[ 1 ]
自動化されたプロセスでは問題が発生する可能性があり、その主な原因は次の 2 つの要因です。1) 言語の複雑さ、2) コンピュータ技術側での直感性の欠如とステートメントから概念を外挿することの難しさ。[ 2 ]これらは主に言語的な課題と特定の問題であり、言語の意味論的および構文的側面に関係しています。[ 2 ]これらの問題は、定義されたキーワードに基づいて発生します。これらのキーワードを使用すると、ヒット、ミス、ノイズに基づいてシステムの精度を判断できます。これらの用語は、完全一致、人間なら見逃さないがコンピュータシステムが見逃したキーワード、人間なら選択しないがコンピュータが選択したキーワードに関連しています。これに基づく精度統計は、人間のインデックス作成の 100% に対してヒットが 85% 以上である必要があります。これにより、ミスとノイズを合わせたものが 15% 以下になります。このスケールは、優れた自動インデックス作成システムと見なされるものの基礎を提供し、問題が発生している場所を示します。[ 1 ]
自動インデックス作成は、特に科学技術文献へのより速く包括的なアクセスへの需要により、1950 年代初頭から注目を集めていました。[ 3 ]このインデックス作成への注目は、1957 年から 1959 年にかけて HP Lunh が発表した一連の論文によるテキスト処理から始まりました。Lunh は、コンピュータがキーワードのマッチング、ソート、コンテンツ分析を処理できると提案しました。これが自動インデックス作成の始まりであり、頻度分析に基づいてテキストからキーワードを抽出する公式でした。後に、頻度だけでは良い記述子には不十分であることが判明しましたが、これが自動インデックス作成の現在の状況への道の始まりでした。[ 4 ]これは、1960 年代に予測された情報爆発[ 5 ]によって強調され、情報技術とワールド ワイド ウェブの出現によって実現しました。この予測は Mooers によって準備され、テキスト処理と情報検索におけるコンピューティングの役割に関する概要が作成されました。この予測では、機械が大規模なコレクションの文書の保管に使用され、これらの機械を使用して検索を実行すると述べていました。ムーアーズはまた、データベースのインデックス作成のためのオンラインの側面と検索環境も予測しました。これにより、ムーアーズはインデックス作成に革命をもたらす帰納推論マシンを予測しました。[ 4 ]この現象は、膨大な量のデータを保管および整理するという課題に対処し、情報へのアクセスを容易にするインデックス作成システムの開発を必要としました。[ 6 ] [ 7 ] 新しい電子ハードウェアは、古い紙のアーカイブによって課せられた障壁を克服し、分子レベルで情報をエンコードできるようにしたため、自動インデックス作成をさらに進歩させました。[ 5 ]この新しい電子ハードウェアにより、ユーザーを支援するツールが開発されました。これらはファイルの管理に使用され、OutlookやLotus NoteなどのPDMスイートや、MindManagerやFreemindなどのマインドマッピングツールなどのさまざまなカテゴリに分類されました。これらにより、ユーザーはストレージと認知モデルの構築に集中できます。[ 8 ]自動インデックス作成は、計算言語学と呼ばれる分野の出現によっても部分的に推進されており、この分野は最終的に言語の構造と意味へのコンピュータ分析の適用などの技術を生み出す研究を方向づけた。[ 3 ] [ 9 ]自動インデックス作成は、人工知能や自己組織化システム(思考機械とも呼ばれる)の分野における研究開発によってさらに促進されている。 [ 3 ]
自動インデックス作成には、例えば医療分野など、多くの実用的な用途があります。2009年に発表された研究では、自動インデックス作成を使用して、ユーザーが医薬品に関する信頼できる情報を見つけることができる情報ポータルを作成する方法について研究者が述べています。CISMeFは、医薬品に関する情報を提供するように設計されたそのような医療ポータルの1つです。このウェブサイトは、MeSHシソーラスを使用して、MEDLINEデータベースの科学論文とダブリンコアメタデータをインデックス化します。システムはメタ用語「医薬品」を作成し、それを検索条件として使用して、特定の医薬品に関するすべての情報を見つけます。このウェブサイトは、シンプル検索と高度な検索を提供します。シンプル検索では、ブランド名または医薬品に割り当てられた任意のコードで検索できます。高度な検索では、探している医薬品を説明するすべての情報を入力できるため、より具体的な検索が可能です。[ 10 ]