ユニタームは、1951年にモーティマー・トーベによって導入された主題索引システムです。その名称は「unit」(単位)と「term」(用語)を組み合わせたもので、索引の基礎として単語(ユニターム)を使用していることに由来します。トーベ自身はこの概念全体を「座標索引」と呼んでいましたが、今日では一般的にユニタームとも呼ばれています。
Unitermは、トピックキーワードによる迅速な検索を可能にし、複数のトピックにわたってそれらのキーワードを相互参照することで、すべての用語に一致する文書を見つけるように設計されています。Uniterm検索の結果は、一致する文書を取得するために使用できる一連の登録番号です。Unitermは既存の登録番号に基づいているため、技術的には後付け座標系です。これは、デューイ十進分類法のように、文書の主題によって特定の番号が与えられる前付け座標系とは対照的です。Unitermは最も人気のある後付け座標系索引システムの1つでしたが、その成功の一部は、Taubeの会社が大規模な技術図書館の索引付けの契約を獲得したことによるものでした。
Unitermやその他の新しい索引システムの開発は、最終的には第二次世界大戦末期にその歴史を遡ります。ドイツで開発された先進的な航空機やロケット技術を認識していた米国は、これらの資料をできる限り多く収集するために、オペレーション・ラスティを、英国は同様のフェデン・ミッションを組織しました。これらの取り組みにより、航空機や様々な兵器の実例とともに、数百万ページに及ぶ技術文書が回収されました。これらの膨大なコレクションへのアクセスを容易にしたいという要望が、情報検索分野の大きな発展につながりました。[ 1 ]
米国では、航空関連の資料は当初ライトフィールドの米陸軍航空隊に送られたが、時が経つにつれて米国の研究資料の同様の保管庫と統合され、技術論文のコレクションが拡大し続けた。コレクションは非常に大規模かつ多様になったため、それを管理するために1951年に新たな運用グループである軍事技術情報局(ASTIA)が設立された。このグループは最終的に原子力委員会の管理下に入った。ASTIAはコレクションの索引付けの実験を開始し、この作業からUnitermが生まれた。[ 2 ]
タウベは、化学文書作成のための機械的補助に関するシンポジウムの一部である1951年の論文「科学分野の座標索引」でユニタームの概念を紹介した。翌年、タウベはジェラルド・ソファーと共同でドキュメンテーション社を設立した。同社は商用検索および索引サービスを提供した。彼らの最大の取り組みの一つは、1958年に新設されたNASAとの契約で、NASAの技術ライブラリ全体を索引化し、後にマイクロフィルムコピーを作成したことである。[ 3 ]
タウベの原著論文では、ユニタームの概念の大きな利点は自動化できることだと述べられています。本質的に、ユニターム検索プロセスは複数の用語の交差部分、つまりタウベが「座標」と呼んだものを探すことです。[ a ]この目的のために、彼らはIBMと提携して「連続多重アクセス照合装置」、つまりCOMACを開発しました。ユーザーはパンチカードライターで検索語を選択し、IBM 9900としても知られるCOMACに入力します。[ 4 ] COMACはそれらのユニタームカードを取り出し、光学システムを使用して一致する項目を探します。そして、それらの番号が記載された新しいカードを返し、それをハードドライブを搭載した最初のコンピュータであるIBM 305 RAMACに送信し、それらの番号に対応する完全な文書情報を取得しました。[ 4 ]
Uniterm は、コレクション内の文書を登録番号で参照する個別のカード目録を作成するという概念に基づいています。登録番号は Uniterm の索引では意味を持たないため、デューイ十進分類法やユニバーサル十進分類法などの一般的なシステムを使用することもできますし、多くの場合、単に連番を使用することもできます。[ 5 ] [ 2 ]
コレクションに新しい作品が追加されると、司書は他の作品と同様に、メインカード索引用の通常の索引カードを作成します。さらに、作品のタイトルまたは本文から検索に使用できる少数のキーワードを選択し、それらもカードに記入します。たとえば、航空機のエアダクトの着氷に関する文書は、「空気」、「ダクト」、「着氷」のカテゴリに分類されるかもしれませんが、あまりにも多くの文書で見られる「航空機」のカテゴリには分類されないかもしれません。[ 6 ]
次に、司書はUnitermカタログでその用語が記載されたカードを探します。見つからない場合は、カードの上部にキーワードを書き込み、下部を0から9までのラベルが付いた10個の縦のセクションに分割してカードを作成します。次に、登録番号の最後の桁をその列に書き込みます。たとえば、登録番号の最後の桁が5の場合は、登録番号全体を5列目に書き込みます。その用語のカードがコレクション内で見つかった場合は、新しい登録番号を既存のカードの適切な列に単純に追加します。[ 7 ]
文書を取得するには、ユーザーは有用と思われるキーワードを選択し、それらのカードをユニターム索引から抽出します。この記事を探すには、ユーザーは「索引付け」と「図書館」を選択し、それらのカードをユニタームカタログから取得します。これらのカードには、さまざまな文書の番号が付けられます。たとえば、「図書館」カードには、アレクサンドリア図書館に関する書籍のリストが含まれている場合があります。ただし、「図書館索引付け」に関する文書のみが両方のカードに表示されます。[ 8 ]
ユーザーはカードをスキャンして、特定の登録番号が両方のカードに表示されているかどうかを確認します。カードを10列に分割するのは、視覚的なスキャンプロセスを簡素化するためです。両方のカードに表示されている番号は検索に関連している可能性が高く、直接検索するか、部分的な登録番号が使用されている場合はメインカードカタログを参照することで検索できます。[ 8 ]
メインカタログのカードには、そのエントリを分類するために使用された用語も含まれており、クロスインデックスを形成しています。「プロペラ」と「飛行機」のカードを選択したユーザーは、カード上で多くの関連作品を見つけるかもしれません。メインインデックスに戻ると、メインインデックスカードに記録されている用語を確認し、「空気力学」など、よく出現する他の用語があることに気づくことができます。これらは、検索を絞り込むために使用できる追加の用語を示唆している可能性があります。その後、ユーザーは用語カタログに戻り、これらの新しい用語を適用して追加の文書を取得したり、検索をさらに絞り込んだりすることができます。[ 9 ]
Unitermは米国で大規模な技術資料集に広く利用され、そのシステムに関する多くの研究が行われた。特に有益な取り組みの一つは、国家安全保障局が7万点の資料集をカタログ化しようとした試みである。[ 10 ]
ユニタームシステムの大きな利点の1つは、図書館員が資料を正しく目録化するために資料を理解する必要がないことだと彼らは発見した。タイトルに出てくる用語や本文中で明らかに重要な用語を選択するだけで、多くの場合、有用なユニタームエントリが作成される。これは、階層内の適切な位置を選択するために基礎となる分野に関するある程度の、あるいはかなりの知識が必要となることが多かった従来の階層的アプローチとは対照的である。[ 10 ]
同様の取り組みにより、いくつかの問題点と解決策も明らかになった。その一つは、同義語が問題となることだった。「エアダクト」に関する論文は、「エアインテーク」に関する論文と同じなのか、それとも異なるのか。この問題は、作品を約 1,000 項目のセットに分割し、カタログをセクションごとに構築することで解決できると彼らは提案した。最初の 1,000 文書のセットから 1,000 個の単語が生成され、それらを調査して同義語を排除した。同義語が見つかった場合は、それらのカードに「参照」の見出しを追加した。次に、それらの同義語を使用して 2 番目のセットを追加した。新しい用語の追加は、約 4,000 項目で横ばいになり始め、10,000 項目以降は非常に具体的な技術用語のみが追加されるようになったことがわかった。[ 11 ]
この概念が最初に導入されたときに提起された懸念は、用語がまったく異なる概念を説明するために使用されているため、用語が多数の誤検出を返す可能性があるということでした。特に、順序によって意味が異なる可能性のある用語が問題になると考えられていました。「カナダへのアメリカの輸出」を検索している場合、「カナダ」、「米国」、「輸出」も、米国へのカナダの輸出に関する多数の文書を返し、結果セットを圧倒する可能性があります。[ 12 ]
しかし、これは実際には深刻な問題ではないことが判明し、発生した少数の例は、方向を組み込んだ「デルタ カード」、つまり参照エントリを追加することで解決されました。この場合、「US」カードには「USΔ」の参照エントリがあり、そのカードには米国からのエントリのみが含まれます。USΔ ページのユニタームは、米国からの輸出に関するものだけです。[ 12 ]