異言語情報検索( CLIR ) は、ユーザーのクエリの言語とは異なる言語で書かれた情報を検索する情報検索のサブフィールドです。 [ 1 ] 「異言語情報検索」という用語には多くの同義語があり、おそらく最もよく使われるのは次のものです: 異言語情報検索、トランスリンガル情報検索、多言語情報検索。「多言語情報検索」という用語は、多言語コレクションを検索するための技術と、ある言語の資料を別の言語で処理するように移行された技術の両方をより一般的に指します。多言語情報検索 (MLIR) という用語は、さまざまな言語で情報クエリを受け付け、さまざまな言語のオブジェクト (テキストやその他のメディア) をユーザーの言語に翻訳して返すシステムの研究を含みます。異言語情報検索は、ユーザーが情報ニーズをある言語で表現し、システムが別の言語で関連するドキュメントを検索するユースケースをより具体的に指します。そのため、ほとんどのCLIRシステムはさまざまな翻訳技術を使用しています。CLIR技術は、さまざまな翻訳リソースに基づいてさまざまなカテゴリに分類できます。[ 2 ]
CLIRシステムは非常に進歩しており、今日では最も正確な多言語およびクロスリンガルのアドホック情報検索システムは、単言語システムとほぼ同等の効果を発揮します。 [ 3 ]メディア監視、情報フィルタリングとルーティング、感情分析、情報抽出などのその他の関連情報アクセスタスクでは、より高度なモデルと、通常、関心のある情報項目のより多くの処理と分析が必要です。その処理の多くは、展開される対象言語の具体的な内容を認識する必要があります。
人間の言語におけるさまざまなバリエーションのメカニズムは、情報検索システムにとってカバレッジの課題となることが多い。コレクション内のテキストは関心のあるトピックを扱っているが、ユーザーが指定した情報ニーズの表現と一致しない用語や表現を使用している可能性がある。これは単一言語の場合にも当てはまるが、特にユーザーが対象言語をある程度しか知らない可能性がある多言語情報検索では当てはまる。対象言語の能力が低いか中程度のユーザーにとってのCLIR技術の利点は、流暢なユーザーよりも大きいことがわかっている。[ 4 ] CLIRサービスに採用されている具体的な技術には、屈折を処理する形態素解析、複合語を処理するための分解または複合語分割、クエリをある言語から別の言語に翻訳する翻訳メカニズムなどがある。
CLIRに関する最初のワークショップは、SIGIR-96会議中にチューリッヒで開催されました。[ 5 ]ワークショップは、2000年以降、クロス言語評価フォーラム(CLEF)の会議で毎年開催されています。研究者たちは、さまざまな情報検索システムと方法に関する調査結果について議論するために、毎年開催されるテキスト検索会議(TREC)にも集まり、この会議はCLIRサブフィールドの参照点として機能しています。[ 6 ]初期のCLIR実験は、1997年11月19日~21日に国立標準技術研究所(NIST)で開催されたTREC-6で行われました。[ 7 ]