自然言語処理 において、言語識別 または言語推測とは、与えられたコンテンツがどの 自然言語 で書かれているかを判断する問題である。この問題に対する計算論的アプローチでは、これをテキスト分類 の特殊なケースと捉え、様々な統計的 手法を用いて解決する。
概要
統計的手法 言語識別には、いくつかの統計的手法が存在する。
グレフェンステット[ 3 ] による古い統計的手法は、短いnグラムの頻度に基づいており、これらはしばしば機能形態素 である。例えば、「ing」はフランス語よりも英語でよく使われるが、「que」という語列はフランス語でよく使われる。ウェブ上で見つかった新しいページが与えられた場合、そのような短い語列の出現回数を数え、その語列の頻度表に最も一致する言語を選択する。
1つの手法は、テキストの圧縮率を既知の言語のセットのテキストの圧縮率と比較することです。このアプローチは、相互情報量に基づく距離尺度として知られています。同じ手法は、歴史的手法を使用して構築されたツリーに密接に対応する言語の系統樹を経験的に構築するためにも使用できます。[ 4 ] 相互情報量に基づく距離尺度は、本質的に従来型のモデルベースの手法と同等であり、一般的には新しいものでも、より単純な手法よりも優れているとも考えられていません。
CavnarとTrenkle(1994)およびDunning(1994)が説明した別の手法は、各言語の「トレーニングテキスト」から言語n-gramモデルを作成することです。これらのモデルは、文字(CavnarとTrenkle)またはエンコードされたバイト(Dunning)に基づいて作成できます。後者の場合、言語識別と 文字エンコード検出が 統合されています。次に、識別が必要なテキストに対して、同様のモデルを作成し、そのモデルを保存されている各言語モデルと比較します。最も可能性の高い言語は、識別が必要なテキストのモデルに最も類似したモデルを持つ言語です。このアプローチは、入力テキストがモデルが存在しない言語である場合に問題となる可能性があります。その場合、この方法は別の「最も類似した」言語を結果として返す可能性があります。また、Webでよく見られるように、複数の言語で構成される入力テキストも、どのアプローチにとっても問題となります。
2025年現在 一般的に使用されているベースライン手法はfastText ライブラリを使用するもので、ディープラーニング技術と同等の分類精度を持ちながら、はるかに高速です。[ 5 ]
類似言語の特定 言語識別システムの大きな課題の一つは、近縁言語を区別することです。ブルガリア語 とマケドニア語 、インドネシア語 とマレー語 のように類似した言語は、語彙や構造において大きな重複が見られるため、システムがそれらを区別するのは困難です。
2014年にDSL共有タスク[ 6 ] が組織され、6つの言語グループに属する13の異なる言語(および言語変種)を含むデータセット(Tan et al., 2014)が提供されました。グループA(ボスニア語、クロアチア語、セルビア語)、グループB(インドネシア語、マレー語)、グループC(チェコ語、スロバキア語)、グループD(ブラジルポルトガル語、ヨーロッパポルトガル語)、グループE(イベリア半島スペイン語、アルゼンチンスペイン語)、グループF(アメリカ英語、イギリス英語)。最良のシステムは95%を超える結果を達成しました(Goutte et al., 2014)。DSL共有タスクの結果はZampieri et al. 2014に記載されています。
参考文献 Benedetto, D.、E. Caglioti、V. Loreto。「言語ツリーとジッピング」。Physical Review Letters 、88:4 (2002)、複雑性理論。 Cavnar, William B. および John M. Trenkle。「Nグラムに基づくテキスト分類」。SDAIR-94、第3回文書分析および情報検索に関する年次シンポジウム議事録(1994年)。 Cilibrasi, Rudi および Paul MB Vitanyi。「圧縮によるクラスタリング」。IEEE Transactions on Information Theory 51(4)、2005 年 4 月、1523–1545。 Dunning, T. (1994)「言語の統計的識別」。技術報告書 MCCS 94-273、ニューメキシコ州立大学、1994 年。 グッドマン、ジョシュア。(2002)「言語ツリーとジッピング」に関する拡張コメント。マイクロソフトリサーチ、2002年2月21日。(これは、ナイーブベイズ法を支持するデータ圧縮に対する批判である。) Goutte, C.; Leger, S.; Carpuat, M. (2014)類似言語を識別するためのNRCシステム。Coling 2014ワークショップ「類似言語、変種、方言へのNLPツールの適用」議事録 グレフェンステット、グレゴリー。(1995)2つの言語識別スキームの比較。第3回テキストデータの統計分析に関する国際会議 (JADT 1995)議事録。 Poutsma, Arjen. (2001) 言語識別にモンテカルロ法を適用する。SmartHaven、アムステルダム。CLIN 2001で発表。2015-01-07 にWayback Machine に アーカイブ済み。 Tan, L.; Zampieri, M.; Ljubešić, N.; Tiedemann, J. (2014)類似言語の識別のための比較可能なデータソースの統合:DSLコーパスコレクション。第7回比較可能なコーパスの構築と利用に関するワークショップ(BUCC)議事録。アイスランド、レイキャビク。p. 6-10 エコノミスト誌(2002年)「スタイルの要素:圧縮データの分析が言語学において目覚ましい成果をもたらす」 Radim Řehůřek および Milan Kolkus。(2009)「Web 上での言語識別:辞書方式の拡張」計算言語学およびインテリジェントテキスト処理 。 Zampieri, M.; Tan, L.; Ljubešić, N.; Tiedemann, J. (2014) DSL共有タスク2014に関するレポート。類似言語、変種、方言へのNLPツールの適用に関する第1回ワークショップ(VarDial)議事録。ダブリン、アイルランド。p. 58-67。
参考文献 ↑ ストック、ヴォルフガング G.;ストック、メヒティルド (2013-07-31)。情報科学ハンドブック 。ウォルター・デ・グルイテル。ページ180–181。ISBN 978-3-11-023500-5 。 ↑ 萩原正人(2021年12月14日) 『 実世界における自然言語処理:深層学習による実践的応用』 サイモン&シュスター、 105-106 頁 。ISBN 978-1-61729-642-0 。↑ Grefenstette, Gregory (1995 年 12 月) 「2 つの言語識別スキームの比較」 (PDF) . 第 3 回テキストデータの統計分析に関する国際会議 (JADT'95) 議事録 . ローマ. pp. 263–268 . ↑ Benedetto, Dario; Caglioti, Emanuele; Loreto, Vittorio (2002 年 1 月) 「 言語 ツリーとジッピング」 Physical Review Letters 88 (4) 048702. arXiv : cond-mat/0108530 . Bibcode : 2002PhRvL..88d8702B . doi : 10.1103/PhysRevLett.88.048702 . ISSN 0031-9007 . PMID 11801178 . ↑ Joulin, Armand; Grave, Edouard; Bojanowski, Piotr; Mikolov, Tomas (2017 年 4 月). Lapata, Mirella; Blunsom, Phil; Koller, Alexander (編). "効率的なテキスト分類のためのトリック集" . Proceedings of the 15th Conference of the European Chapter of the Association for Computational Linguistics: Volume 2, Short Papers . Valencia, Spain: Association for Computational Linguistics: 427–431 . ↑ 「VarDial Workshop @ COLING 2014」 。