計算言語学および応用言語学の分野では、形態論辞書は、単語の表面形式と語彙形式との対応関係を含む言語リソースです。単語の表面形式とは、自然言語テキストに見られるものです。表面形式に対応する語彙形式は、語幹に続いて文法情報(例えば、品詞、性、数)が続くものです。英語では、give 、 gives、giving、gave、givenは動詞giveの表面形式です。語彙形式は「give」動詞になります。形態論辞書には、形態素アラインメント辞書と完全形式(非アラインメント)辞書の 2 種類があります。
構文上の依存関係を言語横断的に注釈するためのUniversal Dependencies の成功に触発され、形態論についても同様の取り組みが生まれています。例えば、UniMorph [ 1 ]やUDer [ 2 ]などです。これらは、1行に1つの形式とその派生(UDer)、または屈折情報(UniMorph)を記載した、シンプルな表形式(タブ区切り)を特徴としています。
アーレン・アーレンV.PTCP;PRS
アーレン アーレン V;IND;PRS;1;PL
アーレン アーレン V;IND;PRS;3;PL
アーレン アーレン V;NFIN
(UniMorph、ドイツ語。列はLEMMA、FORM、FEATURESです)
UDerでは、追加情報(品詞)が以下の列内にエンコードされます。
abändern_V Abänderung_Nf dVN07>
アバルベイテン_Nn アバルベイテン_V dNV09>
abartig_A Abartigkeit_Nf dAN03>
Abart_Nf abartig_A dNA05>
abbaggern_V Abbaggern_Nn dVN09>
(UDer、ドイツ語版DErivBase 0.5。列はBASE、DERIVED、RULEです)
執筆時点(2021年)では、これらはすべて非整合型の形態素辞書です(下記参照)。そのシンプルな形式は機械学習技術の適用に特に適しており、特にUniMorphは数多くの共有タスクの対象となってきました。
有限状態トランスデューサ(FST) は、形態論、特に屈折形態論の計算処理によく用いられる手法です。ルールベースの形態素解析器では、通常、語彙とルールの両方が有限状態オートマトンとして形式化され、その後結合されます。そのため、特定の処理命令を持つ形態素辞書が必要となります (多くの場合、言語的な解釈がありますが、技術的には任意の文字列記号として扱われます)。[ 3 ] SFST [ 4 ] (Debian および Ubuntu の fst パッケージから入手可能)などの一般的な FST パッケージでは、形態素辞書のアプリケーション固有のファイル形式を定義できます。この形式では、さまざまな形態素情報が個々の形態素ごとにまとめられます。そのため、これらは整列された形態素辞書ですが、構造が非常に豊富で (また、独特でもあります)。
SMOR [ 5 ](ドイツ語SFST文法)からのサンプルデータ:
<Base_Stems>アーヘン<NN><base><nativ><Name-Neut_s>
<Base_Stems>Aal<NN><base><nativ><NMasc_es_e>
<Base_Stems>Aarau<NN><base><nativ><Name-Neut_s>
<Suff_Stems><suffderiv><gebunden><kompos><NN>nom<>:e<>:n<NN><SUFF><kompos><frei>
<Suff_Stems><suffderiv><gebunden><kompos><NN>nom<NN><SUFF><base><frei><NMasc_en_en>
<Suff_Stems><suffderiv><gebunden><kompos><NN>nom<NN><SUFF><deriv><frei>
インターライングロステキスト (IGT)は、言語ドキュメンテーション、言語類型論、および言語学や文献学の他の分野でよく使われる形式です。IGT は特別なソフトウェアなしで (従来のエディタだけで) 作成できますが、そのような特別なソフトウェアも開発されており、Toolbox [ 6 ] 、 FieldWorks Language Explorer (FLEx) [ 7 ] 、または Xigt [ 8 ]のようなオープンソースの代替品などが挙げられます。Toolboxと FLEx は、内部の形態辞書を使用して半自動の注釈をサポートしています。辞書に注釈が見つかる形態素セグメントに遭遇すると、その注釈が適用されます。形態素セグメントに新しい注釈が付けられると、その注釈は辞書に保存されます。FLEx と Toolbox は、テキストの注釈と辞書の編集のためのさまざまなエディタ機能を提供し、注釈に含まれる情報以外の追加情報を追加できますが、その核心は、それらのフォーマットが整列された形態辞書を提供することです。
FLExとXigtはXML形式をベースとしていますが、Toolboxは独自の「マーカー」を備えたプレーンテキスト形式を使用しています。FLExとToolboxは直接相互運用できませんが、ToolboxからFLExへの半自動コンバーターは存在します。XigtにはFLExとToolboxのインポーターが付属していますが、FLExやToolboxほど広くは使用されていません。FLExとToolboxの形式は人間が読み取ることを想定しておらず、ネイティブツール以外の処理ソフトウェアでは十分にサポートされていません。
OntoLex は、ウェブ上の機械可読辞書のコミュニティ標準です。2019 年に、辞書学における形態論のデータモデリングを容易にし、自然言語処理用の形態辞書のデータモデルを提供する目的で OntoLex-Morph モジュールが提案されました。[ 9 ] OntoLex-Morph は、整列された形態辞書と整列されていない形態辞書の両方をサポートしています。具体的な目標は、機械学習で使用される IGT 辞書、FST 語彙、形態辞書間の相互運用性を確立することです。
整列された形態論辞書では、単語の表面形と語彙形の対応関係が文字レベルで整列されます。例えば、次のようになります。
ここで、 θは空の記号であり、⟨n⟩は「名詞」を、⟨pl⟩は「複数形」を表します。
この例では、左側が表層形(入力)、右側が語彙形(出力)です。この順序は、表層形から語彙形を生成する形態素解析で用いられます。形態素生成では、この順序は逆になります。
形式的には、Σが入力記号のアルファベットであり、は出力記号のアルファベットであり、整列された形態論辞書は部分集合である。、 どこ:
は、空記号を含むすべての可能な配置のアルファベットです。つまり、整列された形態辞書は、文字列のセットです。。
非整列形態論辞書(または完全形辞書)は、単に入力文字列と出力文字列のペア。非整列形態論辞書では、前の例を次のように表します。
非整列辞書を整列辞書に変換することは可能です。左揃えや右揃えといった単純な整列だけでなく、文字を対応する形態素に揃える、言語学的に意味のある整列も可能です。
多くの場合、単語の表面的な形には複数の語彙形式が関連付けられています。例えば、「house」は単数形の名詞/haʊs/である場合もあれば、現在形の動詞/haʊz/である場合もあります。そのため、入力文字列とそれに対応する出力文字列を関連付ける関数が必要となります。
セットを定義すると、入力単語の対応関数は次のようになる。定義される。