モビー・プロジェクトは、グラディ・ウォードによって作成されたパブリックドメインの語彙リソースのコレクションです。これらのリソースはパブリックドメインに提供され、現在はプロジェクト・グーテンベルクにミラーリングされています。2007年現在これには、177,267語とその対応する発音を含む、最大の無料音声データベースが含まれています。[ 1 ]
Moby Hyphenator IIには、187,175 の単語とフレーズのハイフネーションが収録されています( throughやavoirのようにハイフネーションが指定されていないエントリ 9,752 個を含む)。文字エンコーディングはMacRomanのようで、ハイフネーションは箇条書き記号 ( ⟨ • ⟩ 、文字値 165 (10 進数)、または A5 (16 進数)) で示されます。ただし、一部のエントリには、" bar•ber-sur•geon "のように、実際のハイフンと文字値 165 が組み合わされています。
ハイフネーションの選択に関する文書はほとんど、あるいは全くありません。以下の例は、使用されているハイフネーションのスタイルをある程度示しているかもしれません: at•mos•phere; at•tend•ant; ca•pac•i•ty; un•col•or•a•ble。
Moby Language IIには、フランス語、ドイツ語、イタリア語、日本語、スペイン語の5つの言語の単語リストが含まれています。それぞれの統計情報は以下のとおりです。
しかし、リストの中には不適切なものも含まれている。例えば、日本語のリストには「abnormal」のような英単語や、 「abcdefgh」や「m,./」のような非単語が含まれている。また、これらのリストの並び順にも特異な点があり、フランス語のリストはアルファベット順に並べられているのに対し、ドイツ語のリストは、伝統的に大文字で始まる単語のアルファベット順リストと、伝統的に小文字で始まる単語のアルファベット順リストが交互に並んでいる。一方、イタリア語のリストには、大文字で始まる単語は一切含まれていない。
これらのリストではアクセント付き文字は使用されないため、フランス語の単語être(「~である」)を検索するには、 「 e^tre 」のように入力します。
Moby Part-of-Speechには、品詞別に完全に記述された233,356語が収録されており、品詞は優先順位順にリストされています。ファイル形式はword\parts-of-speechで、以下の品詞が識別されています。
Moby Pronunciator IIには、対応する発音を含む 177,267 件のエントリが含まれています。エントリのほとんどは単語を説明していますが、約 79,000 件[ 2 ]には、ハイフン付きまたは複数の単語のフレーズ、名前、または語彙素が含まれています。Project Gutenberg の配布には、 cmudict v0.3のコピーも含まれています。このファイルには、単語[/品詞] 発音の形式の行が含まれています。各行は、ASCIIキャリッジリターン文字 (CR、'\r'、0x0D、10 進数で 13) で終わります。
単語フィールドには、アポストロフィ(例:isn't)、ハイフン(例:able-bodied)、アンダースコアで区切られた複数の単語(例:monkey_wrench)を含めることができます。ドキュメントに記載されているとおり、英語以外の単語は一般的にアクセント記号やその他の発音記号なしで表示されます。ただし、36のエントリ(例:São_Miguel )では、 Mac OS Romanエンコーディングを使用して表現された、ASCII以外のアクセント付き文字が残っています。
品詞フィールドは、品詞によって発音が異なる770の単語を区別するために使用されます。たとえば、closeと綴られる単語の場合、動詞の発音は/ˈkloʊz /ですが、形容詞の発音は/ˈkloʊs/です。品詞には次のコードが割り当てられています。
以下に発音を示します。いくつかの特殊記号が含まれています。
残りの記号は、IPA文字を表すために使用されます。発音は、一般的に、 father-bother の融合、hurry-furry の融合、lot-cloth の分裂が見られるものの、 cot-caught の融合やwine-whine の融合が見られない、一般的なアメリカ英語の方言と一致しています。各音素は、1 つ以上の文字のシーケンスで表されます。シーケンスの一部は、次の表に示すように、スラッシュ文字「/」で区切られていますが、/ ɔɪ /のシーケンスは、両端に2 つのスラッシュ文字で区切られていることに注意してください。
このコレクションには、他のいくつかの言語に見られる音素を表す追加のシーケンスがいくつか追加されています。これらは、データベースに含まれる英語以外の単語、フレーズ、名前をエンコードするために使用されます。以下の表にはこれらの追加音素が記載されていますが、これらの音素の一部がエンコードエラーによって生じたものである可能性は不明であることに注意してください。
Moby Shakespeareにはシェイクスピアの全作品が収録されています。この特定の資料はプロジェクト・グーテンベルクでは入手できませんが、1993年版がウェブ上で入手可能です。[ 3 ]
Moby Thesaurus IIには、30,260の語根と、2,520,264の同義語および関連語が収録されています。これは、語根1つあたり平均83.3の同義語と関連語がある計算になります。各行はカンマで区切られた値のリストで構成され、最初の語が語根、それに続く語はすべて関連語です。
Grady Ward は1996 年にこのシソーラスをパブリックドメインにしました。Debianパッケージとしても利用可能ですが、 Bullseye以降はパッケージの提供が終了しています。[ 4 ]
Moby Words IIは世界最大の単語リストです。[ 1 ]配布ファイルは以下の16個のファイルで構成されています。
Words:61万語以上の単語とフレーズ。世界最大の単語リスト。