単語リストとは、一般的に出現頻度順に並べられた語彙集の単語リストです(段階別、または順位付けされたリストとして)。単語リストは、特定のテキストコーパス内の語彙頻度分析によって作成され、コーパス言語学において言語やテキストの系譜や進化を調査するために使用されます。コーパス内で一度しか出現しない単語は、ハパックス・レゴメナと呼ばれます。教育学では、単語リストは語彙習得のためのカリキュラム設計に使用されます。頻度順に並べられた語彙集は、「学習者が語彙学習の努力に対して最良の成果を得られるようにするための合理的な根拠を提供する」(Nation 1997 )ものですが、主にコース作成者向けであり、学習者向けではありません。頻度リストは、一般的な単語が漏れていないことを確認するためのチェックリストのような役割を果たす、辞書編纂の目的でも作成されます。主な落とし穴としては、コーパスの内容、コーパスのレジスター、そして「単語」の定義などが挙げられます。単語数のカウントは千年も前から行われており、20世紀半ばには膨大な量の分析が手作業で行われていましたが、映画の字幕(SUBTLEXメガスタディ)などの大規模コーパスの自然言語による電子処理によって、この研究分野は急速に発展しました。
計算言語学において、頻度リストとは、単語(単語の種類)とその頻度をソートしたリストであり、ここでいう頻度とは通常、特定のコーパスにおける出現回数を意味し、そこからリスト内の位置として順位が導き出される。
ネイション(Nation 1997)は、コンピューターの能力がコーパス分析をはるかに容易にする上で非常に役立つことを指摘した。彼は、頻度リストの作成に影響を与えるいくつかの重要な問題点を挙げた。

現在入手可能な研究のほとんどは、入手しやすく処理しやすい書き言葉のコーパスに基づいている。
しかし、New et al. 2007 は、オンラインで入手可能な多数の字幕を利用して多数のスピーチを分析することを提案した。Brysbaert & New 2009 は、従来のテキスト分析アプローチを長々と批判的に評価し、スピーチ分析とオンラインで入手可能な映画字幕の分析への移行を支持した。最初の研究は、さまざまな言語の貴重な頻度カウント分析を提供するいくつかの追跡研究につながった。 [ 1 ] SUBTLEX による詳細な研究[ 2 ]は、フランス語 ( New et al. 2007 )、アメリカ英語 ( Brysbaert & New 2009 ; Brysbaert, New & Keuleers 2012 )、オランダ語 ( Keuleers & New 2010 )、中国語 ( Cai & Brysbaert 2010 )、スペイン語 ( Cuetos et al. 2011 ) 、ギリシャ語 ( Dimitropoulou et al. 2010 ) 、ベトナム語 ( Pham, Bolger & Baayen 2011 )、ドイツ語 ( Brysbaert et al. 2011 harvnb error: no target: CITEREFBrysbaertBuchmeierConradJacobs,_Bölte_ & _Böhl2011 ( help ) )、ブラジルポルトガル語 ( Tang 2012 )、ポルトガルポルトガル語 ( Soares ) について、クリーンアップされたオープン字幕に対して行われた。 (et al. 2015)、アルバニア語(Avdyli & Cuetos 2013)、ポーランド語(Mandera et al. 2014)、カタルーニャ語(2019 [ 3 ])、ウェールズ語(Van Veuhen et al. 2024 [ 4 ])、韓国語。[ 5 ] SUBTLEX-IT(2015)は生データのみを提供します。[ 6 ]
いずれにせよ、基本的な「単語」単位を定義する必要があります。ラテン文字の場合、単語は通常、スペースまたは句読点で区切られた1つまたは複数の文字で構成されます。しかし、例外もあります 。英語の「can't」やフランス語の「aujourd'hui」には句読点が含まれていますが、フランス語の「chateau d'eau」は、構成要素の単純な加算とは異なる概念を表し、スペースを含んでいます。また、語族の単語を基本語の表現の下にグループ化する方が望ましい場合もあります。したがって、possible、impossible、possibilityは同じ語族の単語であり、基本語*possib*で表されます。統計目的では、これらの単語はすべて基本語*possib*の下にまとめられ、概念と形式の出現頻度をランク付けすることができます。さらに、他の言語では特有の困難が生じる場合があります。中国語は単語間にスペースを使用しないため、特定の複数の文字の連鎖が、単一文字の単語の句または複数の文字の単語として解釈される可能性があります。
ジップの法則は、あらゆる自然言語の長文テキストから抽出された頻度リストにも当てはまるようです。頻度リストは電子辞書を作成する際に有用なツールであり、電子辞書は計算言語学における幅広い応用分野の前提条件となります。
ドイツの言語学者がHäufigkeitsklasse (頻度クラス)を定義リスト内の各項目の出現頻度を、その項目の出現頻度と最も頻繁に出現する項目の出現頻度の比の底が2の対数を用いて算出します。最も頻繁に出現する項目は出現頻度クラス0(ゼロ)に属し、その約半分の頻度の項目はクラス1に属します。上記の例では、スペルミスのある単語「outragious」の出現頻度は76/3789654で、クラス16に属します。
どこは床関数です。
頻度リストは、意味ネットワークとともに、意味圧縮のプロセスにおいて上位語に置き換えるべき、最も使用頻度の低い専門用語を特定するために使用されます。
これらのリストは生徒に直接渡すことを意図したものではなく、教師や教科書の著者のためのガイドラインとして機能することを意図したものです(Nation 1997)。ポール・ネイションの現代語教育の要約では、まず「高頻度語彙と特殊な目的の(テーマ別)語彙から低頻度語彙へと進み、次に学習者に自律的な語彙拡張を維持するための戦略を教える」ことを推奨しています(Nation 2006)。
単語頻度はさまざまな効果をもたらすことが知られています ( Brysbaert et al. 2011 harvnb error: no target: CITEREFBrysbaertBuchmeierConradJacobs,_Bölte_ & _Böhl2011 ( help ) ; Rudell 1993 )。記憶は単語頻度が高いほどプラスの影響を受けますが、これは学習者がより多くの単語に触れる機会が増えるためと考えられます ( Laufer 1997 )。語彙へのアクセスは単語頻度が高いほどプラスの影響を受け、この現象は単語頻度効果と呼ばれています( Segui et al. )。単語頻度の効果は、単語を学習した年齢である習得年齢の効果と関連しています。
以下に、利用可能なリソースの概要を示します。
単語数のカウントは古代の分野であり、ヘレニズム時代にまで遡る議論が知られています。1944年、エドワード・ソーンダイク、アーヴィン・ロージらは、現代のコンピュータがそのようなプロジェクトをはるかに容易にする以前に、18,000,000の連続した単語を手作業でカウントして、最初の大規模な英語の頻度リストを作成しました(Nation 1997 ) 。20世紀の作品はすべて、その古さゆえに問題があります。特に、「blog」のようなテクノロジーに関連する単語は、2014年には現代アメリカ英語コーパスで頻度7665位でしたが、1999年に初めて確認され、これらの3つのリストのいずれにも登場しません。
New & Pallierによるレビューが行われた。1950 年代から 60 年代にかけてFrançais fondamentalで試みが行われた。これには、1,500 の高頻度語を含む FF1 リスト、後に 1,700 の中頻度語を含む FF2 リスト、および最もよく使用される構文規則が含まれる。[ 14 ] 70 の文法語がコミュニケーション文の 50% を構成し、[ 15 ] [ 16 ] 3,680 語で約 95〜98% をカバーしていると主張されている。[ 17 ] 3,000 の頻出語のリストが利用可能である。[ 18 ]
フランス教育省は、語彙学者エティエンヌ・ブリュネが作成した、最も頻繁に使用される1,500の語族のランキングリストも提供している。[ 19 ]ジャン・ボードは、アメリカのブラウン研究をモデルにした「現代フランス語における単語の使用頻度」というタイトルの研究を行った。[ 20 ]
さらに最近では、 Lexique3プロジェクトが、正書法、音声、音節、品詞、性、ソースコーパスでの出現回数、頻度順位、関連する語彙素などを含む142,000のフランス語の単語を、オープンライセンスCC-by-sa-4.0の下で提供しています。[ 21 ]
このLexique3は、前述のSubtlex運動の起源となった継続的な研究である。Newら(2007)は、オンライン映画の字幕に基づいて全く新しい計数を行った。
スペイン語の単語頻度に関する研究はいくつか行われている(Cuetos et al. 2011)。[ 22 ]
中国語コーパスは、長い間、頻度リストの観点から研究されてきました。中国語の語彙を学ぶ歴史的な方法は、文字の頻度に基づいています(Allanic 2003)。アメリカの中国学者ジョン・デフランシスは、著書『ジョニーが中国語を読めない理由』(DeFrancis 1966 )の中で、外国語としての中国語の学習と教授におけるその重要性について述べています。頻度ツールキットとして、Da(Da 1998)と台湾教育部(TME 1997)は、文字と単語の頻度ランクを含む大規模なデータベースを提供しています。中華人民共和国の8,848の高頻度および中頻度の単語のHSKリストと、中華民国(台湾)の約8,600の一般的な繁体字中国語の単語のTOPリストは、一般的な中国語の単語と文字を示す他の2つのリストです。SUBTLEX運動に続いて、Cai & Brysbaert 2010は最近、中国語の単語と文字の頻度に関する豊富な研究を行いました。
Wiktionaryには、より多くの言語の頻度リストが含まれています。[ 23 ]
Wikipediaまたは複数のコーパスを組み合わせたものに基づいて、さまざまな言語で最も頻繁に使用される単語。[ 24 ]
{{cite journal}}:ジャーナルを引用するには|journal=(ヘルプ){{citation}}: CS1 maint: 場所の発行元が見つかりません (リンク)。{{citation}}: CS1 maint: 複数の名前: 著者リスト (リンク){{citation}}: CS1メンテナンス: DOIは2025年7月現在非アクティブです(リンク)