Loading article…
オックスフォード英語コーパス(OEC)は、21世紀英語のテキストコーパスであり、オックスフォード英語辞典の作成者とオックスフォード大学出版局の言語研究プログラムによって使用されています。これは、その種のコーパスとしては最大で、約21億語が含まれています。[1] 英国、米国、アイルランド、オーストラリア、ニュージーランド、カリブ海諸国、カナダ、インド、シンガポール、南アフリカの言語が含まれています。[2]テキストは主にWebページから収集されていますが、学術雑誌などの印刷されたテキストは、特定の主題領域を補足するために収集されています。[2]ソースは、「文学小説や専門誌から日常の新聞や雑誌、ハンサードからブログ、電子メール、ソーシャルメディアの言語まで」あらゆる種類の文章です。[2]これは、特定の種類の文章のみをサンプリングする同様のデータベースとは対照的です。コーパスは通常、オックスフォード大学出版局の研究者のみが利用できますが、強い必要性を証明できる他の研究者はアクセスを申請できます。[2] [3]
オックスフォード英語コーパスのデジタル版はXML形式でフォーマットされており、通常はSketch Engineソフトウェアで分析されます。 [4] 2006年4月27日までに、辞書データベースには10億語が収録されました。 [5]
OE コーパス内の各ドキュメントには、次のようなメタデータが付随します。
- タイトル
- 著者(わかっている場合。多くのウェブサイトではこれを確実に判断することが困難です)
- 著者の性別(わかる場合)
- 言語の種類(例:イギリス英語、アメリカ英語)
- ソースウェブサイト
- 年(+日付、わかる場合)
- 収集日
- ドメイン + サブドメイン
- 文書統計(トークン数、文数など)[4]
参照
- 英国国立コーパス
- 現代アメリカ英語コーパス(COCA)
- アメリカ国立コーパス
- 周波数分析
参考文献
- ^ 「The Oxford English Corpus」。Sketch Engine。Lexical Computing CZ sro、2015年6月6日。 2016年10月27日閲覧。
- ^ abcd 「The Oxford English Corpus」。オックスフォード辞書オンライン。オックスフォード大学出版局。2012年1月1日時点のオリジナルよりアーカイブ。 2014年11月8日閲覧。
- ^ 「Compare COCA」。Corpus of Contemporary American English。2014年11月7日時点のオリジナルよりアーカイブ。2014年11月8日閲覧。
- ^ ab The Oxford English Corpus. 2014年2月4日閲覧。
- ^ 「辞書データベースには10億語が収録されている」ノースウェスト・ヘラルド、2006年4月27日、2ページ。 2020年3月15日閲覧– Newspapers.com経由。
