タトエバのロゴ | |
サイトの種類 | オンライン対訳コーパス |
|---|---|
| 利用可能 | インターフェースの言語は56、コンテンツは422言語(2024年2月) |
| 原産国 | フランス |
| 所有者 | タトエバ協会 |
| 創設者 | トランホー |
| 主要人物 | アラン・サイモン |
| メールアドレス | タトエバ |
| コマーシャル | いいえ |
| 登録 | オプション |
| 発売 | 2006 |
| 現在の状況 | オンライン |
コンテンツライセンス | CC BY(一部の文章はCC0)、音声は異なります |
Tatoeba は、外国語学習者向けの翻訳付き例文集です。400以上の言語で利用できます。名前は「例えば」を意味する日本語の「例えば」に由来しています。オープンコラボレーションモデルを通じて、ボランティアのコミュニティによって作成および管理されています。個々の貢献者は「Tatoebans」と呼ばれます。寄付金で運営されているフランスの非営利団体Association Tatoeba によって運営されています。
歴史と発展
2006年、トラン・ホーは、日本語の辞書と異なり、ドイツ語のバイリンガル辞書には翻訳付きの使用例の全文検索機能がないことに不満を感じていました。 [1]それがきっかけで、彼女は理想の辞書を思い描き、 [2]「multilangdict」という名前でSourceForgeにホストされているプロトタイプを作成しました。 [3]主な焦点はすでに翻訳文のクラウドソーシングでした。「Wikipediaのようなものですが、記事ではなく文を追加します。」
コンピエーニュ工科大学で学業を続ける傍ら、トラン・ホーは数人のクラスメートとともにウェブサイトを徐々に改良していった。彼女はプロジェクトを2度ゼロから再構築し、Tatoebaとしてブランド名を変更した。2007年9月、田中コーパス(兵庫大学教授田中康人氏が2001年に公開し、ジム・ブリーン氏とポール・ブレイ氏が保守管理していたパブリックドメインの集成)から約15万の英日文ペアがTatoebaコーパスにインポートされた。[4] 2008年12月、トラン・ホーはより柔軟なデータモデルに基づいて構築された現在のコードベースの最初のバージョンをリリースした。[5]翌月、ウェブサイトはtatoeba.orgドメインに移行した。[6]
2009年から2010年にかけて、当時SUPINFOの学生だったアラン・サイモンがTatoebaのコア開発者となった。彼らはトラン・ホーや他の若い開発者とともに、文章リスト、ユーザープロフィール、プライベートメッセージ、Facebook風のウォールなど、Tatoebaをよりソーシャルなものにした。また、文章のリンク、タグ付け、「翻訳の翻訳」検索などの重要な機能も導入した。2010年11月、Tatoebaの文章数は60万を超え、1年以内に毎日追加される文章の数はほぼ50倍に増加した。[7]
2014年から2016年にかけて、Trang Hoを中心に新しい開発者チームが結成されました。[8]彼らはGoogle Summer of Code 2014 で学生を指導し[9]、コーパスの品質を向上させる機能を追加しました。
2018年から2020年にかけて、Common Voiceプロジェクトの一環としてMozilla Foundationから支援を受け、Tatoebaはプラットフォームをよりオープンでユーザーフレンドリーなものにすることができました。[10] [11]
オープンさ
使用
ユーザーは単語を検索して、その単語が使われている文章を検索することができます。結果は言語、単語数、タグ、その他の基準でフィルタリングできます。[12]
各文は、その翻訳と「翻訳の翻訳」の横に表示されます。コメント セクションでは、フィードバックや修正が簡単に行えます。
登録ユーザーは、非公開、公開、または共同でダウンロード可能な文章リストを作成できます。
貢献
Tatoebansは、最も得意な言語で貢献することが奨励されています。[13]オリジナルの文章を追加したり、既存の文章を翻訳したりできます。他のユーザーの文章を校正したりコメントしたり、所有者のいない文章を「採用」したりできます。上級貢献者は、文章にタグを付けたり、リンクしたり、リンクを解除したりすることもできます。
文の所有者が修正要求に応答しない場合は、コーパス管理者のみが文を更新または削除する権限を持ちます。
ガバナンス
Tatoeba の創設者である Trang Ho 氏は、長年にわたり同プロジェクトのBDFLを務めてきました。
2011年、彼女はこのプロジェクトを監督するために非営利団体を設立した。
2022年、彼女は経験を積んだタトエバンスの小グループに譲ることを決めました。[14]
言語
2024年2月現在、タトエバコーパスには422の言語で11,900,000以上の文が収録されています。これらの言語のうち59の言語には10,000以上の文があります。100万以上の文に音声録音があります。[15]
文章は23,700,000以上のリンクを持つグラフ内で相互に関連しています。253の言語ペアには10,000以上の翻訳された文章があります。 [16]
手術
Tatoebaは2010年12月にMozilla Drumbeatから助成金を受けた。 [18] [19]
Tatoebaのインフラストラクチャに関する一部の作業は、2014年版のGoogle Summer of Codeによって後援されました。[9]
2018年5月に彼らは25,000ドルのMozillaオープンソースサポート(MOSS)プログラム助成金を受け取った。[10]
2019年8月、彼らは15,000ドルのMozillaオープンソースサポート(MOSS)プログラム助成金を受け取った。[11]
コンテンツへのアクセス
ライセンス
デフォルトでは、Tatoeba Corpusの文章はCC BYライセンスの下で公開されており、[20]学術的およびその他の用途に自由に使用できます。ユーザーはCC0の下で文章を投稿することもできますが、それらの文章の翻訳は現在同じライセンスを共有できません。[21]
文章の音声録音には、CC BY、CC BY-SA、CC BY-NC、またはパブリックライセンスなしなど、話者が選択したライセンスが使用されています。[22]
オフライン使用
訪問者は、 Tatoebaのウェブサイトから、Ankiや同様の間隔反復ソフトウェアにインポートできるタブ区切りの文章ペアをダウンロードすることができます。 [16]
ソフトウェア開発ツール
ソフトウェア開発者向けに不安定なAPIが利用可能である。[23]
関連プロジェクト
第二言語習得
Tatoebaの文章は、言語学習者のための辞書参照を作成するために使用できます。JMdict日本語-英語辞書は、Tatoebaコーパスから例文を選択しています。[24] OpenRussianは、主にWiktionaryとTatoebaのコンテンツから構築された無料のロシア語辞書です。[25] GoodExampleは、英語のTatoebaコーパスから高品質の例文の多様なセットを自動的に抽出しようとします。[26]
Tatoebaデータセットは、外国語の習得と、ウェブ閲覧や読書などのユーザーの日常的な活動を組み合わせた偶発的な学習体験を促進することができます。 [27] [28] MITメディアラボのチームは、Tatoebaの例文をWordSenseで使用しました。WordSenseは、「自然の中での偶然の言語学習」を可能にする複合現実プラットフォームです。 [29]最近では、日本の研究者が統合されたライティング支援環境にTatoebaの検索機能を実装しました。[30]
Tatoebaコーパスの文章はすべてが本物というわけではないが、データ駆動型の学習アプリケーションの構築に使用されることがある。BES(Basic English Sentence)Searchは、教材に使用するための初級レベルの英語の文章を見つけるための非商用ツールである。[31] 100万以上の文章が含まれており、そのほとんどはTatoebaからのものである。[32] Reversoは、商用のバイリンガルコンコーダンスエンジンでTatoebaの並列コーパスを使用している。[33]
例文は練習問題の基礎としても使われています。日本のEFL教師であるチャールズ・ケリーとポール・レインは、タトエバ・コーパスから集めた文章をもとに言語学習アクティビティを開発しました。 [34] [35]クローズマスターは、タトエバの文章ペアからゲーム化されたクローズテストを生成する言語自習プログラムです。[36]一部のAnkiユーザーは、タトエバを使用して作成されたフラッシュカードを共有しています。[37]
地域言語または少数言語
一部の言語デジタル活動家は、デジタル空間で少数言語を宣伝するために、Tatoeba、Wikipedia、Common Voiceなどのオープンな共同プロジェクトに貢献しています。 [38]カビル語、カタロニア語、バスク語などの地域言語では、100人以上のメンバーがTatoebaに登録されています。[39]
人工言語
Tatoebaのエスペラント語版から厳選されたコンテンツは、E@Iが発行する多言語DVD 「Esperanto Elektronike」でご覧いただけます。 [40] 2022年11月現在、エスペラント語はTatoebaの5番目の中心言語であり、33万以上の文章が少なくとも2つの言語に翻訳されています。[16]トキポナ語、インターリングア、クリンゴン語、ロジバン語、イド語などの他の人工言語も大きな足跡を残しています。[15]
言語技術

フランシス・ボンドは2008年から2011年にかけて、日本語の研究にタトエバコーパスを使用した。[42] [43]
2013年以来、イェルク・ティーデマンはOPUSリポジトリで共有し、「Tatoeba翻訳チャレンジ」を主催することで、機械翻訳コミュニティでTatoebaの対訳コーパスをより広く普及させてきました。 [44] [45]ディープラーニングの台頭により、研究者は機械翻訳、[46]言語識別、[47]意味検索、[48]音声認識などのタスクで、超多言語モデルのトレーニングと評価にTatoebaのデータセットを使用することが増えています。[49]
参照
参考文献
- ^ Trang. 「タトエバの物語」 。 2022年11月8日閲覧。
- ^ 「Trang's ideal dictionary.pdf」。Google Docs 。 2022年11月8日閲覧。
- ^ 「Trangの辞書プロジェクト」. sourceforge.net . 2013年4月10日.
- ^ 「Tanaka Corpus」。EDRDG Wiki。電子辞書研究開発グループ。2011年2月3日。 2011年3月20日閲覧。
- ^ Tatoeba Stream #3 - Going back in time、2021年11月29日、 2022年11月8日閲覧。
- ^ Trang. 「新しいアドレス:tatoeba.org」 。 2022年11月8日閲覧。
- ^ Trang. 「いくつかの統計」 。 2022年11月8日閲覧。
- ^ AlanF. 「開発の最新情報」 。 2022年11月8日閲覧。
- ^ ab 「Google Summer of Code 2014 Organization Association Tatoeba」。www.google-melange.com 。 2022年9月26日閲覧。
- ^ ab 「TatoebaがMOSS賞を受賞」。2022年9月26日閲覧。
- ^ ab 「第2回MOSS賞」。2022年9月26日閲覧。
- ^ 「詳細検索 - Tatoeba」. tatoeba.org . 2023年11月21日閲覧。
- ^ 「クイックスタートガイド」。
- ^ “スレッド #38883 - Tatoeba”. tatoeba.org . 2023年11月21日閲覧。
- ^ ab 「言語ごとの文数 - Tatoeba」. tatoeba.org . 2022年11月1日閲覧。
- ^ abc 「文章をダウンロード - Tatoeba」. tatoeba.org . 2022年11月1日閲覧。
- ^ Tatoeba の週間エクスポート
- ^ Ho, Trang (2011 年 1 月 17 日). 「Mozilla Drumbeat からの助成金」. Tatoeba プロジェクト ブログ. 2011 年3 月 20 日閲覧。
- ^ Moltke, Henrik (2010 年 12 月 30 日). 「ベスト ドラムビート プロジェクト: Tatoeba – 無料でオープンな文章データベース」. Yoyodyne.cc . 2011 年 1 月 2 日時点のオリジナルよりアーカイブ。2011年3 月 20 日閲覧。...
Mozilla Foundation は、2,500 米ドルの Mozilla Drumbeat 助成金を提供することで、Tatoeba プロジェクトを奨励し、支援したいと考えています。
- ^ 「利用規約」. Tatoeba.org . 2011年3月20日閲覧。
- ^ 「CC0で貢献する方法」en.wiki.tatoeba.org . 2021年10月25日閲覧。
- ^ 「「audio」を含むすべての公開リスト(140) - Tatoeba」。tatoeba.org 。2021年10月25日閲覧。
- ^ 「タトエバ API」. api.dev.tatoeba.org 。2023 年11 月 21 日に取得。
- ^ 「WWWJDIC - INFORMATION」www.edrdg.org . 2022年11月13日閲覧。
- ^ 「OpenRussianについて」 en.openrussian.org . 2022年11月16日閲覧。
- ^ 「法的考慮事項 - GoodExample」www.goodexample.is 。 2022年12月6日閲覧。
- ^ Winiwarter, Werner (2015 年 12 月 11 日)。「JILL」。情報統合と Web ベースのアプリケーションおよびサービスに関する第 17 回国際会議の議事録。iiWAS '15。米国ニューヨーク州ニューヨーク: Association for Computing Machinery。pp. 1–9。doi : 10.1145 / 2837185.2837191。ISBN 978-1-4503-3491-4. S2CID 2130581。
- ^ “Lisons!”. fauu.github.io . 2022年12月2日閲覧。
- ^ バスケス、クリスチャン・デイヴィッド;ニャティ、アフィカ・アヤンダ。ルー、アレクサンダー。ふー、ミーガン。相川貴子メイス、パティ(2017年5月6日)。 「複合現実における偶然の言語学習」。2017 CHI Conference の議事録、コンピューティング システムにおけるヒューマン ファクターに関する拡張要約。チーエア'17。米国ニューヨーク州ニューヨーク州: コンピューティング機械協会。 2172–2179ページ。土井:10.1145/3027063.3053098。ISBN 978-1-4503-4656-6.S2CID 1557887 。
- ^ 萩原 正人、伊藤 匠、栗林 樹、鈴木 淳、乾 健太郎。2019。TEASPN: 統合ライティング支援環境のフレームワークとプロトコル。2019年自然言語処理における経験的手法に関する会議および第 9 回自然言語処理に関する国際合同会議 (EMNLP-IJCNLP): システムデモンストレーションの議事録、229~234 ページ、香港、中国。計算言語学会。
- ^ 「BES Search」. bessearch.ddl-study.org . 2023年6月14日閲覧。
- ^ 西垣千恵子・赤瀬川誠. 中学生:自律的なコーパスユーザーを育てるために何ができるか?
- ^ 「Reverso Context | 文脈辞書で使用されるコーパスに関する法的考慮事項」context.reverso.net 。 2022年12月2日閲覧。
- ^ チャールズ・ケリー (2012). 「タトエバ・プロジェクト・コーパスを使った www.ManyThings.org の語学教材」(PDF)、愛知工業大学研究報告 (47)、77-84。
- ^ Raine, Paul (2018). 「Web 2.0とTatoebaデータベースを使用した文の構築」(PDF) . Accents Asia .
- ^ 「クローズテストとは何か?クローズ削除テストと言語学習」。Clozemaster ブログ。2017 年 10 月 17 日。
- ^ “Tatoeba - AnkiWeb”. ankiweb.net . 2022年12月2日閲覧。
- ^ 「Rising Voices - インド出身のサンタリ語デジタル活動家、プラサンタ・ヘムブラム氏に会う」Rising Voices 2022年6月28日。 2022年11月15日閲覧。
- ^ 「メンバーの言語 - Tatoeba」. tatoeba.org . 2022年11月15日閲覧。
- ^ “エスペラント語 Elektronike | E@I”. 2017 年 10 月 13 日。2022 年11 月 1 日に取得。
- ^ 「Google Scholar」. scholar.google.com . 2022年11月13日閲覧。
- ^ フランシス・ボンド、栗林孝行 [栗林貴行]、橋本力 [橋本力] (2008) HPSG に基づくフリーな日本語ツリーバンクの構築 [A free Japanese Treebank based on HPSG]。言語処理学会第14回年次大会にて、東京。
- ^ Eric Nichols、Francis Bond、Darren Scott Appling、Yuji Matsumoto (2010)「統計的機械翻訳のためのトレーニングデータの言い換え」自然言語処理ジャーナル、17(3)、101~122ページ。
- ^ “OPUS - オープンソースの並列コーパス”. 2013年7月30日. 2013年7月30日時点のオリジナルよりアーカイブ。 2022年11月13日閲覧。
- ^ Tiedemann, Jörg (2020年10月13日). 「Tatoeba翻訳チャレンジ - 低リソースおよび多言語MT向けの現実的なデータセット」. arXiv : 2010.06354 [cs.CL].
- ^ NLLB チーム; Costa-jussà, Marta R.; Cross, James; Çelebi, Onur; Elbayad, Maha; Heafield, Kenneth; Heffernan, Kevin; Kalbassi, Elahe; Lam, Janice; Licht, Daniel; Maillard, Jean; Sun, Anna; Wang, Skyler; Wenzek, Guillaume; Youngblood, Al (2022 年 8 月 25 日)。「取り残される言語はない: 人間中心の機械翻訳のスケーリング」。arXiv : 2207.04672 [ cs.CL]。
- ^ 「言語識別 · fastText」. fasttext.cc . 2022年11月16日閲覧。
- ^ Hu, Junjie; Ruder, Sebastian; Siddhant, Aditya; Neubig, Graham; Firat, Orhan; Johnson, Melvin (2020年9月4日)。「XTREME: 言語間一般化を評価するための大規模多言語マルチタスクベンチマーク」。arXiv : 2003.11080 [ cs.CL]。
- ^ ワン、チャンハン;ピノ、フアン。ウー、アン。顧佳涛(2020年6月9日)。 「CoVoST: 多様な多言語音声からテキストへの翻訳コーパス」。arXiv : 2002.01320 [cs.CL]。
外部リンク
- 公式サイト
- MozFest 2019でTatoebaを紹介するTrang Hoのビデオ
- Tatoebaの統計
- タトエバ翻訳チャレンジ
