
機械翻訳とは、計算技術を使用して、両方の言語の文脈、慣用表現、実用的なニュアンスを含め、テキストまたは音声をある言語から別の言語に翻訳することです。
初期のアプローチは主にルールベースまたは統計的でした。これらの方法はその後、ニューラル機械翻訳[1]と大規模言語モデル[2]に取って代わられました。
歴史
起源
機械翻訳の起源は、9世紀のアラビアの暗号学者アル・キンディーの研究にまで遡ります。キンディーは、現代の機械翻訳で使用されている暗号解読、頻度分析、確率と統計を含む体系的な言語翻訳の技術を開発しました。 [3]機械翻訳のアイデアは、その後17世紀に登場しました。1629年、ルネ・デカルトは、異なる言語で同等のアイデアを1つの記号で共有する普遍言語を提唱しました。[4]
自然言語の翻訳にデジタルコンピュータを使用するというアイデアは、1947年にイギリスのAD Booth [5]とロックフェラー財団のウォーレン・ウィーバーによって提案されました。「1949年にウォーレン・ウィーバーが書いた覚書は、機械翻訳の初期の頃に出版されたものの中でおそらく最も影響力のあったものです。」[6] [7]他の人もそれに続きました。1954年には、バークベック・カレッジ(ロンドン大学)のAPEXCマシンで英語からフランス語への初歩的な翻訳のデモが行われました。当時、このテーマに関する論文がいくつか出版され、一般誌にも記事が掲載されました (たとえば、1955年9月のWireless Worldに掲載された Cleave と Zacharov の記事)。当時バークベック・カレッジで開拓された同様のアプリケーションは、コンピュータによる 点字テキストの読み取りと作成でした。
1950年代
この分野の最初の研究者であるイェホシュア・バーヒレルは、MIT(1951年)で研究を開始しました。マイケル・ザレチナック教授率いるジョージタウン大学のMT研究チームが(1951年)続き、1954年にはジョージタウン-IBM実験システムの公開デモンストレーションを行いました。MT研究プログラムは日本[8] [9]とロシア(1955年)で始まり、最初のMT会議はロンドン(1956年)で開催されました。[10] [11]
デイビッド・G・ヘイズは「1957年にコンピュータ支援言語処理について執筆し」、「1955年から1968年までランド研究所で計算言語学のプロジェクトリーダーを務めた。」 [12]
1960–1975
研究者たちは引き続きこの分野に加わり、米国では機械翻訳・計算言語学会が設立され(1962年)、全米科学アカデミーは機械翻訳を研究するために自動言語処理諮問委員会(ALPAC)を設立した(1964年)。しかし、実際の進歩ははるかに遅く、10年に及ぶ研究が期待に応えられなかったとALPACの報告書(1966年)が発表された後、資金は大幅に削減された。 [13]国防研究技術局長(DDR&E)による1972年の報告書によると、大規模な機械翻訳の実現可能性は、その紛争中に軍事マニュアルをベトナム語に翻訳する際のLogos MTシステムの成功によって再確立された。
フランス繊維研究所も MT を使用して、フランス語、英語、ドイツ語、スペイン語の要約を翻訳しました (1970 年)。ブリガム ヤング大学は、モルモン教のテキストを自動翻訳で翻訳するプロジェクトを開始しました (1971 年)。
1975年以降
SYSTRANは、 1960年代に「米国政府との契約に基づいてこの分野を開拓した」[14]が、ゼロックス社によって技術マニュアルの翻訳に使用された(1978年)。1980年代後半から、計算能力が向上し、コストが下がるにつれて、機械翻訳の統計モデルへの関心が高まった。MTは、コンピュータの出現後にさらに普及した。[15] SYSTRANの最初の実装システムは、1988年にフランス郵便公社のMinitelと呼ばれるオンラインサービスによって実装された。[16]また、さまざまなコンピュータベースの翻訳会社も設立され、その中には、MTとは異なるが、翻訳メモリ技術(1989年)を開発し販売した最初の企業であるTrados(1984年)も含まれる。ロシア語/英語/ドイツ語-ウクライナ語の最初の商用MTシステムは、ハリコフ国立大学で開発された(1991年)。
1998年までに、「わずか29.95ドルで」PC上で実行できる「英語と主要なヨーロッパ言語の間で一方向に翻訳するプログラム」を購入できるようになりました。[14]
ウェブ上のMTは、SYSTRANが短いテキストの無料翻訳を提供した(1996年)ことから始まり、その後AltaVista Babelfish [14]で提供され、 1日50万件のリクエストが寄せられた(1997年)。[17]ウェブ上の2番目の無料翻訳サービスは、Lernout & HauspieのGlobaLinkだった。[14] Atlantic Magazineは1998年に、「SystranのBabelfishとGlobaLinkのComprende」が「Don't bank on it」を「適切なパフォーマンス」で処理したと書いた。[18]
フランツ・ヨーゼフ・オッホ(後にグーグル翻訳開発部門の責任者となる)は、DARPAのスピードMTコンペティション(2003年)で優勝した。[19]この時期のさらなるイノベーションには、オープンソースの統計的MTエンジンであるMOSES(2007年)、日本の携帯電話向けテキスト/SMS翻訳サービス(2008年)、英語、日本語、中国語の音声翻訳機能を内蔵した携帯電話(2009年)などがある。2012年、グーグルは、Google翻訳が1日でおよそ100万冊の本に相当するテキストを翻訳すると発表しました。
アプローチ
ディープラーニング手法が登場する前は、統計的手法には、形態論的、統語論的、意味論的注釈を伴う多くのルールが必要でした。
ルールベース
ルールベースの機械翻訳アプローチは、主に辞書や文法プログラムの作成に使用されていました。その最大の欠点は、すべてを明示的にする必要があったことです。つまり、綴りのバリエーションや誤った入力をソース言語アナライザーの一部にして対処する必要があり、あいまいなすべてのインスタンスに対して語彙選択ルールを記述する必要がありました。
転送ベースの機械翻訳
転送ベースの機械翻訳は、元の文の意味をシミュレートする中間表現から翻訳を作成するという点で、異言語機械翻訳に似ています。異言語 MT とは異なり、翻訳に関係する言語ペアに部分的に依存します。
インターリンガル
インターリンガル機械翻訳は、ルールベースの機械翻訳アプローチの一例です。このアプローチでは、ソース言語、つまり翻訳対象のテキストが、インターリンガル言語、つまりどの言語にも依存しない「言語中立」表現に変換されます。次に、ターゲット言語がインターリンガルから生成されます。商用レベルで運用された唯一のインターリンガル機械翻訳システムは、Caterpillar Technical English (CTE) を他の言語に翻訳するために設計された KANT システム (Nyberg および Mitamura、1992) でした。
辞書ベース
機械翻訳は辞書のエントリに基づいた方法を使用しており、単語は辞書にそのまま翻訳されています。
統計
統計的機械翻訳は、カナダ議会の英仏記録であるカナダハンサードコーパスや、欧州議会の記録であるEUROPARLなどのバイリンガルテキストコーパスに基づく統計的手法を使用して翻訳を生成しようとした。そのようなコーパスが利用可能であった場合、類似のテキストを翻訳して良好な結果が得られたが、多くの言語ペアではそのようなコーパスはまれであった。最初の統計的機械翻訳ソフトウェアはIBMのCANDIDEであった。2005年、Googleは国連の資料から約2000億語を使用してシステムをトレーニングすることで社内の翻訳機能を改善し、翻訳精度が向上した。[20]
SMT の最大の欠点は、膨大な量の並列テキストに依存していること、形態論が豊富な言語 (特にそのような言語への翻訳) に関する問題、および単一エラーを修正できないことです。
3つ以上の言語に翻訳されたテキストである多言語コーパスの利用に関する研究がいくつか行われています。これらの方法を使用すると、2つ以上の言語に翻訳されたテキストを組み合わせて使用することで、ソース言語の1つだけを単独で使用した場合と比較して、3番目の言語へのより正確な翻訳を提供できます。 [21] [22] [23]
ニューラルMT
ディープラーニングに基づくMTへのアプローチであるニューラル機械翻訳は、近年急速に進歩しています。しかし、現在のコンセンサスでは、達成されたいわゆる人間と同等の精度は、完全に限られたドメイン、言語ペア、および特定のテストベンチマークに基づいているため、現実的ではないと考えられています[24]。つまり、統計的有意性が欠けています。[25]
2022年現在、通常最も優れた機械翻訳結果をもたらすと考えられているDeepL翻訳などのニューラルMTツールによる翻訳には、通常、人間による後編集が必要です。 [26] [27] [28]
並列データセットで特殊な翻訳モデルをトレーニングする代わりに、GPTのような生成大規模言語モデルに直接テキストを翻訳させることもできます。[29] [30] [31]このアプローチは有望であると考えられていますが、[32]専門的な翻訳モデルよりも依然として多くのリソースを必要とします。
問題


人間による評価(プロの文学翻訳者や人間の読者など)を用いた研究では、最新の高度なMT出力に関するさまざまな問題が体系的に特定されています。 [31]一般的な問題には、正しい翻訳には常識的な意味言語処理や文脈が必要となる曖昧な部分の翻訳が含まれます。[31]また、ソーステキストにエラーがあったり、高品質のトレーニングデータが不足している可能性があり、いくつかの種類の問題の頻度の深刻度は、これまで使用されていた技術では軽減されない可能性があり、ある程度の人間の積極的な参加が必要です。
曖昧さ回避
語義の曖昧さ解消は、単語が複数の意味を持つ場合に適切な翻訳を見つけることに関するものです。この問題は、1950年代にイェホシュア・バーヒレルによって初めて提起されました。[33]彼は、「普遍的な百科事典」がなければ、機械は単語の2つの意味を区別することができないだろうと指摘しました。[34]今日、この問題を克服するために設計されたアプローチは数多くあります。それらは、おおよそ「浅い」アプローチと「深い」アプローチに分けることができます。
浅いアプローチはテキストに関する知識を前提としません。曖昧な単語の周囲の単語に統計的手法を適用するだけです。深いアプローチは単語に関する包括的な知識を前提とします。これまでのところ、浅いアプローチの方が成功しています。[35]
国連と世界保健機関で長年翻訳に携わってきたクロード・ピロン氏は、機械翻訳は、最良の場合、翻訳者の仕事のより簡単な部分を自動化するが、より困難で時間のかかる部分には通常、対象言語の文法や語彙の要件を満たすためにソーステキストの曖昧さを解決するための広範な調査が含まれると書いている。
なぜ翻訳者は5ページを翻訳するのに1時間か2時間ではなく丸一日かかるのでしょうか? ..... 平均的なテキストの約90%はこれらの単純な条件に該当します。しかし残念ながら、残りの10%があります。その部分に6時間以上の作業が必要です。解決しなければならない曖昧さがあります。たとえば、原文の著者であるオーストラリア人医師は、第二次世界大戦中に「日本軍捕虜収容所」で宣言された伝染病の例を挙げました。彼は日本軍捕虜のいるアメリカ軍の収容所について話しているのでしょうか、それともアメリカ軍捕虜のいる日本軍の収容所について話しているのでしょうか?英語には2つの意味があります。したがって、オーストラリアに電話をかける程度の調査が必要です。[36]
理想的なディープ アプローチでは、翻訳ソフトウェアがこの種の曖昧さ解消に必要なすべての調査を独自に行う必要がありますが、これには、これまで達成されたレベルよりも高いレベルのAI が必要です。ピロンが言及している曖昧な英語のフレーズの意味を推測するだけの浅いアプローチ (おそらく、特定のコーパスでどの種類の捕虜収容所がより頻繁に言及されているかに基づいて) では、かなり頻繁に間違った推測をする可能性があります。「各曖昧さについてユーザーに尋ねる」という浅いアプローチでは、ピロンの見積もりによると、プロの翻訳者の仕事の約 25% しか自動化されず、より困難な 75% は人間が行う必要があります。
非標準的な話し方
MT の大きな落とし穴の 1 つは、非標準言語を標準言語と同じ精度で翻訳できないことです。ヒューリスティックまたは統計ベースの MT は、言語の標準形式でさまざまなソースからの入力を受け取ります。ルールベースの翻訳は、その性質上、一般的な非標準の使用法を含みません。そのため、方言のソースからの翻訳や口語への翻訳でエラーが発生します。日常会話からの翻訳の制限は、モバイル デバイスでの機械翻訳の使用に問題をもたらします。
名前付きエンティティ
情報抽出において、名前付きエンティティは、狭義では、ジョージ・ワシントン、シカゴ、マイクロソフトなど、固有名詞を持つ人物、組織、会社、場所など、現実世界の具体的または抽象的なエンティティを指します。また、2011 年 7 月 1 日、$500 など、時間、空間、数量の表現も指します。
「スミスはFabrionixの社長です」という文では、スミスとFabrionixは両方とも名前付きエンティティであり、ファーストネームやその他の情報によってさらに限定することができます。「社長」はそうではありません。スミスは以前Fabrionixで副社長などの別の役職に就いていた可能性があるからです。固定指定子という用語は、統計機械翻訳での分析のためにこれらの用法を定義するものです。
名前付きエンティティは、まずテキスト内で識別される必要があります。そうでない場合、誤って一般名詞として翻訳される可能性があります。これは、翻訳のBLEU評価には影響しない可能性が高いですが、テキストの人間による可読性を変えてしまいます。 [37]これらは出力翻訳から省略される可能性があり、これもテキストの可読性とメッセージに影響を与える可能性があります。
音訳には、ソース言語の名前に最も近い文字をターゲット言語で探すことが含まれます。しかし、これは翻訳の品質を低下させることがあると言われています。[38]「Southern California」の場合、最初の単語は直接翻訳し、2番目の単語は音訳する必要があります。機械は、それらを1つのエンティティとして扱うため、両方を音訳することがよくあります。このような単語は、音訳コンポーネントを備えた機械翻訳者にとっても処理が困難です。
「翻訳しない」リストの使用は、翻訳ではなく音訳という同じ最終目標を持っています。[39]は、 依然として名前付きエンティティの正しい識別に依存しています。
3 つ目のアプローチは、クラスベースのモデルです。名前付きエンティティは、その「クラス」を表すトークンに置き換えられます。つまり、「Ted」と「Erica」は両方とも「人」クラスのトークンに置き換えられます。すると、「Ted」と「Erica」の分布を個別に見るのではなく、人名の統計的分布と使用法を一般的に分析できるため、特定の言語での名前の確率が翻訳の割り当て確率に影響することはありません。スタンフォード大学によるこの翻訳分野の改善に関する研究では、トレーニング データでの名前の出現回数が異なるため、ターゲット言語が英語の場合、「David is going for a walk」と「Ankit is going for a walk」に異なる確率が割り当てられる例が示されています。スタンフォード大学による同じ研究 (および名前認識翻訳を改善するためのその他の試み) の残念な結果は、名前付きエンティティ翻訳のメソッドを組み込むと、翻訳のBLEUスコアが低下することがよくあることです。 [39]
アプリケーション
制限のないテキストを完全に自動的に高品質の機械翻訳するという理想を実現するシステムはありませんが、多くの完全に自動化されたシステムは妥当な出力を生み出します。[40] [41] [42]ドメインが制限され制御されている場合、機械翻訳の品質は大幅に向上します。[43]これにより、機械翻訳をツールとして使用して翻訳を高速化し、簡素化できるだけでなく、欠陥があっても有用な低コストまたはアドホックな翻訳を作成することもできます。
旅行
機械翻訳アプリケーションは、携帯電話、ポケット PC、PDA など、ほとんどのモバイル デバイス向けにもリリースされています。このような機器は携帯性に優れているため、モバイル翻訳ツールとして指定されるようになり、異なる言語を話すパートナー間のモバイル ビジネス ネットワーキングを可能にしたり、人間の翻訳者を介さずに外国語の学習や海外旅行を容易にしたりできるようになりました。
例えば、Google翻訳アプリでは、スマートフォンのカメラを使って周囲のテキストを拡張現実で素早く翻訳し、翻訳されたテキストをテキストに重ね合わせることができます。[44]また、音声を認識して翻訳することもできます。[ 45]
行政
機械翻訳プログラムは、その固有の限界にもかかわらず、世界中で使用されています。おそらく最大の機関ユーザーは欧州委員会です。2012年、ルールベースの機械翻訳を新しい統計ベースのMT@ECに置き換えることを目的として、欧州委員会は307万2000ユーロを拠出しました(ISAプログラムを通じて)。[46]
ウィキペディア
機械翻訳はWikipediaの記事の翻訳にも使用されており、特にMT機能が向上するにつれて、将来的には記事の作成、更新、拡張、および一般的な改善においてより大きな役割を果たす可能性があります。編集者が複数の選択された言語間で記事をより簡単に翻訳できるようにする「コンテンツ翻訳ツール」があります。[47] [48] [49]英語の記事は通常、他の言語の翻訳されていない同等の記事よりも包括的で偏りが少ないと考えられています。[50] 2022年現在、英語版Wikipediaには650万を超える記事がありますが、ドイツ語版とスウェーデン語版のWikipediaにはそれぞれ250万を超える記事しかありません。 [51]それぞれははるかに包括的ではありません。
監視と軍事
9.11を含む西側諸国でのテロ攻撃を受けて、米国とその同盟国は アラビア語の機械翻訳プログラムの開発に最も関心を寄せてきたが、パシュトー語とダリー語の翻訳にも関心を寄せてきた。[要出典]これらの言語では、携帯電話アプリの使用を通じた軍人と民間人の間のキーフレーズと迅速なコミュニケーションに焦点が当てられている。[52] DARPAの情報処理技術局は、TIDESやBabylon Translatorなどのプログラムを主催した。米空軍は言語翻訳技術の開発に100万ドルの契約を結んだ。[53]
ソーシャルメディア
近年のウェブ上のソーシャル ネットワーキングの著しい増加により、機械翻訳ソフトウェアを応用する新たなニッチ市場が生まれています。Facebook などのユーティリティや、Skype、Google Talk、MSN Messengerなどのインスタント メッセージングクライアントで、異なる言語を話すユーザー同士がコミュニケーションできるようになりました。
オンラインゲーム
リネージュWは、機械翻訳機能により異なる国のプレイヤー同士がコミュニケーションをとることができるため、日本で人気を博した。[54]
薬
1966年に米国政府が組織した自動言語処理諮問委員会によって、機械翻訳は人間の翻訳に匹敵するものではないと評されたが[55] 、現在では機械翻訳の品質はオンラインコラボレーションや医療分野への応用が検討されるほどに向上している。人間の翻訳者がいない医療現場でのこの技術の応用は別の研究テーマであるが、医療診断における正確な翻訳の重要性から困難が生じている。[56]
研究者は、医療における機械翻訳の使用は誤訳のリスクがあり、それが重大な状況で危険となる可能性があると警告している。[57] [58]機械翻訳は医師が日常業務で患者とコミュニケーションをとることを容易にするが、他に選択肢がない場合にのみ機械翻訳を使用し、翻訳された医療テキストは正確さのために人間の翻訳者によって確認されるべきであると推奨されている。[59] [60]
法
法律用語は、その精密な性質と通常の単語の非定型的な使用のため、機械翻訳ツールにとって大きな課題となります。このため、法律の文脈で使用するための特殊なアルゴリズムが開発されました。[61]機械翻訳による誤訳のリスクがあるため、研究者は機械翻訳の正確さを人間の翻訳者が確認することを推奨しており、一部の裁判所は正式な手続きでの使用を禁止しています。[62]
法律分野での機械翻訳の使用は、翻訳ミスや依頼人の機密保持に関する懸念を引き起こしている。Google翻訳などの無料翻訳ツールを使用する弁護士は、翻訳ツールの提供者に個人情報を漏らすことで、誤って依頼人の機密保持を侵害する可能性がある。[61]さらに、機械翻訳によって得られた警察の捜査への同意は無効であるという議論もあり、これらの議論の正当性については裁判所によって判決が異なる。[57]
古代言語
近年の畳み込みニューラルネットワークの進歩と低リソース機械翻訳(トレーニングに利用できるデータと例が非常に限られている場合)により、アッカド語やその方言であるバビロニア語やアッシリア語などの古代言語の機械翻訳が可能になりました。[63]
評価
機械翻訳システムの評価方法に影響を与える要因は多数あります。これらの要因には、翻訳の用途、機械翻訳ソフトウェアの性質、翻訳プロセスの性質が含まれます。
異なるプログラムが、異なる目的に適する場合があります。たとえば、統計的機械翻訳(SMT)は通常、例に基づく機械翻訳(EBMT)よりも優れていますが、研究者は、英語からフランス語への翻訳を評価すると、EBMTの方が優れていることを発見しました。[64]同じ概念は技術文書にも当てはまり、正式な言語であるため、SMTでより簡単に翻訳できます。
しかし、特定の用途、例えば、管理された言語で書かれた製品の説明などでは、辞書ベースの機械翻訳システムは、品質検査を除いて人間の介入を必要としない満足のいく翻訳を生み出しました。[65]
機械翻訳システムの出力品質を評価する方法は様々です。最も古い方法は、翻訳の品質を評価するために人間の審査員[66]を使用することです。人間による評価は時間がかかりますが、ルールベースや統計システムなどの異なるシステムを比較するには、依然として最も信頼性の高い方法です。[67] 自動化された評価手段には、BLEU、NIST、METEOR、LEPORなどがあります。[68]
編集されていない機械翻訳だけに頼ることは、人間の言語によるコミュニケーションは文脈に埋め込まれており、元のテキストの文脈を相当な確率で理解するには人間が必要であるという事実を無視している。純粋に人間が生成した翻訳でさえ間違いが起こりやすいのは確かである。したがって、機械生成翻訳が人間にとって有用であり、出版可能な品質の翻訳が達成されることを保証するためには、そのような翻訳は人間によってレビューされ、編集されなければならない。[69]故クロード・ピロンは、機械翻訳は、最良の場合、翻訳者の仕事のより簡単な部分を自動化するが、より困難で時間のかかる部分は通常、ターゲット言語の文法と語彙の緊急性によって解決される必要があるソーステキストの曖昧さを解決するために広範な調査を行うことを伴うと書いている。そのような調査は、出力が無意味にならないように機械翻訳ソフトウェアに入力を提供するために必要な事前編集の必要な前奏曲である。[70]
曖昧さ解消の問題に加えて、機械翻訳プログラムのトレーニングデータのレベルが異なるために精度が低下する可能性があります。例文ベースと統計的機械翻訳はどちらも、翻訳の基礎として実際の例文を大量に使用しており、分析される文が多すぎたり少なすぎたりすると精度が低下します。研究者は、プログラムを203,529の文の組み合わせでトレーニングすると、精度が実際に低下することを発見しました。[64]トレーニングデータの最適なレベルは100,000文を少し超える程度であると思われますが、これはトレーニングデータが増えると、考えられる文の数が増え、正確な翻訳の一致を見つけるのが難しくなるためと考えられます。
機械翻訳の欠陥は、その娯楽性から注目されている。2017年4月にYouTubeに投稿された2本の動画では、ひらがなの「えぐ」という文字がGoogle翻訳に繰り返し貼り付けられ、その結果生じた翻訳はすぐに「DECEARING EGG」や「Deep-sea squeeze trees」などの意味不明なフレーズに劣化し、ますます不条理な声で読み上げられるという内容だった。[71] [72]動画のフルバージョンは、2022年3月現在で690万回再生されている。[73][アップデート]
機械翻訳と手話
2000年代初頭、音声言語と手話の間の機械翻訳の選択肢は非常に限られていました。聴覚障害者は従来の翻訳機を使用できるというのが一般的な考えでした。しかし、音声言語と手話では、ストレス、イントネーション、ピッチ、タイミングの伝達方法が大きく異なります。そのため、聴覚障害者は音声言語に基づいた文章の意味を誤解したり混乱したりする可能性があります。[74]
研究者の Zhao ら (2000) は、英語からアメリカ手話(ASL) への翻訳を完了する TEAM (英語から ASL への機械翻訳) と呼ばれるプロトタイプを開発した。このプログラムは、まず英語のテキストの統語的、文法的、形態的側面を分析します。このステップに続いて、プログラムは ASL の辞書として機能する手話合成装置にアクセスします。この合成装置には、ASL 手話を完了するために必要なプロセスと、手話の意味が格納されています。テキスト全体が分析され、翻訳を完了するために必要な手話が合成装置に配置されるやいなや、コンピューターで生成された人間が現れ、ASL を使用して英語のテキストをユーザーに手話で伝えます。[74]
著作権
著作権保護の対象となるのはオリジナルの作品のみであるため、機械翻訳は創造性を伴わないため、機械翻訳の結果は著作権保護の対象にならないと主張する学者もいる。[75]問題となっている著作権は派生作品に関するものであり、元の言語でのオリジナル作品の著者は、作品が翻訳されても権利を失うことはない。翻訳者は翻訳を出版する許可を得なければならない。 [要出典]
参照
- AI完全
- キャッシュ言語モデル
- 機械翻訳アプリケーションの比較
- さまざまな機械翻訳アプローチの比較
- 計算言語学
- コンピュータ支援翻訳と翻訳メモリ
- 機械翻訳における制御言語
- 制御された自然言語
- 外国語ライティング支援
- あいまい一致(コンピュータ支援翻訳)
- 機械翻訳の歴史
- 人間の言語技術
- 翻訳におけるユーモア(「ハウラーズ」)
- 言語とコミュニケーション技術
- 言語の壁
- 新興技術のリスト
- 機械翻訳研究機関一覧
- モバイル翻訳
- ニューラル機械翻訳
- オープンロゴス
- フレーズ作成者
- 投稿編集
- 疑似翻訳
- 往復翻訳
- 統計的機械翻訳
- 翻訳 § 機械翻訳
- 翻訳メモリ
- ULTRA(機械翻訳システム)
- ユニバーサルネットワーキング言語
- ユニバーサル翻訳機
注記
- ^ 「Google Translate がディープラーニングによるアップグレードを実現」IEEE Spectrum 2016年10月3日。 2024年7月7日閲覧。
- ^ 「Google Translate vs. ChatGPT: どちらが最高の言語翻訳者か?」PCMag UK 2024年2月23日2024年7月7日閲覧。
- ^ DuPont, Quinn (2018年1月). 「機械翻訳の暗号学的起源:アル・キンディーからウィーバーまで」. Amodern . 2019年8月14日時点のオリジナルよりアーカイブ。2019年9月2日閲覧。
- ^ ノウルソン、ジェームズ(1975年)。『1600-1800年のイギリスとフランスにおける普遍言語体系』トロント:トロント大学出版局。ISBN 0-8020-5296-7。
- ^ Booth, Andrew D. (1953 年 5 月 1 日)。「機械翻訳」。Computers and Automation 1953-05: Vol 2 Iss 4。Berkeley Enterprises。6 ページ。
- ^ J. Hutchins ( 2000)。「Warren Weaver と MT の立ち上げ」。機械翻訳の初期(PDF)。言語科学史研究。第 97 巻。p. 17。doi :10.1075/sihols.97.05hut。ISBN 978-90-272-4586-1. S2CID 163460375. 2020年2月28日時点のオリジナル(PDF)よりアーカイブ– Semantic Scholar経由。
- ^ “ウォーレン・ウィーバー、アメリカの数学者”. 2020年7月13日. 2021年3月6日時点のオリジナルよりアーカイブ。 2020年8月7日閲覧。
- ^ 上野、俊夫 (1986 年 8 月 13 日).パーソナルコンピュータによる機械翻訳プログラムの制作。東京:(株)ラッセル社。 p. 16.ISBN 494762700X
この機械は1962年頃は中学1年の教科書で90点以上の能力に達したと報告されて
いる(翻訳 (Google 翻訳
による支援): 1959 年の日本では、独立行政法人産業技術総合研究所 (AIST) が適切な英日翻訳機「ヤマト」をテストし、1964 年にその出力レベルに達したと報告されました。中学1年生の教科書90点以上)
- ^ “機械翻訳専用機「やまと」 - コンピュータ博物館”. 2016 年 10 月 19 日のオリジナルからアーカイブ。2017 年4 月 4 日に取得。
- ^ Nye, Mary Jo (2016). 「Speaking in Tongues: Science's century-long hunt for a common language」. Distillations . 2 (1): 40– 43. 2020年8月3日時点のオリジナルよりアーカイブ。 2018年3月20日閲覧。
- ^ ゴーディン、マイケル・D. (2015)。『科学のバベル:グローバル英語以前と以後の科学のやり方』シカゴ、イリノイ州:シカゴ大学出版局。ISBN 9780226000299。
- ^ Wolfgang Saxon (1995年7月28日). 「コンピュータによる言語研究の開発者、66歳のデイビッド・G・ヘイズ」ニューヨーク・タイムズ。2020年2月7日時点のオリジナルよりアーカイブ。 2020年8月7日閲覧。
1957年には早くもコンピュータ支援言語処理について執筆。1955年から1968年までランド研究所で計算言語学のプロジェクトリーダーを務めた。
- ^ 上野、俊夫 (1986 年 8 月 13 日).パーソナルコンピュータによる機械翻訳プログラムの制作。東京:(株)ラッセル社。 p. 16.ISBN 494762700X。
- ^ abcd Budiansky, Stephen (1998年12月). 「Lost in Translation」.アトランティック誌. pp. 81– 84.
- ^ シャンク、ロジャー C. (2014).概念的な情報処理。ニューヨーク:エルゼビア。 p. 5.ISBN 9781483258799。
- ^ ファーウェル、デイビッド、ガーバー、ローリー、ホヴィ、エドゥアルド (2003 年 6 月 29 日)。機械翻訳と情報スープ: アメリカ機械翻訳協会第 3 回会議、AMTA'98、ラングホーン、ペンシルバニア州、米国、1998 年 10 月 28 ~ 31 日議事録。ベルリン: シュプリンガー。p. 276。ISBN 3540652590。
- ^ Barron, Brenda (2019年11月18日). 「Babel Fish: What Happened To The Original Translation Application?: We Investigate」. Digital.com . 2019年11月20日時点のオリジナルよりアーカイブ。 2019年11月22日閲覧。
- ^ 他の例も挙げた
- ^ Chan, Sin-Wai (2015). Routledge Encyclopedia of Translation Technology . オックスフォード: Routledge. p. 385. ISBN 9780415524841。
- ^ 「Google Translator: The Universal Language」。Blog.outer-court.com。2007年1月25日。2008年11月20日時点のオリジナルよりアーカイブ。2012年6月12日閲覧。
- ^ Schwartz, Lane (2008). マルチソース翻訳手法(PDF)。アメリカ機械翻訳協会第8回隔年会議で発表された論文。2016年6月29日時点のオリジナルよりアーカイブ(PDF) 。 2017年11月3日閲覧。
- ^ Cohn, Trevor; Lapata, Mirella (2007). 三角測量による機械翻訳: 多重並列コーパスの有効利用(PDF)。2007年6月23~30日、チェコ共和国プラハで開催された計算言語学会第45回年次会議で発表された論文。2015年10月10日時点のオリジナルよりアーカイブ(PDF) 。2015年2月3日閲覧。
- ^ Nakov , Preslav ; Ng, Hwee Tou ( 2012). 「関連するリソースが豊富な言語を使用したリソースの少ない言語の統計的機械翻訳の改善」。人工知能研究ジャーナル。44 : 179–222。arXiv : 1401.6876。doi : 10.1613/jair.3540。
- ^ Antonio Toral、Sheila Castilho、Ke Hu、Andy Way。2018。「達成不可能なことを達成する?ニューラル機械翻訳における人間と同等の能力の主張を再評価する」CoRR、abs/1808.10432。
- ^ イヴェット・グラハム、バリー・ハドウ、コーエン・フィリップ(2019)。「機械翻訳評価における翻訳語」。arXiv : 1906.09833 [ cs.CL]。
- ^ Katsnelson, Alla (2022年8月29日). 「英語力が低い?新しいAIが研究者の文章力向上を支援」. Nature . 609 (7925): 208– 209. Bibcode :2022Natur.609..208K. doi : 10.1038/d41586-022-02767-9 . PMID 36038730. S2CID 251931306.
- ^ Korab, Petr (2022年2月18日). 「DeepL: 並外れて素晴らしい言語翻訳者」. Medium . 2023年1月9日閲覧。
- ^ 「DeepLがGoogle翻訳を上回る – DW – 2018年12月5日」。Deutsche Welle 。 2023年1月9日閲覧。
- ^ Hendy, Amr; Abdelrehim, Mohamed; Sharaf, Amr; Raunak, Vikas; Gabr, Mohamed; Matsushita, Hitokazu; Kim, Young Jin; Afify, Mohamed; Awadalla, Hany (2023年2月18日)。「機械翻訳におけるGPTモデルの有効性はどの程度か?包括的な評価」。arXiv : 2302.09210 [ cs.CL ]。
- ^ Fadelli, Ingrid. 「研究はAIによる文学翻訳の品質を人間による翻訳と比較することで評価する」techxplore.com 。 2022年12月18日閲覧。
- ^ abc Thai, Katherine; Karpinska, Marzena; Krishna, Kalpesh; Ray, Bill; Inghilleri, Moira; Wieting, John; Iyyer, Mohit (2022年10月25日). 「世界文学からの並列段落を使用した文書レベルの文学機械翻訳の探索」. arXiv : 2210.14250 [cs.CL].
- ^ Kocmi, Tom; Avramidis, Eleftherios; Bawden, Rachel; Bojar, Ondřej; Dvorkovich, Anton; Federmann, Christian; Fishel, Mark; Freitag, Markus; Gowda, Thamme; Grundkiewicz, Roman; Haddow, Barry; Koehn, Philipp; Marie, Benjamin; Monz, Christof; Morishita, Makoto (2023). Koehn, Philipp; Haddow, Barry; Kocmi, Tom; Monz, Christof (編著). 2023 年機械翻訳会議 (WMT23) の調査結果: LLM は到来しているが、まだそこまでには至っていない。第 8 回機械翻訳会議の議事録。シンガポール: 計算言語学協会。 pp. 1– 42. doi : 10.18653/v1/2023.wmt-1.1 .
- ^ 機械翻訳のマイルストーン - 第6回:Bar-HillelとFAHQTの実現不可能性 2007年3月12日、Wayback MachineにJohn Hutchinsによってアーカイブ
- ^ Bar-Hillel (1960)、「言語の自動翻訳」。http://www.mt-archive.info/Bar-Hillel-1960.pdf でオンラインで入手可能。Wayback Machineで 2011 年 9 月 28 日にアーカイブ。
- ^ 機械翻訳へのハイブリッド アプローチ。コスタ・ジュサ、マルタ R.、ラップ、ラインハルト、ランバート、パトリック、エベル、カート、バンチ、ラファエル E.、ベイビーチ、ボグダン。スイス。 2016 年 7 月 21 日。ISBN 9783319213101. OCLC 953581497.
{{cite book}}: CS1 メンテナンス: 場所が不明な発行元 (リンク) CS1 メンテナンス: その他 (リンク) - ^ クロード・ピロン、Le défi des langues (The Language Challenge)、パリ、ラルマッタン、1994 年。
- ^ Babych, Bogdan; Hartley, Anthony (2003). 自動固有表現抽出による機械翻訳品質の向上(PDF) 。第 7 回 MT およびその他の言語技術ツールに関する国際 EAMT ワークショップで発表された論文... 2006 年 5 月 14 日のオリジナル(PDF)からアーカイブ。2013 年11 月 4 日に閲覧。
- ^ Hermajakob, U., Knight, K., & Hal, D. (2008). 統計的機械翻訳学習における名前の翻訳: 翻字するタイミング Archived 4 January 2018 at the Wayback Machine . Association for Computational Linguistics. 389–397.
- ^ ab Neeraj Agrawal; Ankush Singla。固有表現認識を使用した機械翻訳の改善(PDF) 。 2013年5月21日時点のオリジナルよりアーカイブ(PDF) 。2013年11月4日閲覧。
- ^ メルビー、アラン。言語の可能性(アムステルダム:ベンジャミンズ、1995年、27-41)。ベンジャミンズドットコム。1995年。ISBN 9789027216144. 2011年5月25日時点のオリジナルよりアーカイブ。2012年6月12日閲覧。
- ^ Wooten, Adam (2006年2月14日). 「翻訳技術の概要を示すシンプルなモデル」T&I Business。 2012年7月16日時点のオリジナルよりアーカイブ。 2012年6月12日閲覧。
- ^ 「付録III『言語の自動翻訳の現状』、Advances in Computers、vol.1(1960年)、p.158-163。Y.Bar-Hillel:Language and information(Reading、Mass.:Addison-Wesley、1964年)、p.174-179に再掲載」(PDF) 。 2018年9月28日時点のオリジナル(PDF)からアーカイブ。2012年6月12日閲覧。
- ^ 「Ta with youによる人間品質の機械翻訳ソリューション」 (スペイン語)。Tauyou.com。2009年4月15日。2009年9月22日時点のオリジナルよりアーカイブ。2012年6月12日閲覧。
- ^ 「Google Translate が拡張現実アプリに 20 言語を追加」。ポピュラーサイエンス。2015 年 7 月 30 日。2023年1 月 9 日閲覧。
- ^ ホイットニー、ランス。「Google翻訳アプリのアップデートにより、音声テキスト変換がさらに簡単に」CNET 。 2023年1月9日閲覧。
- ^ 「機械翻訳サービス」。2011年8月5日。2013年9月8日時点のオリジナルよりアーカイブ。2013年9月13日閲覧。
- ^ ウィルソン、カイル(2019年5月8日)。「WikipediaにはGoogle翻訳の問題がある」The Verge 。 2023年1月9日閲覧。
- ^ 「Wikipedia が Google を活用して編集者の記事翻訳を支援」VentureBeat 2019 年 1 月 9 日。2023年1 月 9 日閲覧。
- ^ 「コンテンツ翻訳ツールが50万件以上のWikipedia記事の作成を支援」Wikimedia Foundation 2019年9月23日2023年1月10日閲覧。
- ^ Magazine、Undark(2021年8月12日)。「Wikipediaには言語の問題がある。それを修正する方法は次のとおりです」。Undark Magazine 。 2023年1月9日閲覧。
- ^ "ウィキペディアのリスト - メタ".メタ.ウィキメディア.org 。2023 年1 月 9 日に取得。
- ^ Gallafent, Alex (2011年4月26日). 「軍隊のための機械翻訳」. PRI's the World . 2013年5月9日時点のオリジナルよりアーカイブ。 2013年9月17日閲覧。
- ^ Jackson, William (2003年9月9日). 「GCN – 空軍はユニバーサル翻訳機の構築を望んでいる」Gcn.com。2011年6月16日時点のオリジナルよりアーカイブ。2012年6月12日閲覧。
- ^ ユン・ヨンシル(2023年6月26日)「厳しい日本のゲーム市場で韓国ゲームの人気が高まっている」BusinessKorea 。 2023年8月8日閲覧。
- ^ 自動言語処理諮問委員会、行動科学部門、米国科学アカデミー、米国研究会議 (1966)。言語と機械: 翻訳と言語学におけるコンピューター(PDF) (レポート)。ワシントン DC: 米国科学アカデミー、米国研究会議。2013年 10 月 21 日時点のオリジナルよりアーカイブ(PDF) 。2013 年10 月 21 日閲覧。
{{cite report}}: CS1 maint: 複数の名前: 著者リスト (リンク) - ^ Randhawa, Gurdeeshpal; Ferreyra, Mariella; Ahmed, Rukhsana; Ezzat, Omar; Pottie, Kevin (2013年4月). 「臨床診療における機械翻訳の使用」. Canadian Family Physician . 59 (4): 382– 383. PMC 3625087 . PMID 23585608. 2013年5月4日時点のオリジナルよりアーカイブ。 2013年10月21日閲覧。
- ^ ab Vieira, Lucas Nunes; O'Hagan, Minako; O'Sullivan, Carol (2021年8月18日). 「機械翻訳の社会的影響を理解する:医療および法律のユースケースに関する文献の批判的レビュー」.情報、コミュニケーション、社会. 24 (11): 1515– 1532. doi : 10.1080/1369118X.2020.1776370 . hdl : 1983/29727bd1-a1ae-4600-9e8e-018f11ec75fb . ISSN 1369-118X. S2CID 225694304.
- ^ Khoong, Elaine C.; Steinbrook, Eric; Brown, Cortlyn; Fernandez, Alicia (2019年4月1日). 「救急科退院指示書のスペイン語および中国語翻訳におけるGoogle翻訳の使用評価」. JAMA内科. 179 (4): 580– 582. doi :10.1001/jamainternmed.2018.7653. ISSN 2168-6106. PMC 6450297 . PMID 30801626.
- ^ Piccoli, Vanessa (2022年7月5日). 「医療相談における多言語主義、マルチモダリティ、機械翻訳:ケーススタディ」.翻訳・通訳研究. 17 (1): 42– 65. doi :10.1075/tis.21012.pic. ISSN 1932-2798. S2CID 246780731.
- ^ Herrera-Espejel, Paula Sofia; Rach, Stefan (2023年11月20日). 「疫学と公衆衛生におけるアウトリーチと健康コミュニケーションのための機械翻訳の使用:スコープレビュー」. JMIR Public Health and Surveillance . 9 : e50814. doi : 10.2196/50814 . ISSN 2369-2960. PMC 10696499 . PMID 37983078.
- ^ ab legalj (2023年1月2日). 「人間対機械:機械翻訳の社会的・法的影響」.プリンストン法律ジャーナル. 2023年12月4日閲覧。
- ^ Chavez, Edward L. (2008). 「ニューメキシコ州における非英語圏陪審員の成功」Journal of Court Innovation . 1 : 303.
- ^ Gutherz, Gai; Gordin, Shai; Sáenz, Luis; Levy, Omer; Berant, Jonathan (2023年5月2日). Kearns, Michael (編). 「ニューラル機械翻訳によるアッカド語から英語への翻訳」. PNAS Nexus . 2 (5): pgad096. doi :10.1093/pnasnexus/pgad096. ISSN 2752-6542. PMC 10153418. PMID 37143863 .
- ^ ab Way, Andy; Nano Gough (2005年9月20日). 「例に基づく機械翻訳と統計的機械翻訳の比較」.自然言語工学. 11 (3): 295– 309. doi :10.1017/S1351324905003888 (2024年11月1日非アクティブ). S2CID 3242163.
{{cite journal}}: CS1 メンテナンス: DOI は 2024 年 11 月時点で非アクティブです (リンク) - ^ Muegge (2006)、「制限付きテキストの完全自動高品質機械翻訳: ケーススタディ」、Wayback Machineに 2011 年 10 月 17 日にアーカイブ、Translating and the computer 28。2006 年 11 月 16 ~ 17 日にロンドンで開催された第 28 回国際翻訳およびコンピュータ会議の議事録、ロンドン: Aslib。ISBN 978-0-85142-483-5。
- ^ 「人間による評価によるMTシステムの比較、2008年5月」。 Morphologic.hu。 2012年4月19日時点のオリジナルよりアーカイブ。2012年6月12日閲覧。
- ^ Anderson, DD (1995). 機械翻訳は第二言語学習のツールである Archived 4 January 2018 at the Wayback Machine . CALICO Journal. 13(1). 68–96.
- ^ Han et al. (2012)、「LEPOR: 拡張因子による機械翻訳の堅牢な評価指標」、 Wayback Machineに 2018 年 1 月 4 日にアーカイブ、Proceedings of the 24th International Conference on Computational Linguistics (COLING 2012): Posters、ページ 441–450、ムンバイ、インド。
- ^ JM コーエンは次のように述べています (p.14): 「科学的翻訳は、すべての活動を 技術に還元しようとする時代の目標です。しかし、知識、読解力、識別力を備えた人間の脳自体よりも複雑でない文学翻訳マシンを想像することは不可能です。」
- ^ 2001年以降に毎年実施されているNISTテストを参照。2009年3月22日アーカイブ、Wayback MachineおよびBilingual Evaluation Understudy
- ^ アバディ、マーク。「Google翻訳が完全に失敗した4回」。Business Insider。
- ^ “回数を重ねるほど狂っていく Google翻訳で「えぐ」を英語訳すると不思議世界に迷い込むと話題に”.ねとらぼ。
- ^ “えぐ”。 2017 年 4 月 12 日 – www.youtube.com 経由。
- ^ ab Zhao, L., Kipper, K., Schuler, W., Vogler, C., & Palmer, M. (2000). 英語からアメリカ手話への機械翻訳システム Archived 20 July 2018 at the Wayback Machine . Lecture Notes in Computer Science, 1934: 54–67.
- ^ 「機械翻訳:結果に著作権はない?」SEO Translator、Zimbabwe Independentを引用。2012年11月29日時点のオリジナルよりアーカイブ。2012年11月24日閲覧。
さらに読む
- コーエン、JM(1986)、「翻訳」、アメリカ百科事典、第27巻、 12〜15ページ
- ハッチンズ、W. ジョン、サマーズ、ハロルド L. (1992)。機械翻訳入門。ロンドン: アカデミック プレス。ISBN 0-12-362830-X。
- ルイス・クラウス、ギデオン(2015年6月7日)。「Tower of Babble」。ニューヨーク・タイムズ・マガジン。pp.48-52 。
- ウェーバー、スティーブン; メハンドル、ニキータ( 2022)。「2020年代の機械翻訳の政治経済学」。ビジネスと政治。24 ( 1 ): 96– 112。arXiv : 2011.01007。doi :10.1017/bap.2021.17。S2CID 226236853 。
外部リンク
- 機械翻訳のメリットとデメリット
- 国際機械翻訳協会 (IAMT) 2010年6月24日アーカイブ、Wayback Machine
- 機械翻訳アーカイブ 2019年4月1日にジョン・ハッチンズによってウェイバックマシンにアーカイブされました。機械翻訳とコンピューターベースの翻訳技術の分野における記事、書籍、論文の電子リポジトリ(および書誌)
- 機械翻訳(コンピュータベースの翻訳) - ジョン・ハッチンズの出版物(機械翻訳に関するいくつかの書籍のPDFが含まれています)
- 機械翻訳と少数言語
- ジョン・ハッチンス 1999 2007年9月7日アーカイブウェイバックマシン
- Slator 機械翻訳の最新動向に関するニュースと分析
- 教室から現実世界へ: 機械翻訳が外国語学習の状況をどう変えるか
