機械学習(ML )は、人工知能の研究分野の一つで、データから学習し 、未知のデータにも一般化できる統計アルゴリズムの開発と研究に関係しており、明示的にプログラムすることなくタスクを実行できます。[ 1 ]深層学習分野の進歩により、統計アルゴリズムの一種であるニューラルネットワークは、これまでの多くの機械学習アプローチを性能面で凌駕するようになりました。
統計学と数学的最適化手法は、機械学習の基礎を構成します。データマイニングは、教師なし学習による探索的データ分析(EDA)に焦点を当てた関連分野です。[ 3 ] [ 4 ]
理論的な観点から言えば、おそらく近似的に正しい学習は、機械学習を記述するための数学的および統計的な枠組みを提供する。従来の機械学習および深層学習アルゴリズムのほとんどは、この枠組みの下で経験的リスク最小化として記述できる。
機械学習という用語は、 IBMの従業員であり、コンピュータゲームと人工知能の分野の先駆者であるアーサー・サミュエルによって1959年に造語されました。[ 5 ] [ 6 ]同義語である自己学習型コンピュータもこの時期に使用されていました。[ 7 ] [ 8 ]
最も初期の機械学習プログラムは1950年代に登場し、サミュエルがチェッカーで各プレイヤーが勝つ確率を計算するコンピュータプログラムを発明しましたが、機械学習の歴史は人間の認知プロセスを研究するための数十年にわたる努力に根ざしています。 [ 9 ] 1949年、カナダの心理学者ドナルド・ヘッブは、神経細胞間の特定の相互作用によって形成される理論的な神経構造を紹介した著書『行動の組織化』を出版しました。[ 10 ]ニューロンの相互作用に関するヘッブ理論は、接続された人工ニューロンがデータに基づいて接続の強度を変化させるという、多くの機械学習アルゴリズムの仕組みの基礎を築きました。 [ 9 ]人間の認知システムを研究した他の研究者も、人間の思考プロセスを反映するアルゴリズムを含むニューラルネットワークの最初の数学モデルを提案したウォルター・ピッツやウォーレン・マカロックなど、現代の機械学習技術に貢献しました 。[ 9 ]
1960年代初頭までに、レイセオン社は、基本的な強化学習を使用してソナー信号、心電図、音声パターンを分析するために、パンチテープメモリを備えた実験的な「学習マシン」であるサイバートロンを開発しました。これは、人間のオペレーター/教師によってパターンを認識するように繰り返し「訓練」され、誤った決定を再評価させる「間違い」ボタンが装備されていました。 [ 11 ] 1960年代の機械学習の研究に関する代表的な書籍は、主にパターン分類のための機械学習を扱ったニルス・ニルソンの著書「学習マシン」です。[ 12 ]パターン認識に関する関心は、1973 年に Duda と Hart が述べたように、1970 年代まで続いた。[ 13 ] 1981 年に、人工ニューラルネットワークがコンピュータ端末から 40 文字 (26 文字、10 桁の数字、4 種類の特殊記号) を認識するように学習するための教育戦略の使用に関する報告がなされた。[ 14 ]
トム・M・ミッチェルは、機械学習分野で研究されているアルゴリズムについて、広く引用されているより形式的な定義を提供しました。「コンピュータプログラムは、あるタスクのクラスTとパフォーマンス指標Pに関して、経験Eから学習していると言われるのは、 Pによって測定されるT内のタスクにおけるパフォーマンスが、経験Eによって向上する場合である。」[ 15 ]機械学習が関心を持つタスクのこの定義は、認知的な観点からこの分野を定義するのではなく、根本的に操作的なものです。これは、アラン・チューリングが論文「計算機械と知能」で提案した内容に倣ったもので、その論文では、「機械は考えることができるか?」という問いが、機械が人間が投げかけた質問に対する人間の反応を説得力をもって模倣できるかどうかという問いに置き換えられています。 [ 16 ] [ 17 ]
2014年、イアン・グッドフェローらは、現実的な合成データを生成できる敵対的生成ネットワーク(GAN)を導入した。 [ 18 ] 2016年までに、AlphaGoは強化学習技術を用いて囲碁のトッププレイヤーに勝利した。[ 19 ]

科学的な取り組みとして、機械学習は人工知能(AI)の探求から生まれた。AIが学問分野として確立された初期の頃、一部の研究者は機械がデータから学習することに関心を持っていた。彼らは様々な記号的手法や、当時「ニューラルネットワーク」と呼ばれていたものを用いてこの問題に取り組もうとした。これらは主にパーセプトロンやその他のモデルであり、後に統計学の一般化線形モデルの再発明であることが判明した。[ 21 ]確率的推論も、特に自動医療診断において用いられた。[ 22 ] : 488
しかし、論理的で知識ベースのアプローチへの重点が高まったことで、AIと機械学習の間に亀裂が生じた。確率システムは、データ取得と表現の理論的および実際的な問題に悩まされた。[ 22 ]: 488 1980年までに、エキスパートシステムがAIを支配するようになり、統計学は不人気になった。[ 23 ]記号的/知識ベースの学習に関する研究はAI内で継続され、帰納的論理プログラミング(ILP)につながったが、より統計的な研究の流れは、パターン認識と情報検索の分野で、本来のAIの領域から外れた。[ 22 ]: 708-710、755ニューラルネットワークの研究は、ほぼ同時期にAIとコンピュータサイエンスによって放棄された。このサブフィールドは「コネクショニズム」と呼ばれ、ジョン・ホップフィールド、デイビッド・ルーメルハート、ジェフリー・ヒントンなどの他の分野の研究者によって継続された。彼らの主な成功は、1980年代半ばにバックプロパゲーションの再発明によってもたらされた。[ 22 ] : 25
機械学習(ML)は、再編成され、独自の分野として認識されるようになり、1990年代に隆盛を極めました。この分野は、人工知能の実現から、実用的な性質を持つ解決可能な問題に取り組むことへと目標を変えました。AIから受け継いだ記号的なアプローチから、統計学、ファジー論理、確率論から借用した手法やモデルへと焦点を移しました。[ 23 ]
機械学習と圧縮には密接な関係があります。シーケンスの全履歴に基づいてそのシーケンスの事後確率を予測するシステムは、最適なデータ圧縮に使用できます(出力分布に算術符号化を使用することによって)。逆に、最適な圧縮器は予測に使用できます(過去の履歴に基づいて最も圧縮率の高いシンボルを見つけることによって)。この等価性は、データ圧縮を「汎用知能」のベンチマークとして使用することの正当化として使用されてきました。[ 24 ] [ 25 ] [ 26 ]
別の見方では、圧縮アルゴリズムは暗黙的に文字列を暗黙的特徴空間ベクトルにマッピングし、圧縮ベースの類似度尺度はこれらの特徴空間内で類似度を計算すると説明できます。各圧縮器 C(.) に対して、関連するベクトル空間 ℵ を定義します。これは、C(.) が入力文字列 x をベクトルノルム ||~x|| に対応するようにマッピングします。すべての圧縮アルゴリズムの基となる特徴空間を網羅的に調べることはスペースの制約により不可能です。代わりに、特徴ベクトルでは、代表的な 3 つの可逆圧縮方法、LZW、LZ77、および PPM を調査することを選択します。[ 27 ]
AIXI理論によれば(この理論は『Hutter Prize』でより直接的に説明されている)、xの最適な圧縮とは、xを生成するソフトウェアの最小サイズである。例えば、このモデルでは、zipファイルの圧縮サイズにはzipファイル自体と解凍ソフトウェアの両方が含まれる。なぜなら、両方がなければ解凍できないからである。しかし、さらに小さい組み合わせ形式が存在する可能性もある。
AI を活用したオーディオ/ビデオ圧縮ソフトウェアの例としては、NVIDIA Maxine、AIVC などがあります。[ 28 ] AI を活用した画像圧縮を実行できるソフトウェアの例としては、OpenCV、TensorFlow、MATLABの Image Processing Toolbox (IPT)、High-Fidelity Generative Image Compression などがあります。[ 29 ]
教師なし機械学習では、k-meansクラスタリングは、類似したデータポイントをクラスタにグループ化することでデータを圧縮するために利用できます。この手法は、事前定義されたラベルのない大規模なデータセットの処理を簡素化し、画像圧縮などの分野で広く使用されています。[ 30 ]
データ圧縮は、データファイルのサイズを縮小し、ストレージ効率を高め、データ転送を高速化することを目的としています。教師なし機械学習アルゴリズムであるK平均クラスタリングは、データセットを指定された数のクラスタkに分割するために使用され、各クラスタは、その点の重心によって表されます。このプロセスにより、膨大なデータセットがよりコンパクトな代表点のセットに圧縮されます。特に画像処理や信号処理において有益なK平均クラスタリングは、データ点のグループをその重心に置き換えることでデータ削減を支援し、元のデータのコア情報を保持しながら、必要なストレージスペースを大幅に削減します。[ 31 ]
大規模言語モデル(LLM) は、DeepMindの Chinchilla 70B モデルによる研究で実証されているように、一部のデータセットでは効率的なロスレス データ圧縮器でもあります。DeepMind が開発した Chinchilla 70B は、画像をPortable Network Graphics (PNG) や音声をFree Lossless Audio Codec (FLAC) などの従来の方法よりも効果的にデータを圧縮しました。画像データと音声データをそれぞれ元のサイズの 43.4% と 16.4% に圧縮することに成功しました。ただし、テストに使用したデータセットが LLM のトレーニング データセットと重複しているため、Chinchilla 70B モデルは既にトレーニング済みのデータに対してのみ効率的な圧縮ツールである可能性があるという懸念があります。[ 32 ] [ 33 ]
機械学習とデータマイニングは、同じ手法を用いることが多く、大きく重複していますが、機械学習が訓練データから学習した既知の特性に基づく予測に焦点を当てているのに対し、データマイニングはデータ内のこれまで知られていなかった特性の発見に焦点を当てています(これはデータベースにおける知識発見の分析ステップです)。データマイニングは多くの機械学習手法を用いますが、それぞれ異なる目的を持っています。一方、機械学習も「教師なし学習」として、あるいは学習器の精度を向上させるための前処理ステップとして、データマイニング手法を用います。これら2つの研究コミュニティ間の混乱の多くは、両者が依拠する基本的な仮定に起因しています。機械学習では、通常、既知の知識を再現する能力に関してパフォーマンスが評価されますが、知識発見とデータマイニング(KDD)では、これまで知られていなかった知識の発見が重要なタスクです。既知の知識に関して評価すると、情報を持たない(教師なし)手法は、他の教師あり手法に容易に劣りますが、典型的なKDDタスクでは、訓練データが利用できないため、教師あり手法を使用することはできません。
機械学習は最適化とも密接な関係があります。多くの学習問題は、訓練例セットにおける何らかの損失関数の最小化として定式化されます。損失関数は、訓練中のモデルの予測と実際の問題インスタンスとの間の不一致を表します(たとえば、分類では、インスタンスにラベルを割り当てたい場合、モデルは一連の例の事前割り当てられたラベルを正しく予測するように訓練されます)。[ 34 ]
様々な学習アルゴリズムの汎化能力を特徴づけることは、特に深層学習アルゴリズムにおいて、現在活発に研究されているテーマである。
機械学習と統計学は方法論の面では密接に関連しているが、主な目標は異なっている。統計学は標本から母集団推論を行うのに対し、機械学習は一般化可能な予測パターンを見つける。[ 35 ]
従来の統計分析では、研究データセットに最も適したモデルを事前に選択する必要があります。さらに、過去の経験に基づいて、有意または理論的に関連する変数のみが分析に含まれます。対照的に、機械学習は事前に構造化されたモデルに基づいて構築されるのではなく、データが潜在的なパターンを検出することによってモデルを形成します。モデルのトレーニングに使用される変数(入力)が多いほど、最終的なモデルの精度が高くなります。[ 36 ]
レオ・ブライマンは、データモデルとアルゴリズムモデルという2つの統計モデリングパラダイムを区別しました[ 37 ]。ここで「アルゴリズムモデル」とは、ランダムフォレストのような機械学習アルゴリズムをほぼ意味します。
統計学者の中には、機械学習の手法を取り入れ、統計的学習という分野を生み出した者もいる。[ 38 ]
無秩序系の根源的な物理学から派生した解析的および計算的手法は、機械学習を含む大規模な問題に拡張することができ、例えば、深層ニューラルネットワークの重み空間を分析することができる。[ 39 ]統計物理学は、このようにして医療診断の分野で応用されている。[ 40 ]
学習者の中核的な目標は、経験から一般化することです。[ 2 ] [ 41 ]この文脈における一般化とは、学習データセットを経験した後、学習機械が新しい未知の例/タスクを正確に実行できる能力のことです。トレーニング例は、一般的に未知の確率分布(発生空間を代表するものと考えられる)から得られ、学習者はこの空間に関する一般的なモデルを構築し、新しいケースで十分に正確な予測を生成できるようにする必要があります。
機械学習アルゴリズムとその性能の計算分析は、計算学習理論として知られる理論計算機科学の一分野です。主要なフレームワークの1つは、おそらく近似的に正しい学習モデルです。訓練データセットは有限であり、将来は不確実であるため、学習理論は通常、アルゴリズムの性能を保証するものではありません。その代わりに、性能の確率的限界がよく用いられます。バイアス・バリアンス分解は、汎化誤差を定量化する1つの方法です。
汎化の文脈で最高のパフォーマンスを得るには、仮説の複雑さがデータの根底にある関数の複雑さと一致する必要があります。仮説が関数よりも単純である場合、モデルはデータに適合しきれていません。それに応じてモデルの複雑さが増加すると、トレーニングエラーが減少します。しかし、仮説が複雑すぎると、モデルは過学習を起こし、汎化性能が低下します。[ 42 ]
学習理論家は、性能限界に加えて、学習の時間計算量と実現可能性についても研究します。計算学習理論では、計算が多項式時間で実行できる場合、その計算は実現可能であるとみなされます。時間計算量の結果には2種類あります。肯定的な結果は、特定のクラスの関数が多項式時間で学習できることを示します。否定的な結果は、特定のクラスの関数は多項式時間で学習できないことを示します。

機械学習のアプローチは、学習システムに利用可能な「信号」または「フィードバック」の性質に応じて、学習パラダイムに対応する3つの大きなカテゴリに従来から分類されています。
各アルゴリズムにはそれぞれ長所と短所があるが、すべての問題に有効な単一のアルゴリズムは存在しない。[ 43 ] [ 44 ] [ 45 ]

教師あり学習アルゴリズムは、入力と望ましい出力の両方を含むデータセットの数学的モデルを構築します。[ 46 ]トレーニングデータと呼ばれるデータは、トレーニング例のセットで構成されます。各トレーニング例には、1 つ以上の入力と、教師信号とも呼ばれる望ましい出力があります。数理モデルでは、各トレーニング例は配列またはベクトル(特徴ベクトルと呼ばれることもあります)で表され、トレーニングデータは行列で表されます。目的関数の反復最適化により、教師あり学習アルゴリズムは、新しい入力に関連付けられた出力を予測するために使用できる関数を学習します。[ 47 ]最適な関数により、アルゴリズムはトレーニングデータの一部ではなかった入力に対して出力を正しく決定できます。時間の経過とともに出力または予測の精度が向上するアルゴリズムは、そのタスクを実行することを学習したと言われます。[ 15 ]
教師あり学習アルゴリズムの種類には、アクティブラーニング、分類、回帰などがあります。[ 48 ]分類アルゴリズムは、出力が限られた値のセットに制限されている場合に使用され、回帰アルゴリズムは、出力が範囲内の任意の数値をとることができる場合に使用されます。たとえば、電子メールをフィルタリングする分類アルゴリズムでは、入力は受信電子メールであり、出力は電子メールを保存するフォルダです。対照的に、回帰は、年齢や遺伝などの要因に基づいて人の身長を予測したり、過去のデータに基づいて将来の気温を予測したりするタスクに使用されます。[ 49 ]
類似性学習は、回帰や分類と密接に関連する教師あり機械学習の一分野ですが、その目的は、2つのオブジェクトの類似性や関連性を測定する類似性関数を用いて、事例から学習することです。ランキング、推薦システム、視覚的アイデンティティ追跡、顔認証、話者認証などの分野で応用されています。
教師なし学習アルゴリズムは、ラベル付け、分類、カテゴリ化されていないデータ内の構造を見つけ出します。フィードバックに反応するのではなく、教師なし学習アルゴリズムはデータ内の共通点を特定し、新しいデータごとにそのような共通点の有無に基づいて反応します。教師なし機械学習の中心的なアプリケーションには、クラスタリング、次元削減[ 4 ]、密度推定[ 50 ]などがあります。
クラスター分析とは、一連の観測値をサブセット(クラスターと呼ばれる)に割り当てることで、同じクラスター内の観測値は1つ以上の事前定義された基準に従って類似し、異なるクラスターから抽出された観測値は類似しないという性質を持つようにする手法です。さまざまなクラスタリング手法は、データの構造について異なる仮定を置いており、多くの場合、何らかの類似度指標によって定義され、例えば、内部コンパクト性(同じクラスターのメンバー間の類似性)や分離度(クラスター間の差異)によって評価されます。その他の手法は、推定密度やグラフ接続性に基づいています。
教師なし学習の特殊なタイプである自己教師あり学習では、データ自体から教師信号を生成することによってモデルを訓練します。[ 51 ] [ 52 ]
次元削減とは、主変数のセットを取得することによって、考慮されるランダム変数の数を減らすプロセスです。[ 53 ]言い換えれば、特徴セットの次元、つまり「特徴の数」を減らすプロセスです。次元削減手法のほとんどは、特徴の除去または抽出のいずれかと考えることができます。次元削減の一般的な方法の 1 つは、主成分分析(PCA) です。PCA では、高次元データ (たとえば 3D) をより小さな空間 (たとえば 2D) に変換します。多様体仮説は、高次元データセットが低次元多様体に沿って存在することを提案しており、多くの次元削減手法はこの仮定に基づいており、多様体学習と多様体正則化の分野につながっています。
半教師あり学習は、教師なし学習(ラベル付き訓練データがまったくない学習)と教師あり学習(ラベル付き訓練データが完全に揃っている学習)の中間に位置します。訓練データの中には訓練ラベルが欠落しているものもありますが、多くの機械学習研究者は、ラベルなしデータを少量のラベル付きデータと併用することで、学習精度を大幅に向上させることができることを発見しています。
弱教師あり学習では、トレーニングラベルはノイズが多く、限定的であったり、不正確であったりしますが、これらのラベルは取得コストが低いことが多く、結果としてより大規模な有効なトレーニングセットが得られます。[ 54 ]

強化学習は、ソフトウェアエージェントが環境内でどのような行動をとって累積報酬の概念を最大化すべきかに関心を持つ機械学習の分野です。その汎用性から、この分野はゲーム理論、制御理論、オペレーションズリサーチ、情報理論、シミュレーションベースの最適化、マルチエージェントシステム、群知能、統計学、遺伝的アルゴリズムなど、他の多くの分野で研究されています。強化学習では、環境は通常マルコフ決定過程(MDP)として表現されます。多くの強化学習アルゴリズムは動的計画法の手法を使用します。[ 55 ]強化学習アルゴリズムは、MDPの正確な数学モデルの知識を前提とせず、正確なモデルが実現不可能な場合に使用されます。強化学習アルゴリズムは、自律走行車や人間相手にゲームをプレイすることを学習する際に使用されます。
この3つの分類にきれいに当てはまらない他のアプローチも開発されており、同じ機械学習システムで複数のアプローチが使用される場合もあります。たとえば、トピックモデリング、メタ学習などです。[ 56 ]
機械学習パラダイムとしての自己学習は、クロスバー適応アレイ(CAA)と呼ばれる自己学習可能なニューラルネットワークとともに1982年に導入されました。[ 57 ] [ 58 ]これは、感情を内部報酬として導入することで、外部報酬なしで学習するという問題に対する解決策を提供します。感情は、自己学習エージェントの状態評価として使用されます。CAA自己学習アルゴリズムは、クロスバー方式で、行動に関する決定と結果状況に関する感情(感覚)の両方を計算します。このシステムは、認知と感情の相互作用によって駆動されます。[ 59 ] 自己学習アルゴリズムは、メモリ行列W =||w(a,s)||を更新し、各反復で次の機械学習ルーチンを実行します。
これは、入力が1つ(状況)のみで、出力が1つ(行動または振る舞い)のみのシステムです。環境からの独立した強化入力も助言入力もありません。逆伝播される値(二次強化)は、結果状況に対する感情です。CAAは2つの環境に存在します。1つは行動環境であり、そこで行動します。もう1つは遺伝環境であり、そこから行動環境で遭遇する状況に関する初期感情を最初に、そして一度だけ受け取ります。遺伝環境からゲノム(種)ベクトルを受け取った後、CAAは望ましい状況と望ましくない状況の両方を含む環境で目標追求行動を学習します。[ 60 ]
いくつかの学習アルゴリズムは、トレーニング中に提供される入力のより良い表現を発見することを目的としています。[ 61 ]古典的な例としては、主成分分析とクラスタ分析があります。特徴学習アルゴリズム(表現学習アルゴリズムとも呼ばれる)は、多くの場合、入力の情報を保持しようとしますが、分類や予測を実行する前の前処理ステップとして、有用な方法でそれを変換します。この手法により、未知のデータ生成分布からの入力を再構築できますが、その分布の下であり得ない構成に必ずしも忠実である必要はありません。これにより、手動の特徴エンジニアリングが置き換えられ、機械が特徴を学習し、それらを使用して特定のタスクを実行できるようになります。
特徴学習は、教師あり学習と教師なし学習のいずれかです。教師あり特徴学習では、ラベル付き入力データを使用して特徴を学習します。例としては、人工ニューラルネットワーク、多層パーセプトロン、教師あり辞書学習などがあります。教師なし特徴学習では、ラベルなし入力データを使用して特徴を学習します。例としては、辞書学習、独立成分分析、オートエンコーダ、行列分解[ 62 ]、およびさまざまな形式のクラスタリング[ 63 ] [ 64 ] [ 65 ]などがあります。
多様体学習アルゴリズムは、学習された表現が低次元であるという制約の下でそれを試みます。スパースコーディングアルゴリズムは、学習された表現がスパースである、つまり数学モデルに多くのゼロがあるという制約の下でそれを試みます。多重線形部分空間学習アルゴリズムは、多次元データのテンソル表現から低次元表現を直接学習することを目指し、それらをより高次元のベクトルに再構成しません。[ 66 ]ディープラーニングアルゴリズムは、複数のレベルの表現、つまり特徴の階層を発見し、より高レベルでより抽象的な特徴は、より低レベルの特徴によって定義されます(または生成されます)。インテリジェントマシンは、観測されたデータを説明する根本的な変動要因を分離する表現を学習すると主張されています。[ 67 ]
特徴学習は、分類などの機械学習タスクでは、数学的にも計算的にも処理しやすい入力データが必要となることが多いという事実に基づいています。しかし、画像、動画、感覚データといった現実世界のデータからは、特定の特性をアルゴリズム的に定義しようとする試みはこれまで成功していません。そこで、明示的なアルゴリズムに頼らず、分析を通してそのような特性や表現を発見するという方法が考えられます。
スパース辞書学習は、訓練例を基底関数の線形結合として表現し、スパース行列であると仮定する特徴学習法です。この方法はNP困難であり、近似的に解くことは困難です。[ 68 ]スパース辞書学習の一般的なヒューリスティック法は、 k -SVDアルゴリズムです。スパース辞書学習は、いくつかのコンテキストで適用されています。分類では、問題は、以前に見たことのない訓練例がどのクラスに属するかを決定することです。各クラスが既に構築されている辞書の場合、新しい訓練例は、対応する辞書によって最もスパースに表現されるクラスに関連付けられます。スパース辞書学習は、画像ノイズ除去にも適用されています。重要なアイデアは、クリーンな画像パッチは画像辞書によってスパースに表現できますが、ノイズはできないということです。[ 69 ]
データマイニングにおいて、異常検出(外れ値検出とも呼ばれる)とは、データの大部分と著しく異なることで疑念を抱かせる稀な項目、イベント、または観測値を特定することである。[ 70 ]通常、異常項目は、銀行詐欺、構造上の欠陥、医療上の問題、またはテキストのエラーなどの問題を表す。異常は、外れ値、新奇性、ノイズ、逸脱、例外などと呼ばれる。 [ 71 ]
特に、不正利用やネットワーク侵入検知の文脈では、興味深い対象は、まれなものではなく、予期せぬ非活動状態の急増であることが多い。このパターンは、まれな対象という外れ値の一般的な統計的定義には当てはまらない。多くの外れ値検出方法(特に教師なしアルゴリズム)は、適切に集約しない限り、このようなデータでは失敗する。代わりに、クラスタ分析アルゴリズムは、これらのパターンによって形成されるマイクロクラスタを検出できる可能性がある。[ 72 ]
異常検出手法には大きく分けて 3 つのカテゴリがあります。[ 73 ]教師なし異常検出手法は、データセット内のインスタンスの大部分が正常であるという仮定の下で、ラベル付けされていないテストデータセット内の異常を検出します。これは、データセットの残りのインスタンスに最も適合しないインスタンスを探すことによって行われます。教師あり異常検出手法では、「正常」と「異常」としてラベル付けされたデータセットが必要であり、分類器のトレーニングを伴います (他の多くの統計的分類問題との主な違いは、外れ値検出の本質的に不均衡な性質です)。半教師あり異常検出手法は、与えられた正常トレーニングデータセットから正常な動作を表すモデルを構築し、テストインスタンスがモデルによって生成される可能性をテストします。
ロボット学習は、教師あり学習、強化学習[ 74 ] [ 75 ]、そしてメタ学習(MAMLなど)といった、数多くの機械学習手法から着想を得ています。
アソシエーションルール学習は、大規模データベース内の変数間の関係を発見するためのルールベースの機械学習手法です。これは、「興味深さ」の尺度を用いてデータベース内で発見された強力なルールを特定することを目的としています。[ 76 ]
ルールベースの機械学習は、知識を保存、操作、または適用するための「ルール」を識別、学習、または進化させるあらゆる機械学習手法の総称です。ルールベースの機械学習アルゴリズムの決定的な特徴は、システムによって取得された知識を集合的に表す一連の関係ルールを識別して利用することです。これは、予測を行うためにあらゆるインスタンスに普遍的に適用できる単一のモデルを識別する他の機械学習アルゴリズムとは対照的です。[ 77 ]ルールベースの機械学習アプローチには、学習分類器システム、アソシエーションルール学習、および人工免疫システムが含まれます。
強力なルールの概念に基づき、Rakesh Agrawal、Tomasz Imieliński、およびArun Swamiは、スーパーマーケットのPOSシステムによって記録された大規模な取引データにおける製品間の規則性を発見するためのアソシエーションルールを導入した。 [ 78 ]例えば、ルールスーパーマーケットの販売データから、顧客がタマネギとジャガイモを一緒に購入した場合、ハンバーガー用の肉も購入する可能性が高いことが分かります。このような情報は、プロモーション価格や商品配置などのマーケティング活動に関する意思決定の基礎として使用できます。マーケットバスケット分析に加えて、アソシエーションルールは、 Web使用状況マイニング、侵入検知、連続生産、バイオインフォマティクスなどのアプリケーション分野で現在使用されています。シーケンスマイニングとは対照的に、アソシエーションルール学習では、通常、トランザクション内またはトランザクション間でアイテムの順序は考慮されません。
学習分類システム(LCS)は、ルールベースの機械学習アルゴリズムの一種で、通常は遺伝的アルゴリズムである発見コンポーネントと、教師あり学習、強化学習、または教師なし学習を実行する学習コンポーネントを組み合わせたものです。LCSは、文脈依存のルールセットを特定し、知識を部分的にまとめて保存および適用して予測を行うことを目指します。[ 79 ]
帰納的論理プログラミング(ILP)は、入力例、背景知識、仮説を統一的に表現する手段として論理プログラミングを用いるルール学習手法です。既知の背景知識の符号化と、事実の論理データベースとして表現された一連の例が与えられると、ILPシステムは、すべての肯定例を含み、否定例を含まない仮説的な論理プログラムを導出します。帰納的プログラミングは、関数型プログラムなど、仮説を表現するためのあらゆる種類のプログラミング言語(論理プログラミングに限らず)を対象とする関連分野です。
帰納的論理プログラミングは、バイオインフォマティクスや自然言語処理において特に有用である。ゴードン・プロトキンとエフド・シャピロは、論理的な設定において帰納的機械学習の最初の理論的基礎を築いた。[ 80 ] [ 81 ] [ 82 ]シャピロは1981年に最初の実装(モデル推論システム)を構築した。これは、正例と負例から論理プログラムを帰納的に推論するPrologプログラムである。 [ 83 ]ここでの帰納的という用語は、整列集合のすべての要素の性質を証明する数学的帰納法ではなく、観察された事実を説明する理論を示唆する哲学的帰納法を指す。
A機械学習モデルは、与えられたデータセットで「トレーニング」されると、新しいデータに対して予測や分類を行うために使用できる数学モデルの一種です。トレーニング中、学習アルゴリズムはモデルの内部パラメータを繰り返し調整して、予測の誤差を最小限に抑えます。 [ 84 ]さらに、「モデル」という用語は、一般的なクラスのモデルとその関連する学習アルゴリズムから、すべての内部パラメータが調整された完全にトレーニングされたモデルまで、いくつかのレベルの具体性を指すことができます。 [ 85 ]
機械学習システムでは様々な種類のモデルが使用され、研究されてきましたが、タスクに最適なモデルを選択することをモデル選択と呼びます。

人工ニューラルネットワーク(ANN)、またはコネクショニストシステムは、動物の脳を構成する生物学的ニューラルネットワークに漠然と着想を得たコンピューティングシステムです。このようなシステムは、一般的にタスク固有のルールをプログラムすることなく、例を検討することによってタスクを実行することを「学習」します。
人工ニューラルネットワーク(ANN)は、「人工ニューロン」と呼ばれる接続されたユニットまたはノードの集合に基づいたモデルであり、生物の脳のニューロンを大まかにモデル化しています。生物の脳のシナプスと同様に、各接続は、ある人工ニューロンから別の人工ニューロンへ情報、つまり「信号」を伝達できます。信号を受け取った人工ニューロンは、その信号を処理し、接続されている他の人工ニューロンに信号を送ることができます。一般的なANNの実装では、人工ニューロン間の接続における信号は実数であり、各人工ニューロンの出力は、その入力の合計の非線形関数によって計算されます。人工ニューロン間の接続は「エッジ」と呼ばれます。人工ニューロンとエッジは通常、学習の進行に伴って調整される重みを持ちます。重みは、接続における信号の強度を増減させます。人工ニューロンには閾値が設定されている場合があり、集約された信号がその閾値を超えた場合にのみ信号が送信されます。通常、人工ニューロンは層に集約されます。異なる層は、入力に対して異なる種類の変換を実行する場合があります。信号は、最初の層(入力層)から最後の層(出力層)へと伝達されるが、その過程で複数の層を通過する場合もある。
人工ニューラルネットワーク(ANN)の当初の目標は、人間の脳と同じように問題を解決することでした。しかし、時が経つにつれ、特定のタスクの実行に焦点が移り、生物学的な仕組みから逸脱するようになりました。人工ニューラルネットワークは、コンピュータビジョン、音声認識、機械翻訳、ソーシャルネットワークのフィルタリング、ボードゲームやビデオゲーム、医療診断など、さまざまなタスクに利用されています。
ディープラーニングは、人工ニューラルネットワーク内の複数の隠れ層から構成されます。このアプローチは、人間の脳が光と音を処理して視覚と聴覚に変換する方法をモデル化しようとします。ディープラーニングの成功例には、コンピュータビジョンや音声認識などがあります。[ 86 ]

決定木学習では、決定木を予測モデルとして使用し、項目に関する観測値(枝で表される)から項目の目標値(葉で表される)に関する結論へと進みます。これは、統計学、データマイニング、機械学習で使用される予測モデリング手法の 1 つです。目標変数が離散的な値のセットを取ることができるツリーモデルは分類木と呼ばれます。これらのツリー構造では、葉はクラスラベルを表し、枝はそれらのクラスラベルにつながる特徴の結合を表します。目標変数が連続値(通常は実数)を取ることができる決定木は回帰木と呼ばれます。意思決定分析では、決定木を使用して意思決定と意思決定を視覚的かつ明示的に表現できます。データマイニングでは、決定木はデータを記述しますが、結果として得られる分類木は意思決定の入力になります。
ランダムフォレスト回帰(RFR) は、決定木ベースのモデルに分類されます。RFR は、複数の決定木を構築し、それらの予測を平均化することで精度を向上させ、過学習を回避するアンサンブル学習法です。決定木を構築するために、RFR はブートストラップサンプリングを使用します。たとえば、各決定木はトレーニングセットからのランダムなデータでトレーニングされます。トレーニング用の RFR のこのランダムな選択により、モデルは偏った予測を減らし、より高い精度を達成できます。RFR は独立した決定木を生成し、単一出力データだけでなく、複数の回帰タスクでも機能します。これにより、RFR はさまざまなアプリケーションでの使用に適しています。[ 87 ] [ 88 ]
サポートベクターマシン(SVM)は、サポートベクターネットワークとも呼ばれ、分類と回帰に使用される一連の関連する教師あり学習手法です。トレーニング例のセットが与えられ、それぞれが2つのカテゴリのいずれかに属するようにマークされている場合、SVMトレーニングアルゴリズムは、新しい例がどちらのカテゴリに属するかを予測するモデルを構築します。[ 89 ] SVMトレーニングアルゴリズムは、非確率的、バイナリ、線形分類器ですが、 Plattスケーリングなどの手法は、 SVMを確率的分類設定で使用するために存在します。SVMは、線形分類を実行することに加えて、カーネルトリックと呼ばれるものを使用して非線形分類を効率的に実行でき、暗黙的に入力を高次元の特徴空間にマッピングします。

回帰分析は、入力変数とそれに関連する特徴との関係を推定するためのさまざまな統計的手法を包含します。最も一般的な形式は線形回帰で、最小二乗法などの数学的基準に従って、与えられたデータに最もよく適合する単一の直線が引かれます。後者は、リッジ回帰のように、過学習やバイアスを軽減するために正則化手法によって拡張されることがよくあります。非線形問題を扱う場合、よく使用されるモデルには、多項式回帰(たとえば、Microsoft Excel [ 90 ]のトレンドラインフィッティングに使用)、ロジスティック回帰(統計的分類でよく使用)、またはカーネルトリックを利用して入力変数を暗黙的に高次元空間にマッピングすることで非線形性を導入するカーネル回帰などがあります。
多変量線形回帰は、線形回帰の概念を拡張して、複数の従属変数を同時に扱うものです。このアプローチでは、多次元線形モデルを当てはめることで、一連の入力変数と複数の出力変数の間の関係を推定します。これは、出力が相互依存的であったり、複数の経済指標の予測や画像の再構築など、本質的に多次元であるシナリオで特に役立ちます。[ 91 ]

ベイジアンネットワーク、信念ネットワーク、または有向非巡回グラフモデルは、確率変数の集合とその条件付き独立性を有向非巡回グラフ(DAG)で表現する確率的グラフモデルです。たとえば、ベイジアンネットワークは、疾患と症状の間の確率的関係を表すことができます。症状が与えられた場合、このネットワークを使用して、さまざまな疾患が存在する確率を計算できます。推論と学習を実行する効率的なアルゴリズムが存在します。音声信号やタンパク質配列などの変数のシーケンスをモデル化するベイジアンネットワークは、動的ベイジアンネットワークと呼ばれます。不確実性の下で意思決定問題を表現および解決できるベイジアンネットワークの一般化は、影響図と呼ばれます。

ガウス過程とは、過程内の有限個の確率変数の集合が多変量正規分布に従う確率過程であり、点のペアが位置に応じてどのように関連しているかをモデル化する、あらかじめ定義された共分散関数(カーネル)に依存している。
観測された点の集合、つまり入出力例が与えられた場合、観測された点と、それらの点と新しい未観測の点との間の共分散を調べることで、新しい点の入力データの関数としての(未観測の)出力の分布を直接計算することができる。
ガウス過程は、ハイパーパラメータ最適化を行うために使用されるベイズ最適化における一般的な代理モデルです。
遺伝的アルゴリズム(GA)は、自然選択のプロセスを模倣する探索アルゴリズムおよびヒューリスティック手法であり、突然変異や交叉などの方法を使用して新しい遺伝子型を生成し、与えられた問題に対する良い解決策を見つけようとします。機械学習では、遺伝的アルゴリズムは1980年代と1990年代に使用されました。[ 93 ] [ 94 ]逆に、機械学習技術は遺伝的アルゴリズムと進化的アルゴリズムの性能を向上させるために使用されてきました。[ 95 ]
信念関数理論は、証拠理論またはデンプスター・シェーファー理論とも呼ばれ、不確実性を伴う推論のための一般的なフレームワークであり、確率、可能性、 不正確確率理論などの他のフレームワークとの関連性が理解されています。これらの理論的フレームワークは、一種の学習器と考えることができ、証拠がどのように結合されるか(例えば、デンプスターの結合規則)について類似の特性を持っています。これは、pmfベースのベイズアプローチで確率が結合される方法と同様です。[ 96 ]ただし、無知と不確実性の定量化を組み込むベイズアプローチと比較すると、これらの信念関数には多くの注意点があります。機械学習領域で実装されるこれらの信念関数アプローチは、通常、さまざまなアンサンブル手法の融合アプローチを利用して、標準的な機械学習アプローチでは解決が難しい学習器の決定境界、サンプル数の少なさ、曖昧なクラスの問題をより適切に処理します。[ 97 ] [ 6 ]しかし、これらのアルゴリズムの計算複雑性は命題(クラス)の数に依存し、他の機械学習アプローチと比較すると、はるかに長い計算時間につながる可能性があります。
ルールベース機械学習(RBML)は、データから「ルール」を自動的に発見して学習する機械学習の一分野です。解釈可能なモデルを提供するため、医療、不正検出、サイバーセキュリティなどの分野での意思決定に役立ちます。主要なRBML技術には、学習分類器システム[ 98 ] 、アソシエーションルール学習[ 99 ] 、人工免疫システム[ 100 ]、およびその他の類似モデルが含まれます。これらの手法は、データからパターンを抽出し、時間の経過とともにルールを進化させます。
一般的に、機械学習モデルは正確な予測を行うために、大量の信頼できるデータを必要とします。機械学習モデルをトレーニングする際、機械学習エンジニアは、大規模で代表的なデータサンプルをターゲットとして収集する必要があります。トレーニングセットのデータは、テキストコーパス、画像コレクション、センサーデータ、サービス利用者の個々のデータなど、多岐にわたります。機械学習モデルのトレーニングでは、過学習に注意する必要があります。偏ったデータや評価されていないデータからトレーニングされたモデルは、偏った、あるいは望ましくない予測につながる可能性があります。偏ったモデルは有害な結果をもたらし、社会や目標に対する悪影響をさらに悪化させる可能性があります。アルゴリズムの偏りは、トレーニング用にデータが十分に準備されていない場合に発生する可能性があります。機械学習倫理は研究分野として確立されつつあり、特に機械学習エンジニアリングチームに統合されつつあります。
フェデレーテッドラーニングは、分散型人工知能を応用した機械学習モデルのトレーニング手法であり、トレーニングプロセスを分散化することで、ユーザーのデータを中央サーバーに送信する必要がないため、ユーザーのプライバシーを維持できます。また、トレーニングプロセスを多くのデバイスに分散化することで効率も向上します。例えば、Gboardはフェデレーテッド機械学習を使用して、個々の検索をGoogleに送信することなく、ユーザーの携帯電話で検索クエリ予測モデルをトレーニングします。[ 101 ]
機械学習には、以下のような多くの応用例があります。
2006年、メディアサービスプロバイダーのNetflixは、ユーザーの好みをより正確に予測し、既存の映画推薦アルゴリズムであるCinematchの精度を少なくとも10%向上させるプログラムを見つけるための最初の「Netflix Prize 」コンテストを開催しました。AT &T Labs - Researchの研究者とBig ChaosおよびPragmatic Theoryのチームとの共同チームがアンサンブルモデルを構築し、2009年に100万ドルのグランプリを獲得しました。[ 105 ]賞が授与された直後、Netflixは視聴者の評価が視聴パターンの最良の指標ではないこと(「すべてが推薦である」)に気づき、それに応じて推薦エンジンを変更しました。[ 106 ] 2010年、ウォール・ストリート・ジャーナルの記事は、Rebellion Researchが機械学習を使用して2008年の金融危機を予測したことを指摘しました。[ 107 ] 2012年、サン・マイクロシステムズの共同創設者であるヴィノッド・コースラは、今後20年で医師の仕事の80%が自動化された機械学習医療診断ソフトウェアに取って代わられると予測した。[ 108 ] 2014年には、美術史の分野で機械学習アルゴリズムが美術絵画の研究に適用され、これまで認識されていなかった芸術家の影響が明らかになった可能性があると報告された。[ 109 ] 2019年、シュプリンガー・ネイチャーは、機械学習を使用して作成された最初の研究書を出版した。[ 110 ] 2020年には、機械学習技術が診断の支援やCOVID-19の治療法の開発に役立てられた。[ 111 ]機械学習は最近、旅行者の環境に配慮した行動を予測するために適用された。[ 112 ]最近では、機械学習技術が、ユーザーの電話とのやり取りに基づいてスマートフォンのパフォーマンスと熱挙動を最適化するためにも適用されている。[ 113 ] [ 114 ] [ 115 ]正しく適用すれば、機械学習アルゴリズム (MLA) は、過学習することなく、幅広い企業特性を利用して株価収益率を予測できます。効果的な特徴量エンジニアリングを採用し、予測を組み合わせることで、MLA はOLSなどの基本的な線形手法から得られる結果をはるかに上回る結果を生成できます。[ 116 ]
機械学習の最近の進歩は量子化学の分野にも及んでおり、新しいアルゴリズムによって化学反応における溶媒効果を予測できるようになり、化学者が最適な結果を得るために実験条件を調整するための新しいツールが提供されています。[ 117 ]
機械学習は、大規模および小規模災害における避難の意思決定を調査および予測するための有用なツールになりつつあります。山火事やハリケーンの際に、住民が避難するかどうか、またいつ避難するかを予測するために、さまざまなソリューションがテストされています。[ 118 ] [ 119 ] [ 120 ]他のアプリケーションは、建物火災における避難前の意思決定に焦点を当てています。[ 121 ] [ 122 ]
機械学習はいくつかの分野で変革をもたらしてきたが、機械学習プログラムは期待される結果を出せないことが多い。[ 123 ] [ 124 ] [ 125 ]その理由は数多くある。適切なデータの不足、データへのアクセス不足、データの偏り、プライバシーの問題、不適切なタスクとアルゴリズムの選択、間違ったツールと人材、リソースの不足、評価の問題などである。[ 126 ]
「ブラックボックス理論」は、もう一つの重大な課題を提起する。ブラックボックスとは、出力を生成するアルゴリズムが完全に不透明である状況を指し、アプリケーションの設計者でさえ、機械がデータから抽出したパターンを監査できないことを意味する。[ 127 ]貴族院特別委員会は、「個人の生活に重大な影響を与える可能性のある」そのような「インテリジェンスシステム」は、その決定に対する「完全かつ満足のいく説明」を提供しない限り、受け入れられないと主張した。[ 127 ]
2018年、 Uberの自動運転車が歩行者を検知できず、衝突事故で歩行者が死亡した。[ 128 ] IBM Watsonシステムを用いた機械学習の医療への応用は、長年の時間と数十億ドルの投資にもかかわらず、成果を上げていない。[ 129 ] [ 130 ] MicrosoftのBing Chatチャットボットは、ユーザーに対して敵対的で攻撃的な応答を生成したと報告されている。[ 131 ]
機械学習は、系統的レビューに関連するエビデンスを更新し、生物医学文献の増加に伴うレビュー担当者の負担増に対処するための戦略として用いられてきた。トレーニングセットによって改善されてきたものの、研究結果自体に必要な感度を損なうことなく作業負荷を軽減できるほど十分に発展してはいない。[ 132 ]
説明可能なAI(XAI)、解釈可能なAI、または説明可能な機械学習(XML)とは、人間がAIによる決定や予測を理解できる人工知能(AI)のことである。[ 133 ]これは、機械学習における「ブラックボックス」の概念とは対照的である。ブラックボックスでは、AIの設計者でさえ、AIが特定の決定に至った理由を説明できない。[ 134 ] XAIは、AI搭載システムのユーザーのメンタルモデルを洗練し、誤解を解消することで、ユーザーがより効果的に業務を遂行できるようになると期待されている。XAIは、説明を受ける社会的権利の実現である可能性がある。

過去のすべての訓練データに適合するように無理やりこじつけられた、不適切で過度に複雑な理論に落ち着くことを過学習といいます。多くのシステムは、理論がデータにどれだけ適合しているかに応じて報酬を与え、理論の複雑さに応じて罰則を与えることで、過学習を減らそうとします。[ 135 ]
人工知能(AI)の分野では、幻覚または人工幻覚(でたらめ、[ 144 ] [ 145 ]虚偽または誤解を招く情報を事実として提示するAIによって生成された応答)は、AIによって生成された応答です。[ 148 ]これらの用語は、幻覚が通常誤った知覚を伴う人間の心理と緩やかに類似しています。
ChatGPTのような大規模言語モデル(LLM)を搭載したチャットボットは、捏造された引用など、もっともらしく聞こえるランダムな虚偽を生成コンテンツに埋め込む可能性があります。エラーや幻覚を検出して軽減することは、チップ設計、サプライチェーン物流、医療診断などの高リスクのシナリオにおける LLM の実用的展開と信頼性にとって大きな課題となります。[ 149 ] [ 150 ] [ 151 ]一部のソフトウェアエンジニアや統計学者は、「AI 幻覚」という特定の用語がコンピュータを不当に擬人化しているとして批判しています。[ 152 ] [ 153 ]記号的人工知能モデルは、大規模言語モデルとは異なり、一般的に幻覚を生成しません。[ 154 ]
学習者は「間違った教訓を学ぶ」ことによって失望することもある。簡単な例として、茶色の馬と黒猫の写真だけで訓練された画像分類器は、すべての茶色の斑点は馬である可能性が高いと結論付けるかもしれない。[ 155 ]現実世界の例としては、現在の画像分類器は、人間とは異なり、画像の構成要素間の空間的な関係から主に判断を下すことはなく、人間が気づかないが、特定の種類の実際の物体の画像と相関するピクセル間の関係を学習することが多い。正当な画像でこれらのパターンを変更すると、システムが誤分類する「敵対的」画像が生じる可能性がある。[ 156 ] [ 157 ]
敵対的脆弱性は、非線形システムや非パターン摂動によっても発生する可能性があります。一部のシステムでは、敵対的に選択された単一のピクセルを変更するだけで出力を変更できる場合があります。[ 158 ]機械学習モデルは、敵対的機械学習による操作や回避に対して脆弱であることがよくあります。[ 159 ]
研究者らは、第三者によって開発またはトレーニングされることが多い分類(例えば、投稿の「スパム」と「スパムではない」のカテゴリ)を行う機械学習モデルに、バックドアを検知されずに仕込む方法を実証した。関係者は、ホワイトボックスアクセスを含む可能性のあるデータ/ソフトウェアの透明性が提供される場合を含め、あらゆる入力の分類を変更できる。[ 160 ] [ 161 ] [ 162 ]
機械学習モデルの分類は、ホールドアウト法などの精度推定手法によって検証できます。ホールドアウト法では、データをトレーニングセットとテストセットに分割し(慣例的にトレーニングセットが2/3、テストセットが1/3)、テストセットでトレーニングモデルのパフォーマンスを評価します。これに対し、K分割交差検証法では、データをランダムにK個のサブセットに分割し、K回の実験を実行します。各実験では、1つのサブセットを評価に、残りのK-1個のサブセットをモデルのトレーニングに使用します。ホールドアウト法と交差検証法に加えて、データセットからn個のインスタンスを復元抽出するブートストラップ法も、モデルの精度を評価するために使用できます。[ 163 ]
In addition to overall accuracy, investigators frequently report sensitivity and specificity, meaning true positive rate (TPR) and true negative rate (TNR), respectively. Similarly, investigators sometimes report the false positive rate (FPR) as well as the false negative rate (FNR). However, these rates are ratios that fail to reveal their numerators and denominators. Receiver operating characteristic (ROC), along with the accompanying Area Under the ROC Curve (AUC), offer additional tools for classification model assessment. Higher AUC is associated with a better performing model.[164]
The ethics of artificial intelligence covers a broad range of topics within AI that are considered to have particular ethical stakes.[165] This includes algorithmic biases, fairness, accountability, transparency, privacy, and regulation, particularly where systems influence or automate human decision-making. It also covers various emerging or potential future challenges such as machine ethics (how to make machines that behave ethically), lethal autonomous weapon systems, arms race dynamics, AI safety and alignment, technological unemployment, AI-enabled misinformation,[166] how to treat certain AI systems if they have a moral status (AI welfare and rights), artificial superintelligence and existential risks.[165]
Some application areas may also have particularly important ethical implications, like healthcare, education, criminal justice, or the military.
Different machine learning approaches can suffer from different data biases. A machine learning system trained specifically on current customers may not be able to predict the needs of new customer groups that are not represented in the training data. When trained on human-made data, machine learning is likely to pick up the constitutional and unconscious biases already present in society.[167]
偏りのあるデータセットでトレーニングされたシステムは、使用時にこれらの偏りを示す可能性があり(アルゴリズムの偏り)、文化的な偏見をデジタル化してしまう。[ 168 ]例えば、1988年に英国の人種平等委員会は、セント・ジョージ医科大学が過去の入学担当者のデータからトレーニングされたコンピュータプログラムを使用しており、このプログラムが女性であるか、非ヨーロッパ風の名前を持つ約60人の候補者を拒否していたことを発見した。[ 167 ]人種差別的な採用方針を持つ企業の採用データを使用すると、機械学習システムが、過去の合格者との類似性に基づいて求職者をスコアリングすることで、偏りを再現してしまう可能性がある。[ 169 ] [ 170 ]別の例としては、予測型警察企業Geoliticaの予測アルゴリズムが、過去の犯罪データでトレーニングされた後、「低所得者層や少数派コミュニティで不均衡に高いレベルの過剰な警察活動」を引き起こしたことが挙げられる。[ 171 ]
システムのアルゴリズム規則の責任あるデータ収集と文書化は機械学習の重要な部分と考えられているが、一部の研究者は、機械学習がバイアスに脆弱である原因として、AI分野におけるマイノリティ集団の参加と代表性の欠如を挙げている。 [ 172 ]実際、2021年にコンピューティング研究協会が行った調査によると、世界中の複数の大学でAIを専門とする教員のうち、「女性教員はわずか16.1%」である。[ 173 ]さらに、「米国在住のAI博士号取得者」のグループでは、45%が白人、22.4%がアジア人、3.2%がヒスパニック系、2.4%がアフリカ系アメリカ人と回答しており、AI分野における多様性の欠如がさらに明らかになっている。[ 173 ]
データから学習した言語モデルには、人間のようなバイアスが含まれていることが示されています。[ 174 ] [ 175 ]人間の言語にはバイアスが含まれているため、言語コーパスで訓練された機械も必然的にこれらのバイアスを学習します。[ 176 ] [ 177 ] 2016年、マイクロソフトはTwitterから学習したチャットボットTayをテストしましたが、すぐに人種差別的および性差別的な言葉を習得しました。[ 178 ]
調査報道機関であるProPublicaが行った実験では、機械学習アルゴリズムによる囚人の再犯率に関する分析で、「黒人被告人は白人被告人よりも2倍高いリスクがある」と誤って判定された。[ 171 ] 2015年には、Googleフォトが黒人数人をゴリラと誤ってタグ付けし、物議を醸した。ゴリラのラベルはその後削除され、2023年になってもゴリラを認識できない。[ 179 ]白人以外の人物を認識する際の同様の問題は、他の多くのシステムでも見つかっている。[ 180 ]
こうした課題があるため、機械学習の効果的な利用が他の分野で採用されるまでには時間がかかる可能性がある。[ 181 ]機械学習における公平性、つまり機械学習におけるバイアスを減らし、その利用を人類の利益のために推進することへの懸念は、人工知能科学者によってますます表明されており、 Fei-Fei Li氏は次のように述べている。「AI には人工的なものは何もない。それは人間に触発され、人間によって作られ、そして最も重要なことに、人々に影響を与える。それは私たちが理解し始めたばかりの強力なツールであり、それは重大な責任である。」[ 182 ]
医療従事者の間では、これらのシステムが公共の利益のためではなく、収益を生み出す機械として設計されているのではないかという懸念がある。これは特に米国において顕著であり、米国では医療の改善と利益の増加という長年の倫理的ジレンマが存在する。例えば、アルゴリズムは、アルゴリズムの所有者が利害関係を持つ患者に不必要な検査や投薬を提供するように設計される可能性がある。医療における機械学習は、医療従事者に患者の診断、投薬、回復計画のための追加ツールを提供する可能性を秘めているが、そのためにはこれらのバイアスを軽減する必要がある。[ 183 ]
2010 年代以降、機械学習アルゴリズムとコンピュータ ハードウェアの両方の進歩により、非線形隠れユニットの多くの層を含む深層ニューラル ネットワーク(機械学習の特定の狭いサブドメイン) のトレーニングのより効率的な方法が実現しました。 [ 184 ] 2019 年までに、多くの場合 AI 専用の機能強化が施されたグラフィックス処理ユニット ( GPU ) が、大規模な商用クラウド AI のトレーニングの主要な方法として CPU に取って代わりました。[ 185 ] OpenAI は、 AlexNet (2012 年)からAlphaZero (2017 年) までの最大の深層学習プロジェクトで使用されたハードウェア コンピューティングを推定し、必要なコンピューティング量が 30 万倍に増加し、倍増時間の傾向線が 3.4 か月であることを発見しました。[ 186 ] [ 187 ]
テンソル処理ユニット (TPU)は、 Googleが機械学習ワークロード専用に開発した特殊なハードウェア アクセラレータです。汎用GPUやFPGAとは異なり、TPU はテンソル計算に最適化されているため、トレーニングや推論などのディープラーニング タスクに特に効率的です。Google Cloud AI サービスや、Google の DeepMind AlphaFold や大規模言語モデルなどの大規模な機械学習モデルで広く使用されています。TPU は、行列乗算ユニットと高帯域幅メモリを活用して、エネルギー効率を維持しながら計算を高速化します。[ 188 ] 2016 年の導入以来、TPU は、特にクラウド ベースの環境において、AI インフラストラクチャの重要なコンポーネントとなっています。
ニューロモルフィックコンピューティングとは、生物学的ニューラルネットワークの構造と機能を模倣するように設計されたコンピューティングシステムのクラスを指します。これらのシステムは、従来のハードウェア上でのソフトウェアベースのシミュレーション、または特殊なハードウェアアーキテクチャによって実装できます。[ 189 ]
物理ニューラルネットワークは、メンリスタなどの電気的に調整可能な材料を使用して神経シナプスの機能を模倣する、ニューロモルフィックハードウェアの特定のタイプです。「物理ニューラルネットワーク」という用語は、ソフトウェアベースの実装とは対照的に、計算に物理ハードウェアを使用することを強調しています。これは、調整可能な抵抗を持つ材料を使用して神経シナプスを再現する人工ニューラルネットワークを広く指します。[ 190 ] [ 191 ]
組み込み機械学習は、ウェアラブルコンピュータ、エッジデバイス、マイクロコントローラなどの限られたコンピューティングリソースを持つ組み込みシステムにモデルを展開する機械学習のサブフィールドです。[ 192 ] [ 193 ] [ 194 ] [ 195 ]これらのデバイスでモデルを直接実行することで、さらなる処理のためにクラウドサーバーにデータを転送および保存する必要がなくなり、データ侵害、プライバシー漏洩、知的財産、個人データ、企業秘密の盗難のリスクが軽減されます。組み込み機械学習は、ハードウェアアクセラレーション[ 196 ] [ 197 ] 、近似コンピューティング[ 198 ]、モデル最適化[ 199 ] [ 200 ]などのさまざまな技術によって実現できます。一般的な最適化技術には、枝刈り、量子化、知識蒸留、低ランク因子分解、ネットワークアーキテクチャ探索、パラメータ共有などがあります。