ニューラルネットワークとは、ニューロンと呼ばれる相互接続されたユニットの集合体であり、互いに信号を送受信します。ニューロンは、生物学的細胞または数学的モデルのいずれかです。個々のニューロンは単純ですが、ネットワーク内で多数のニューロンが集まることで、複雑なタスクを実行できます。ニューラルネットワークには、主に2つの種類があります。
神経科学では、行動や認知は脳の分散した領域間の相互作用から生じる。コンピュータ科学では、人工ニューラルネットワークが多くの最新のAIシステムを支えているが、膨大なデータセットと相当な計算能力を必要とする。さらに、その内部表現の解釈は困難である。

生物学の文脈では、ニューラルネットワークとは、シナプスによって化学的に相互接続された生物学的ニューロンの集団のことです。1 つのニューロンは何十万ものシナプスと接続されることがあります。[ 1 ]各ニューロンは、活動電位と呼ばれる電気化学信号を接続された隣接ニューロンに 送受信します。ニューロンは、受け取った信号を増幅して伝播する興奮性の役割、または信号を抑制する抑制性の役割を果たすことができます。[ 1 ]
神経ネットワークよりも小さい、相互接続されたニューロンの集団は神経回路と呼ばれます。非常に大きな相互接続されたネットワークは大規模脳ネットワークと呼ばれ、これらが多数集まって脳や神経系を形成します。
脳内の神経ネットワークによって生成された信号は、最終的に神経系を通って神経筋接合部を横断して筋細胞に伝わり、そこで収縮を引き起こし、それによって運動が生じる。[ 2 ]

機械学習において、ニューラルネットワークは非線形関数を近似するために使用される人工数学モデルです。初期の人工ニューラルネットワークは物理的な機械でしたが、[ 3 ]今日ではほぼ常にソフトウェアで実装されています。
人工ニューラルネットワークのニューロンは通常、層状に配置され、情報は最初の層(入力層)から 1 つ以上の中間層(隠れ層)を経て最終層(出力層)へと伝達されます。[ 4 ] 各ニューロンへの「信号」入力は数値であり、具体的には前の層の接続されているニューロンの出力の線形結合です。各ニューロンの出力信号は、その活性化関数に従ってこの数値から計算されます。ネットワークの動作は、ニューロン間の接続の強度(または重み)に依存します。ネットワークは、既存のデータセットに適合するように、経験的リスク最小化またはバックプロパゲーションによってこれらの重みを修正することによってトレーニングされます。 [ 5 ]
ディープニューラルネットワークという用語は、3層以上のニューラルネットワークを指し、通常は入力層と出力層に加えて少なくとも2つの隠れ層を含む。
人工ニューラルネットワークは内部表現の分析が難しいため、「ブラックボックス」モデルと呼ばれることが多く、解釈可能性は特に重要なアプリケーションにおいて活発な研究分野となっている。[ 6 ]
ニューラルネットワークは人工知能における問題を解決するために使用され、予測モデリング、適応制御、顔認識、手書き認識、一般的なゲームプレイ、生成AIなど、多くの分野で応用されています。
現代のニューラルネットワークの理論的基盤は、1873年にアレクサンダー・ベイン[ 7 ]、1890年にウィリアム・ジェームズ[ 8 ]によってそれぞれ独立に提唱された。両者とも、人間の思考は脳内の多数のニューロン間の相互作用から生じると仮定した。1949年、ドナルド・ヘッブは、ニューラルネットワークは信号が伝わるたびにシナプスを強化することで時間とともに変化し学習できるという考え方であるヘッブ学習について説明した[ 9 ] 。 1956年、スヴァエティチンは、ニューラルネットワークの理解の基礎となる第2次網膜細胞(水平細胞)の機能を発見した。
人工ニューラルネットワークは、もともと1930年代にコネクショニズムのアプローチの下で生物学的ニューラルネットワークをモデル化するために使用されていました。しかし、1943年にウォーレン・マカロックとウォルター・ピッツによって提案された人工ニューロンの数学的モデル[ 10 ] [ 11 ] 、それに続くフランク・ローゼンブラットによるパーセプトロンの導入と1950年代後半のハードウェア実装[ 3 ]により、 人工ニューラルネットワークは機械学習アプリケーションにますます使用されるようになり、生物学的ニューラルネットワークとはますます異なってきました。
1969年、マービン・ミンスキーとシーモア・パパートは著書『パーセプトロン』の中で単層パーセプトロンの限界を分析し、この批判はニューラルネットワーク研究への資金提供と関心の低下につながり、一部の著者はこれを「AIの冬」と表現している。
ニューラルネットワークの研究は、1980年代にバックプロパゲーションによって訓練された多層ネットワークの開発と普及によって復活し、2000年代以降は、大規模なデータセット、より高速なハードウェア(特にGPU)、およびアルゴリズムの進歩の組み合わせにより、ディープラーニングの台頭につながりました。[ 12 ]