統計学において、潜在変数(ラテン語:lateo「隠れている」の現在分詞)とは、直接観察または測定できる他の観測可能な変数から数学モデルを通して間接的にのみ推測できる変数のことである。[ 1 ]このような潜在変数モデルは、工学、医学、生態学、物理学、機械学習/人工知能、自然言語処理、バイオインフォマティクス、ケモメトリクス、人口統計学、経済学、経営学、政治学、心理学、社会科学など、多くの分野で使用されている。
潜在変数は、物理的現実の側面に対応する可能性がある。これらは原理的には測定可能であるが、実際的な理由から測定できない場合がある。この考え方の最も初期の表現の一つが、フランシス・ベーコンの論争書『ノヴム・オルガヌム』であり、これはアリストテレスの『オルガノン』に表現されたより伝統的な論理に対する挑戦である。
しかし、私たちがここで述べている潜在的なプロセスは、現代の人々の心にとって、決して明白なものではない。なぜなら、私たちがここで言っているのは、身体そのものに現れるようなプロセスの尺度、症状、程度ではなく、感覚による観察をほとんど逃れる、継続的なプロセスだからである。
このような状況では、 「隠れ変数」という用語が一般的に用いられます。これは、変数が意味を持つものの、観測できないという事実を反映しています。その他の潜在変数は、カテゴリー、行動状態や精神状態、データ構造といった抽象的な概念に対応します。このような状況では、 「仮説変数」または「仮説構成概念」という用語が用いられることがあります。
潜在変数を用いることで、データの次元を削減できる。多くの観測可能な変数をモデルに集約することで、根底にある概念を表現し、データの理解を容易にすることができる。この点において、潜在変数は科学理論と同様の役割を果たす。同時に、潜在変数は現実世界の観測可能な「非記号的」データを、モデル化された世界の記号的データと結びつける役割も担う。

因子分析法によって生成される潜在変数は、一般的に「共有」分散、つまり変数がどの程度一緒に「動く」かを表します。相関のない変数は、共通因子モデルに基づく潜在構成概念を生み出すことはできません。[ 4 ]
経済学の分野における潜在変数の例としては、生活の質、企業信頼感、士気、幸福感、保守主義などが挙げられます。これらはすべて直接測定できない変数です。しかし、これらの潜在変数を他の観測可能な変数と関連付けることで、観測可能な変数の測定値から潜在変数の値を推測することができます。生活の質は直接測定できない潜在変数であるため、観測可能な変数を用いて生活の質を推測します。生活の質を測定するための観測可能な変数には、富、雇用、環境、身体的および精神的健康、教育、レクリエーションと余暇、社会的帰属意識などがあります。
潜在変数法は、医学の多くの分野で用いられています。潜在変数法が自然と適用できる問題群の一つに、時間軸(例えば、参加者の年齢や研究開始時からの経過時間)が研究対象の特性と同期していない縦断研究があります。このような研究では、潜在変数を用いて、研究対象の特性と同期した観測不能な時間軸を、観測された時間軸の変換としてモデル化することができます。その例としては、疾患進行のモデリングや成長のモデリングなどが挙げられます(囲み記事参照)。
潜在変数を利用し、潜在変数が存在する状況下で推論を可能にする、さまざまなモデルクラスと手法が存在する。モデルには以下が含まれる。
分析および推論手法には以下が含まれる。
ベイズ統計学は、潜在変数を推論するためによく用いられる。