一般化関数線形モデル(GFLM )は、一般化線形モデル(GLM)の拡張であり、様々なタイプ(連続または離散)の単変量応答を、主に二乗可積分確率過程によって生成されるランダム軌跡である関数予測子に回帰させることができます。GLMと同様に、リンク関数は応答変数の期待値を線形予測子に関連付けます。GFLMの場合、これはランダム予測子関数のスカラー積を形成することによって得られます。滑らかなパラメータ関数関数線形回帰、関数ポアソン回帰、関数二項回帰、そして重要な関数ロジスティック回帰は、GFLM の特殊なケースです。GFLM の応用には、確率過程と関数データの分類と識別が含まれます。[ 1 ]
GFLMの重要な側面は、滑らかなパラメータ関数の推定と推論である。これは通常、無限次元関数予測子の次元削減によって得られる。一般的な方法は、予測関数を展開することである。L 2空間の正規直交基底において、二乗可積分関数のヒルベルト空間において、パラメータ関数を同じ基底で同時に展開します。この表現は、パラメータ関数の寄与を減らすための切り捨てステップと組み合わされます。線形予測子を有限個の回帰係数に縮小します。カルーネン・レーヴェ展開を用いる関数主成分分析(FPCA)は、この目的を達成するための一般的かつ簡潔な手法です。フーリエ展開やBスプライン展開などの他の直交展開も、次元削減ステップに利用できます。含まれる成分の数を選択するには、赤池情報量規準(AIC)を使用できます。分類アプリケーションでよく使用される別の基準として、交差検証予測誤差の最小化があります。予測プロセスの次元が削減されると、簡略化された線形予測子を使用して、GLMおよび準尤度推定手法により、有限次元の回帰係数の推定値を取得できます。これにより、パラメータ関数の推定値が得られます。GFLMにおいて。
予測関数は、通常、実数区間上の二乗可積分確率過程である。そして未知の滑らかなパラメータ関数は、上で二乗可積分であると仮定される。実測値が与えられた場合の上線形予測子は次のように与えられる。どこは中心化された予測プロセスであり、は切片として機能するスカラー値です。
結果は、通常、連続または離散のいずれかである実数値の確率変数です。多くの場合、 の条件付き分布は、予測プロセスが指数族内で指定されている場合。ただし、応答の分布の代わりに条件付き分散関数を指定する関数準尤度設定を考慮するだけでも十分です。条件付き平均の関数として、。
リンク機能は滑らかで可逆な関数であり、応答の条件付き平均を関連付けます。線形予測子を用いて関係式は次のように表される。。
必要な次元削減を実行するために、中心化された予測プロセス そしてパラメータ関数は次のように展開されます。
どこは関数空間の正規直交基底である。そのためどこもしそしてさもないと。
ランダム変数はそして係数としてのために。
そしてそして、、 それで。
基底関数の正規直交性からそこから直ちに次のことが導かれる。。
重要なステップは、近似することです。による適切に選択された切り捨て点の場合。
FPCAは、与えられた基底関数の数に対して、線形予測子の最も簡潔な近似値を提供する。これは、固有関数基底が他のどの基底関数セットよりも多くの変動を説明するためである。
有界な一次導関数を持つ微分可能なリンク関数の場合、-切り捨てモデル、つまり最初の項の合計に切り捨てられた線形予測子構成要素は、定数倍です。
切り捨て戦略のヒューリスティックな動機は、次の事実から生じる。これはコーシー・シュワルツの不等式の結果であり、最後の不等式の右辺が 0 に収束することに注目すると、両方ともそして有限である。
固有関数基底の特殊な場合、数列共分散カーネルの固有値のシーケンスに対応する。
データの場合独立同分布観測、設定、そして近似線形予測子は次のように表すことができます。手段に関連する。
主な目的は、パラメータ関数を推定することです。。
一度修正済みなので、標準的な GLM および準尤度法を使用できます。- 推定するための切り捨てモデル推定方程式またはスコア方程式を解くことによって
ベクトル値スコア関数は次のようになる。これはを通してそして。
GLMと同様に、方程式は回帰係数の推定値を得るために、ニュートン・ラフソン法(NR)、フィッシャースコアリング法(FS)、反復重み付き最小二乗法(IWLS)などの反復法を用いて解く。パラメータ関数の推定値が得られる正規リンク関数を使用する場合、これらの方法は同等です。
結果は文献で入手可能です-切り捨てモデルとしてこれらは、推定されたパラメトリック関数と真のパラメトリック関数との偏差に対する漸近推論、および回帰効果に対する漸近検定と漸近信頼領域を提供する。
応答変数与えられたが1パラメータ指数型分布族に従う場合、その確率密度関数または確率質量関数(場合による)は次のようになる。
一部の機能についてはそして、 どこは正準パラメータであり、は分散パラメータであり、通常は正の値であると仮定される。
標準的な設定では、指数型分布族の性質から、
したがってリンク関数として機能し、正準リンク関数と呼ばれます。
は対応する分散関数であり、分散パラメータ。
関数線形回帰は、関数データ解析で最も有用なツールの1つであり、応答変数が連続で、正規分布に従うと仮定されるGFLMの例です。分散関数は定数関数であり、リンク関数は恒等関数です。これらの仮定の下では、GFLMはFLRに帰着します。
正規性の仮定がない場合、一定の分散関数は準正規分布の手法を用いる動機となる。
応答変数が二値の結果、つまり0または1を持つ場合、分布は通常ベルヌーイとして選択され、よく使われるリンク関数としては、ロジット関数の逆関数であるexpit関数(関数ロジスティック回帰)とプロビット関数(関数プロビット回帰)があります。任意の累積分布関数Fは[0,1]の範囲を持ち、これは二項分布の平均の範囲であるため、リンク関数として選択できます。この文脈におけるもう1つのリンク関数は、非対称リンクである相補対数対数関数です。二値データの分散関数は次のように与えられます。ここで分散パラメータはは1とみなされるか、あるいは準尤度アプローチが用いられる。
GFLMのもう1つの特殊なケースは、結果がカウントである場合で、応答の分布はポアソン分布であると仮定されます。平均通常は線形予測子に関連付けられています対数リンク関数(正準リンク関数でもある)を介して、分散関数は次のようになります。ここで、分散パラメータはデータは1ですが、データが過分散している可能性がある場合は、準ポアソンアプローチが使用されます。
GFLM の拡張は、予測関数が複数ある場合について提案されています。[ 2 ]もう 1 つの一般化は、セミ パラメトリック準尤度回帰 (SPQR) [ 1 ]と呼ばれ 、リンク関数と分散関数が未知であり、データからノン パラメトリックに推定される状況を考慮しています。この状況は、例えばスライス逆回帰 (SIR) を使用した単一または複数のインデックス モデルでも処理できます。
この分野のもう1つの拡張は、関数一般化加法モデル(FGAM)[ 3 ]であり、これは一般化加法モデル(GAM)の一般化である。
どこはランダム予測関数の展開係数である。そしてそれぞれは推定する必要のある未知の滑らかな関数であり、。
一般的に、FGAM での推定には IWLS とバックフィッティングを組み合わせる必要があります。ただし、展開係数が関数主成分として得られる場合、場合によっては (例えばガウス予測関数)) それらは独立しており、その場合はバックフィッティングは不要であり、未知のパラメータ関数を推定するために一般的な平滑化手法を用いることができる。。

関数データ解析の分野で数多くの分析に用いられてきた一般的なデータセットは、地中海ミバエ(略してメドフライ)1000匹が死ぬまで毎日産む卵の数である。ここに示すグラフは、約600匹の雌ミバエ(生涯で少なくとも20個の卵を残す個体)の生後25日間の産卵軌跡を示しています。赤色の曲線は、25歳以降に産卵数が中央値より少ないハエを表し、青色の曲線は、25歳以降に産卵数が中央値より多いハエを表します。初期の産卵軌跡を予測因子とし、その後のハエの寿命を応答として、ミバエを長寿または短命に分類するという関連問題がGFLM [ 1 ]で研究されています。