意味 べき変換は、べきパラメータλの連続関数として定義され、通常は特異点 ( λ = 0)で連続となるように区分的に与えられます。各y i > 0 であるデータベクトル ( y 1 ,..., y n )の場合、べき変換は次のようになります。
y 私 ( λ ) = { y 私 λ − 1 λ ( GM ( y ) ) λ − 1 、 もし λ ≠ 0 GM ( y ) ln y 私 、 もし λ = 0 {\displaystyle y_{i}^{(\lambda )}={\begin{cases}{\dfrac {y_{i}^{\lambda }-1}{\lambda (\operatorname {GM} (y))^{\lambda -1}}},&{\text{if }}\lambda \neq 0\\[12pt]\operatorname {GM} (y)\ln {y_{i}},&{\text{if }}\lambda =0\end{cases}}} どこ
GM ( y ) = ( ∏ 私 = 1 n y 私 ) 1 n = y 1 y 2 ⋯ y n n {\displaystyle \operatorname {GM} (y)=\left(\prod _{i=1}^{n}y_{i}\right)^{\frac {1}{n}}={\sqrt[{n}]{y_{1}y_{2}\cdots y_{n}}}\,} は、観測値y 1 、...、y n の幾何平均 です。 λ = 0 {\displaystyle \lambda =0} 限界はλ {\displaystyle \lambda } 0に近づく。これを確認するには、次の点に注目してください。y 私 λ = exp ( λ ln ( y 私 ) ) = 1 + λ ln ( y 私 ) + O ( ( λ ln ( y 私 ) ) 2 ) {\displaystyle y_{i}^{\lambda }=\exp({\lambda \ln(y_{i})})=1+\lambda \ln(y_{i})+O((\lambda \ln(y_{i}))^{2})} -テイラー級数 を使用します。y 私 λ − 1 λ = ln ( y 私 ) + O ( λ ) {\displaystyle {\dfrac {y_{i}^{\lambda }-1}{\lambda }}=\ln(y_{i})+O(\lambda )} 、そしてそれ以外すべてln ( y 私 ) {\displaystyle \ln(y_{i})} 無視できるほどになるλ {\displaystyle \lambda } 十分に小さい。
分母に幾何平均の( λ − 1) 乗を含めることで、を含むあらゆる方程式の科学的解釈が簡素化されます。 y 私 ( λ ) \displaystyle y_{i}^{(\lambda )}} なぜなら、 λ が変化しても測定単位は変化しないからである。
Box とCox (1964)は、まず再スケーリングされたべき変換のヤコビアンを 含めることによって、幾何平均をこの変換に導入した。
y λ − 1 λ 。 \displaystyle {\frac {y^{\lambda }-1}{\lambda }}.} 尤度に基づいて、このヤコビアンは次のようになります。
J ( λ ; y 1 、 … 、 y n ) = ∏ 私 = 1 n | d y 私 ( λ ) / d y | = ∏ 私 = 1 n y 私 λ − 1 = GM ( y ) n ( λ − 1 ) {\displaystyle J(\lambda ;y_{1},\ldots ,y_{n})=\prod _{i=1}^{n}|dy_{i}^{(\lambda )}/dy|=\prod _{i=1}^{n}y_{i}^{\lambda -1}=\operatorname {GM} (y)^{n(\lambda -1)}} これにより、通常の対数尤度が最大となる場合 、次のように表すことができます。
ログ ( L ( μ ^ 、 σ ^ ) ) = ( − n / 2 ) ( ログ ( 2 π σ ^ 2 ) + 1 ) + n ( λ − 1 ) ログ ( GM ( y ) ) = ( − n / 2 ) ( ログ ( 2 π σ ^ 2 / GM ( y ) 2 ( λ − 1 ) ) + 1 ) 。 {\displaystyle {\begin{aligned}\log({\mathcal {L}}({\hat {\mu }},{\hat {\sigma }}))&=(-n/2)(\log(2\pi {\hat {\sigma }}^{2})+1)+n(\lambda -1)\log(\operatorname {GM} (y))\\[5pt]&=(-n/2)(\log(2\pi {\hat {\sigma }}^{2}/\operatorname {GM} (y)^{2(\lambda -1)})+1).\end{aligned}}} ここから吸収してGM ( y ) 2 ( λ − 1 ) \displaystyle \operatorname {GM} (y)^{2(\lambda -1)}} 表現にσ ^ 2 {\displaystyle {\hat {\sigma }}^{2}} 残差 の二乗和を最小化する式を生成するy 私 ( λ ) \displaystyle y_{i}^{(\lambda )}} これは、からの偏差の正規対数 尤度の合計を最大化することと同等である。( y λ − 1 ) / λ {\displaystyle (y^{\lambda }-1)/\lambda } そして、変換のヤコビアン行列の対数。
λが任意の値の場合、 Y = 1における値は0であり、その値におけるY に関する導関数は λ が任意の値の場合1である。Yは 、何らかの平均値でY = 1となるようにスケーリングされた、他の変数のバージョンである場合もある。
この変換はべき変換の一種ですが、 λ = 0においてパラメータλと 連続に なるように行われます。計量経済学 を含む回帰分析 において広く用いられています。
ボックスとコックスは、シフトパラメータを組み込んだ、より一般的な変換形式も提案した。
τ ( y 私 ; λ 、 α ) = { ( y 私 + α ) λ − 1 λ ( GM ( y + α ) ) λ − 1 もし λ ≠ 0 、 GM ( y + α ) ln ( y 私 + α ) もし λ = 0 、 {\displaystyle \tau (y_{i};\lambda ,\alpha )={\begin{cases}{\dfrac {(y_{i}+\alpha )^{\lambda }-1}{\lambda (\operatorname {GM} (y+\alpha ))^{\lambda -1}}}&{\text{if }}\lambda \neq 0,\\\\\operatorname {GM} (y+\alpha )\ln(y_{i}+\alpha )&{\text{if }}\lambda =0,\end{cases}}} これは、すべてのiに対して y i + α > 0が成り立つ場合に成立します。τ( Y , λ, α)が切断正規分布 に従う場合、Y は Box–Cox 分布 に従うと言われます。
BickelとDoksumは、変換の範囲をすべてのyに拡張することで、 切り捨て分布 を使用する必要性を排除しました。その方法は以下のとおりです。
τ ( y 私 ; λ 、 α ) = { サイン ( y 私 + α ) | y 私 + α | λ − 1 λ ( GM ( y + α ) ) λ − 1 もし λ ≠ 0 、 GM ( y + α ) サイン ( y + α ) ln ( y 私 + α ) もし λ = 0 、 {\displaystyle \tau (y_{i};\lambda ,\alpha )={\begin{cases}{\dfrac {\operatorname {sgn} (y_{i}+\alpha )|y_{i}+\alpha |^{\lambda }-1}{\lambda (\operatorname {GM} (y+\alpha ))^{\lambda -1}}}&{\text{if }}\lambda \neq 0,\\\\\operatorname {GM} (y+\alpha )\operatorname {sgn} (y+\alpha )\ln(y_{i}+\alpha )&{\text{if }}\lambda =0,\end{cases}}} ここで、sgn(.)は符号関数 です。この定義の変更は、以下の限り実際的な意味はほとんどありません。α {\displaystyle \alpha } より小さいミニ ( y 私 ) {\displaystyle \operatorname {min} (y_{i})} 通常はそうである。[ 5 ]
BickelとDoksumは、適切な正則条件の下ではパラメータ推定値が一致性 があり漸近的に正規であることを証明したが、パラメータ値がノイズ分散に比べて小さい場合、標準的な Cramér–Rao下限は 分散を大幅に過小評価する可能性がある。[ 5 ] しかし、この分散の過小評価の問題は、多くのアプリケーションでは実質的な問題ではないかもしれない。[ 6 ] [ 7 ]
1パラメータのBox–Cox変換は次のように定義される。
y 私 ( λ ) = { y 私 λ − 1 λ もし λ ≠ 0 、 ln y 私 もし λ = 0 、 {\displaystyle y_{i}^{(\lambda )}={\begin{cases}{\dfrac {y_{i}^{\lambda }-1}{\lambda }}&{\text{if }}\lambda \neq 0,\\\ln y_{i}&{\text{if }}\lambda =0,\end{cases}}} そして2パラメータBox–Cox変換は
y 私 ( λ ) = { ( y 私 + λ 2 ) λ 1 − 1 λ 1 もし λ 1 ≠ 0 、 ln ( y 私 + λ 2 ) もし λ 1 = 0 、 {\displaystyle y_{i}^{({\boldsymbol {\lambda }})}={\begin{cases}{\dfrac {(y_{i}+\lambda _{2})^{\lambda _{1}}-1}{\lambda _{1}}}&{\text{if }}\lambda _{1}\neq 0,\\\ln(y_{i}+\lambda _{2})&{\text{if }}\lambda _{1}=0,\end{cases}}} 原著論文に記載されているとおりである。[ 8 ] [ 9 ] さらに、最初の変換は以下に対して成り立つ。y 私 > 0 {\displaystyle y_{i}>0} 2番目はy 私 > − λ 2 {\displaystyle y_{i}>-\lambda _{2}} [ 8 ]
パラメータλ {\displaystyle \lambda } プロファイル尤度 関数と適合度検定を用いて推定される。 [ 10 ]
信頼区間 Box–Cox変換の信頼区間は、プロファイル尤度 関数に関するWilksの定理を使用して漸近的に構築し 、すべての可能な値を求めることができます。λ {\displaystyle \lambda } 以下の制約を満たすもの: [ 11 ]
ln ( L ( λ ) ) ≥ ln ( L ( λ ^ ) ) − 1 2 χ 2 1 、 1 − α 。 {\displaystyle \ln {\big (}L(\lambda ){\big )}\geq \ln {\big (}L({\hat {\lambda }}){\big )}-{\frac {1}{2}}{\chi ^{2}}_{1,1-\alpha }.}
例 BUPA肝臓データセット[ 12 ] には、肝酵素ALT とγGT のデータが含まれています。log(γGT)を使用してALTを予測することに関心があるとします。データのプロットは図のパネル(a)に示されています。分散が一定ではないようで、Box-Cox変換が役立つかもしれません。
べき乗パラメータの対数尤度はパネル(b)に示されています。水平基準線は最大値からχ 1 2 /2の距離にあり、λのおおよその95%信頼区間を読み取るために使用できます。ゼロに近い値が良いと思われるので、対数を取ります。
対数変換にシフトパラメータを追加することで、変換精度が向上する可能性がある。図のパネル(c)は対数尤度を示している。この場合、尤度の最大値はゼロに近いことから、シフトパラメータは不要であることが示唆される。最後のパネルは、変換後のデータに回帰直線を重ねて表示したものである。
Box-Cox変換はモデルの適合度を大幅に向上させることができますが、変換では解決できない問題もいくつかあります。今回の例では、データが裾野の広い分布を示しているため、正規分布を仮定することは現実的ではなく、ロバスト回帰 アプローチを用いることでより精度の高いモデルが得られます。
計量経済学への応用 経済学者はしばしば、生産関係をボックス・コックス変換の何らかの変形によって特徴づける。[ 13 ]
生産量Q を、資本ストックK によって提供されるサービスと労働時間N に依存するものとして表現する一般的な方法を考えてみましょう。
τ ( Q ) = α τ ( K ) + ( 1 − α ) τ ( N ) 。 {\displaystyle \tau (Q)=\alpha \tau (K)+(1-\alpha )\tau (N).\,} Box–Cox変換を反転させてQ を求めると、次のようになる。
Q = ( α K λ + ( 1 − α ) N λ ) 1 / λ 、 {\displaystyle Q={\big (}\alpha K^{\lambda }+(1-\alpha )N^{\lambda }{\big )}^{1/\lambda },\,} これは定弾性代替 (CES)生産関数 として知られています。
CES生産関数は、1次の同次関数である。
λ = 1の場合、線形生産関数が得られます。
Q = α K + ( 1 − α ) N 。 {\displaystyle Q=\alpha K+(1-\alpha )N.\,} λ → 0の場合、有名なコブ・ダグラス 生産関数が得られます。
Q = K α N 1 − α 。 {\displaystyle Q=K^{\alpha }N^{1-\alpha }.\,}
ボックス・ティドウェル変換は、一般化線形モデル 、特にロジスティック回帰 において、予測変数とロジット 間の非線形性を評価し、補正するために用いられる統計的手法です。この変換は、独立変数と結果変数の関係が非線形であり、標準モデルでは適切に捉えられない場合に有効です。
概要 Box-Tidwell変換は、従属変数に適用されるBox-Cox変換 の拡張として、 George EP Box とPaul W. Tidwellによって1962年に開発されました。しかし、Box-Cox変換とは異なり、Box-Tidwell変換は回帰モデルにおいて独立変数に適用されます。予測変数と結果変数の間の線形性の仮定が満たされない場合によく用いられます。
方法 Box-Tidwell変換の基本的な考え方は、回帰モデルにおける各独立変数Xiにべき変換を適用することである。
X 私 ′ = X 私 λ {\displaystyle X_{i}'=X_{i}^{\lambda }}
どこλ {\displaystyle \lambda } はデータから推定されたパラメータです。Box-Tidwell変換が1と有意に異なる場合、これはXiとロジットの間に非線形関係があることを示しており、この変換によってモデルの適合性が向上します。
Box-Tidwell検定は通常、回帰モデルに次のような項を追加することによって実行されます。X 私 ログ ( X 私 ) {\displaystyle X_{i}\log(X_{i})} そして、係数の有意性を検定します。有意性が認められた場合は、予測変数とロジットの間に線形関係を達成するために変換を適用する必要があることを示唆します。
アプリケーション
ロジスティック回帰における線形性の検証 ロジスティック回帰 において、重要な前提条件は、連続的な独立変数が従属変数のロジットと線形関係にあることです。この前提条件に違反すると、推定値の偏りやモデル性能の低下につながる可能性があります。ボックス・ティドウェル変換は、連続的な予測変数がロジットとの線形性を達成するために変換を必要とするかどうかを判断することで、このような違反を評価し修正するために使用される手法です。
直線性検証方法 Box-Tidwell変換は、各連続変数X i とその自然対数との間に相互作用項を導入する。ログ ( X 私 ) {\displaystyle \log(X_{i})} :
X 私 ログ ( X 私 ) {\displaystyle X_{i}\log(X_{i})}
この項は、ロジスティック回帰モデルに含まれており、 X i とロジットの関係が非線形であるかどうかを検証します。この交互作用項の係数が統計的に有意 である場合、線形性の仮定が満たされていないことを示し、予測変数の変換が必要であることを示唆します。Box-Tidwell変換は、関係を線形化するための適切なべき変換を提供し、モデルの精度と妥当性を向上させます。逆に、有意でない結果は、線形性の仮定を支持します。
制限事項 Box-Tidwell変換の限界の一つは、独立変数が正の値の場合にのみ有効である点です。データに負の値が含まれている場合、変数を修正(例えば定数項の追加)しない限り、この変換を直接適用することはできません。
電力変換は、さまざまな科学的および応用的な文脈において、異なる名称で現れる。
Box-Cox変換について は、上記で説明したとおりです。アルファ公平性 – フランク・ケリーとその共同研究者によって、ネットワーク効用最大化の研究において、α公平効用関数ファミリーとして導入された。[ 16 ] [ 17 ] Q指数族 – 標準指数族の一般化であり、指数関数をツァリス統計から導出されたq指数 形式に置き換える。[ 18 ]
注記 ↑ Gao, Peisheng; Wu, Weilin (2006). "Power Quality Disturbances Classification using Wavelet and Support Vector Machines". Sixth International Conference on Intelligent Systems Design and Applications . ISDA '06. Vol. 1. Washington, DC, USA: IEEE Computer Society. pp. 201–206 . doi : 10.1109/ISDA.2006.217 . ISBN 9780769525280 . S2CID 2444503 . ↑ Gluzman, S.; Yukalov, VI (2006-01-01). "外挿問題における自己相似べき変換". Journal of Mathematical Chemistry . 39 (1): 47– 56. arXiv : cond-mat/0606104 . Bibcode : 2006cond.mat..6104G . doi : 10.1007/s10910-005-9003-7 . ISSN 1572-8897 . S2CID 118965098 . ↑ Howarth, RJ; Earle, SAM (1979-02-01). "地球化学データへの一般化べき変換の適用". Journal of the International Association for Mathematical Geology . 11 (1): 45–62 . doi : 10.1007/BF01043245 . ISSN 1573-8868 . S2CID 121582755 . ↑ Peters, JL; Rushton, L.; Sutton, AJ; Jones, DR; Abrams, KR; Mugglestone, MA (2005). "疫学的および毒性学的証拠のクロスデザイン統合のためのベイズ法". Journal of the Royal Statistical Society, Series C . 54 : 159– 172. doi : 10.1111/j.1467-9876.2005.00476.x . S2CID 121909404 . 1 2 Bickel, Peter J. ; Doksum, Kjell A. (1981 年 6 月). 「変換の分析の再検討」. Journal of the American Statistical Association . 76 (374): 296– 311. doi : 10.1080/01621459.1981.10477649 . ↑ Sakia, RM (1992), "The Box–Cox transformation technique: a review", The Statistician , 41 (2): 169– 178, CiteSeerX 10.1.1.469.7176 , doi : 10.2307/2348250 , JSTOR 2348250 ↑ Li, Fengfei (2005年4月11日)、 Box–Cox変換の概要 (PDF) (スライドプレゼンテーション)、ブラジル、サンパウロ:サンパウロ大学、 2014年11月2日 取得 1 2 Box, George EP ; Cox, DR (1964). "変換の分析". Journal of the Royal Statistical Society, Series B . 26 (2): 211– 252. JSTOR 2984418 . MR 0192611 . ↑ ジョンストン、J. (1984). 計量経済学的方法 (第3 版). ニューヨーク:マグロウヒル. pp. 61–74 . ISBN 978-0-07-032685-9 。↑ Asar, O.; Ilk, O.; Dag, O. (2017). "適合度検定による Box-Cox べき変換パラメータの推定". Communications in Statistics - Simulation and Computation . 46 (1): 91– 105. arXiv : 1401.3812 . doi : 10.1080/03610918.2014.957839 . S2CID 41501327 . ↑アブラモビッチ 、 フェリックス;リトフ、ヤアコフ( 2013)。 統計理論:簡潔な入門 。CRC Press。pp. 121–122。ISBN 978-1-4398-5184-5 。↑ BUPA肝疾患データセット ↑ Zarembka, P. (1974). "計量経済学における変数の変換". Frontiers in Econometrics . New York: Academic Press. pp. 81–104 . ISBN 0-12-776150-0 。↑ 電力変換ファミリーグラフ、SOCRウェブページ ↑ Yeo, In-Kwon; Johnson, Richard A. (2000). "正規性または対称性を改善するための新しいべき変換のファミリー". Biometrika . 87 (4): 954– 959. doi : 10.1093/biomet/87.4.954 . JSTOR 2673623 . ↑ Kelly, FP; Maulloo, AK; Tan, DKH (1998). "通信ネットワークのレート制御: シャドウプライス、比例的公平性、安定性". Journal of the Operational Research Society . 49 (3): 237– 252. doi : 10.1057/palgrave.jors.2600523 . ↑ Pereira, CF; Menasché, DS; Zaverucha, G.; Paes, A.; Barbosa, VC (2025). "関係ドメインのためのインスタンスベース転移学習へのユーティリティ駆動型アプローチ". Machine Learning . 114 (11): 261. doi : 10.1007/s10994-025-06864-4 . ↑ Zhu, Lingwei; Shah, Haseeb; Wang, Han; Nagai, Yukie; White, Martha (2025). q-Exponential Family for Policy Optimization . Proceedings of the International Conference on Learning Representations (ICLR).
参考文献 Box, George EP ; Cox, DR (1964). 「変換の分析」. Journal of the Royal Statistical Society, Series B . 26 (2): 211– 252. JSTOR 2984418 . MR 0192611 . Carroll, RJ; Ruppert, D. (1981). 「予測とべき変換ファミリーについて」(PDF) . Biometrika . 68 (3): 609– 615. doi : 10.1093/biomet/68.3.609 . DeGroot, MH (1987). "ジョージ・ボックスとの対話" (PDF) . Statistical Science . 2 (3): 239– 258. doi : 10.1214/ss/1177013223 .Handelsman, DJ (2002). 「精子濃度およびその他の精液変数の分析のための最適なべき変換」. Journal of Andrology . 23 (5). Gluzman, S.; Yukalov, VI (2006). "外挿問題における自己相似べき変換". Journal of Mathematical Chemistry . 39 (1): 47–56 . arXiv : cond-mat/0606104 . Bibcode : 2006cond.mat..6104G . doi : 10.1007/s10910-005-9003-7 . S2CID 118965098 . Howarth, RJ; Earle, SAM (1979). 「地球化学データへの一般化べき変換の適用」. Journal of the International Association for Mathematical Geology . 11 (1): 45–62 . doi : 10.1007/BF01043245 . S2CID 121582755 . Box, GEP および Tidwell, PW (1962) 独立変数の変換。Technometrics、4、531-550。https ://doi.org/10.1080/00401706.1962.10490038 (別名 Box-Tidwell 変換)
外部リンク 西井良(2001)[1994] 「ボックス・コックス変換」、数学百科事典 、EMS Press (リンクを修正しました)サンフォード・ワイスバーグ、ヨー・ジョンソン電力変革