Multi-dimensional version of a confidence interval
統計学 において 、 信頼領域とは、 信頼区間 を 多次元的に 一般化したものです 。 二変量正規 分布の場合、信頼領域は 楕円( 誤差楕円 とも呼ばれます)となります。より一般的には、 n 次元空間における点の集合であり、多くの場合、問題の推定解となる点の周囲を囲む 超楕円体 として表されます が、他の形状となる場合もあります。
解釈 信頼領域は、一連の測定を複数回繰り返し、各測定セットについて同じ方法で信頼領域を計算した場合に、一定の割合(例えば95%)で、推定対象となる変数セットの「真の」値を表す点が信頼領域に含まれるように計算されます。ただし、 事前確率 に関する特定の仮定が ない 限り、1つの信頼領域を計算したからといって、その信頼領域内に「真の」値が含まれる確率が95%であるとは限りません。これは、「真の」値に特定の確率分布を仮定しておらず、それらの値がどこに位置する可能性があるかについて他の情報を持っているかどうかもわからないためです。
独立かつ同一に正規分布する誤差の場合 次の過剰決定問題の 解決策を見つけたとします。 β {\displaystyle {\boldsymbol {\beta }}}
Y = X β + ε {\displaystyle \mathbf {Y} =\mathbf {X} {\boldsymbol {\beta }}+{\boldsymbol {\varepsilon }}} ここで、 Y は 従属変数 の観測値を含む n 次元の列ベクトル、 X は 正確に既知であると仮定される 独立変数 の観測値の n 行 p 列の行列(物理モデルを表すことができる)、は推定される p 個 のパラメータを含む列ベクトル、は 平均がゼロでそれぞれが同じ未知の分散を持つ 正規分布 で 独立に分布して いると仮定される誤差の n 次元の列ベクトルです 。 β {\displaystyle {\boldsymbol {\beta }}} ε {\displaystyle {\boldsymbol {\varepsilon }}} σ 2 {\displaystyle \sigma ^{2}}
の要素に対する 100(1 − α )%の信頼区間は、次の不等式を満たすベクトル b の値の集合によって表される: [1] β {\displaystyle {\boldsymbol {\beta }}}
( β ^ − b ) T X T X ( β ^ − b ) ≤ p s 2 F 1 − α ( p , ν ) , {\displaystyle ({\boldsymbol {\hat {\beta }}}-\mathbf {b} )^{\operatorname {T} }\mathbf {X} ^{\operatorname {T} }\mathbf {X} ({\boldsymbol {\hat {\beta }}}-\mathbf {b} )\leq ps^{2}F_{1-\alpha }(p,\nu ),} ここで、変数 bは 信頼領域内の任意の点を表し、 p はパラメータの数、 すなわちベクトルの要素の数であり、 s 2 は、 の 不偏 推定値 で ある、 β , {\displaystyle {\boldsymbol {\beta }},} β ^ {\displaystyle {\boldsymbol {\hat {\beta }}}} σ 2 {\displaystyle \sigma ^{2}}
s 2 = ε T ε n − p . {\displaystyle s^{2}={\frac {\varepsilon ^{\operatorname {T} }\varepsilon }{n-p}}.} さらに、 F は F 分布 の 分位関数 で、 p と 自由度 、 は 統計的有意 水準、記号 は の 転置を 意味します 。 ν = n − p {\displaystyle \nu =n-p} α {\displaystyle \alpha } X T {\displaystyle X^{\operatorname {T} }} X {\displaystyle X}
この式は次のように書き直すことができます。
( β ^ − b ) T C β − 1 ( β ^ − b ) ≤ p F 1 − α ( p , ν ) , {\displaystyle ({\boldsymbol {\hat {\beta }}}-\mathbf {b} )^{\operatorname {T} }\mathbf {C} _{\mathbf {\beta } }^{-1}({\boldsymbol {\hat {\beta }}}-\mathbf {b} )\leq pF_{1-\alpha }(p,\nu ),} ここで 、 は の最小二乗スケール共分散行列です 。 C β = s 2 ( X T X ) − 1 {\displaystyle \mathbf {C} _{\mathbf {\beta } }=s^{2}\left(\mathbf {X} ^{\operatorname {T} }\mathbf {X} \right)^{-1}} β ^ {\displaystyle {\boldsymbol {\hat {\beta }}}}
上記の不等式は、 p 次元直交座標パラメータ空間R p における 楕円体 領域を定義する。楕円体の中心は推定値 にある。Pressらによれば、 特異値分解 を 行った後に楕円体をプロットすると、より容易になる。楕円体の軸の長さは 対角行列 の対角線上の値の逆数に比例し 、これらの軸の方向は分解の3番目の行列の行によって与えられる。 β ^ {\displaystyle {\boldsymbol {\hat {\beta }}}}
加重最小二乗法と一般化最小二乗法 ここで、 のいくつかの異なる要素が 既知の非ゼロ 共分散を 持つ(つまり、観測値の誤差が独立に分布していない)、および/または誤差の標準偏差がすべて等しくない、より一般的なケースを考えてみましょう。 の共分散行列が であるとします。 ここ で、 V は n 行 n 列の非特異行列で、前のセクションで扱ったより具体的なケースで は と等しかったものです(ここで、 I は 単位行列 )。しかし、ここでは は、個々の観測値のペアの共分散を表す非ゼロの非対角要素を持つことが許されています。また、すべての対角要素が必ずしも等しいとは限りません。 ε {\displaystyle {\boldsymbol {\varepsilon }}} ε {\displaystyle {\boldsymbol {\varepsilon }}} V σ 2 {\displaystyle \mathbf {V} \sigma ^{2}} I {\displaystyle \mathbf {I} }
[2] 非特異対称行列 Pが 次のように 定義される。
P ′ P = P P = V {\displaystyle \mathbf {P} ^{\prime }\mathbf {P} =\mathbf {P} \mathbf {P} =\mathbf {V} } 実際には、 Pは共分散行列 V の平方根です 。
最小二乗問題
Y = X β + ε {\displaystyle \mathbf {Y} =\mathbf {X} {\boldsymbol {\beta }}+{\boldsymbol {\varepsilon }}} 次に、各項にP の逆数を左乗算することで変換し 、新しい問題定式化を形成する。
Z = Q β + f , {\displaystyle \mathbf {Z} =\mathbf {Q} {\boldsymbol {\beta }}+\mathbf {f} ,} どこ
Z = P − 1 Y {\displaystyle \mathbf {Z} =\mathbf {P} ^{-1}\mathbf {Y} } Q = P − 1 X {\displaystyle \mathbf {Q} =\mathbf {P} ^{-1}\mathbf {X} } そして f = P − 1 ε {\displaystyle \mathbf {f} =\mathbf {P} ^{-1}{\boldsymbol {\varepsilon }}} パラメータ、すなわち要素の結合信頼領域は、 次式で与えられる楕円体によって囲まれる: [3] β {\displaystyle {\boldsymbol {\beta }}}
( b − β ^ ) ′ Q ′ Q ( b − β ^ ) = p n − p ( Z ′ Z − b ′ Q ′ Z ) F 1 − α ( p , n − p ) . {\displaystyle (\mathbf {b} -{\boldsymbol {\hat {\beta }}})^{\prime }\mathbf {Q} ^{\prime }\mathbf {Q} (\mathbf {b} -{\boldsymbol {\hat {\beta }}})={\frac {p}{n-p}}(\mathbf {Z} ^{\prime }\mathbf {Z} -\mathbf {b} ^{\prime }\mathbf {Q} ^{\prime }\mathbf {Z} )F_{1-\alpha }(p,n-p).} ここで、 F は F 分布 のパーセンテージ ポイントを表し 、量 p と np は、この分布のパラメーターである 自由度 です。
非線形問題 信頼領域は、任意の確率分布に対して定義できます。実験者は有意水準と領域の形状を選択し、領域の大きさは確率分布によって決定されます。自然な選択としては、定数 ( カイ二乗 )値を持つ点の集合を境界として用いることが挙げられます。 χ 2 {\displaystyle \chi ^{2}}
一つのアプローチは、非線形モデルに線形近似 を用いることです 。これは解の近傍では近似値に近い可能性があります。そして、線形問題に対する解析を適用して近似的な信頼領域を求めます。信頼領域がそれほど大きくなく、モデルの2次導関数もそれほど大きくない場合、これは合理的なアプローチとなる可能性があります。
ブートストラップ アプローチも使用できる。 [4]
参照
注記 ^ ドレイパーとスミス(1981年、94ページ) ^ ドレイパーとスミス(1981年、108ページ) ^ ドレイパーとスミス(1981年、109ページ) ^ Hutton TJ, Buxton BF, Hammond P, Potts HWW (2003). カーネルスムージングを用いた形状空間における平均成長軌道の推定. IEEE Transactions on Medical Imaging , 22 (6):747-53
参考文献 Draper, NR; H. Smith (1981) [1966]. 応用回帰分析 (第2版). 米国: John Wiley and Sons Ltd. ISBN 0-471-02995-5 。 Press, WH; SA Teukolsky; WT Vetterling; BP Flannery (1992) [1988]. Numerical Recipes in C: The Art of Scientific Computing (第2版). Cambridge UK: Cambridge University Press. ISBN 978-0-521-43720-2 。