48
重回帰モデル
重回帰モデルにおけるモデル全体のF検定と、個別の偏回帰係数のt検定の違いを理解し、それぞれの帰無仮説・検定統計量・自由度・棄却域を説明できるようになる。
重回帰モデルでも考え方の出発点は同じ
このレクチャーでは、 重回帰モデル における仮説検定を見ていきます。
重回帰モデルでも、 単回帰モデルと基本的な考え方は同じです。
母集団には、 本当に知りたい回帰関係があり、 そこから誤差をともなって標本データが観測されると考えます。
重回帰では、 説明変数が複数あるため、 回帰関係を2次元上の1本の直線として描くことはできません。
ただし、 標本から推定したモデルを使って、母集団の真のモデルについて推測する という考え方は単回帰と同じです。
重回帰モデルでは2種類の仮説検定を考える
重回帰モデルでは、 偏回帰係数が複数あります。
そのため、 仮説検定も大きく2種類に分かれます。
モデル全体として \(y\) を説明する力があるか を検定します。
他の説明変数を固定したうえで効果があるか を検定します。
個別の偏回帰係数を見るのがt検定。
重回帰モデルの基本式と誤差の仮定
まず、 重回帰モデルそのものを確認しておきましょう。
ここで、
という誤差の仮定を置きます。
さらに、 各誤差は互いに独立で、 同じ分散 \(\sigma^2\) をもつと考えます。
単回帰モデルと同様に、 誤差項 \(\varepsilon_i\) の確率分布を仮定することで、 モデル全体や偏回帰係数について 確率的な仮説検定を行えるようになります。
手順0:モデル全体の有意性について帰無仮説を立てる
まず、 回帰モデル全体の有意性 を検定します。
このときの帰無仮説は、
です。
つまり、 すべての偏回帰係数が0 という世界を仮定します。
\(y\) の説明に効果がない
この帰無仮説を棄却できれば、
=
少なくとも1つの説明変数には \(y\) を説明する効果がある
手順1:\(S_e\) と \(S_R\) をカイ二乗分布に整理する
誤差が正規分布にしたがうという仮定を使うと、 2つの平方和について カイ二乗分布にしたがう形を作ることができます。
ここで、 \(S_e\) は モデルで説明できずに残った変動、 \(S_R\) は 回帰モデルによって説明できた変動 です。
\(S_R/\sigma^2\sim\chi^2(p)\) という整理は、 ここで検定している \(H_0:\beta_1=\cdots=\beta_p=0\) のもとで考えています。
平方和だけでなく自由度も分解できる
ここで、 \(S_R\) の自由度が なぜ \(p\) になるのか確認しておきましょう。
まず、 これまで見てきた平方和の分解は、
でした。
つまり、 \(y\) 全体の変動は、
\(S_R\)
\(S_e\)
に分かれています。
そして、 平方和がこのように分解されるのに対応して、 自由度も同じように分解できます。
自由度 \[ n-1 \]
自由度 \[ p \]
自由度 \[ n-p-1 \]
全平方和 \(S_y\) の自由度は \(n-1\)、 残差平方和 \(S_e\) の自由度は \(n-p-1\) でした。
したがって、 残った回帰平方和 \(S_R\) の自由度は、
と導かれます。
なお、 残差平方和の自由度が \(n-p-1\) なのは、 \(p\) 個の偏回帰係数と 1個の定数項を標本から推定しているためでした。
手順2:平均平方和の比をとるとF分布になる
手順1では、 回帰平方和 \(S_R\) と 残差平方和 \(S_e\) について、
と整理しました。
さらに、 正規線形モデルのもとでは、 この2つの平方和 \(S_R\) と \(S_e\) は互いに独立 です。
① それぞれがカイ二乗分布にしたがう
② その2つが互いに独立である
この2つがそろうことで、 それぞれを自由度で割った値の比が F分布にしたがいます。
そこで、 それぞれの平方和を 自由度で割って 平均平方和 にします。
したがって、 Fが大きいということは、 残差として残った変動に比べて、 回帰モデルが説明できた変動が大きい ということになります。
F分布では、 1つ目に分子の自由度 \(p\)、
2つ目に分母の自由度 \(n-p-1\) がきます。
\[ F(p,n-p-1) \] の順番を逆にしないようにしましょう。
手順3:モデル全体のF検定は上側だけを見る
有意水準を \(\alpha=0.05\) としてみましょう。
今回知りたいのは、 回帰による変動 \(S_R\) が 帰無仮説のもとで想定されるより 有意に大きいか です。
F統計量では \(S_R\) が分子にあるため、 Fが大きいほど モデルの説明力が強い方向になります。
なら、 帰無仮説を棄却します。
次は個別の偏回帰係数を検定する
ここまでは、 重回帰モデル全体として 有意性があるかを検定しました。
次は、 個別の説明変数に効果があるか を見ていきます。
・\(x_1\) の効果は本当にあるのか
・\(x_2\) の効果は本当にあるのか
は別々に確認する必要があります。
手順0:個別の偏回帰係数について帰無仮説を立てる
個別の偏回帰係数 \(\beta_j\) については、
と設定します。
これは、 他の説明変数を固定したときに、 \(x_j\) が \(y\) に線形な効果をもつか を検定することになります。
手順1:\(\hat\beta_j\) も標本によって変動する
単回帰モデルの回帰係数と同じように、 重回帰モデルの偏回帰係数 \(\hat\beta_j\) も標本から計算される値です。
したがって、 標本を取り直せば \(\hat\beta_j\) の値も変わります。
誤差が正規分布にしたがうことを使うと、
と整理できます。
つまり、 \(\hat\beta_j\) は 真の偏回帰係数 \(\beta_j\) を中心として変動します。
手順2:標準誤差で割るとt分布になる
前のSTEPで、 偏回帰係数の推定値 \(\hat\beta_j\) は標本によって変動し、
と整理しました。
もし \(\hat\beta_j\) の真の標準偏差
がわかっていれば、 \(\hat\beta_j\) を標準化して、
とできます。
ただし実際には、 誤差分散 \(\sigma^2\) が未知であるため、 \(\hat\beta_j\) の真の標準偏差もわかりません。
そこで、 標本データから推定した 偏回帰係数の標準誤差
を代わりに使います。
\(\hat\beta_j\) がどの程度ばらつくか
を標本データから推定したもの
つまり、 標準誤差が小さいほど \(\hat\beta_j\) の推定は安定しており、 大きいほど標本によるブレが大きい、 ということになります。
\(se(\hat\beta_j)\) は、 単に残差の大きさだけでなく、 説明変数のばらつき方や、 説明変数どうしの関係 にも影響されます。
そして、 真の標準偏差の代わりに \(se(\hat\beta_j)\) を使うことで、
と整理できます。
さらに、 今回の帰無仮説
のもとでは、 分子の \(\beta_j\) に0を代入できるので、
となります。
なぜt分布の自由度は \(n-p-1\) なのか
偏回帰係数の標準誤差 \(se(\hat\beta_j)\) は、 誤差分散 \(\sigma^2\) を 残差から推定して計算します。
その中心となるのが、
です。
手順3:個別の偏回帰係数は両側t検定で判定する
ここでは、 対立仮説を
としているため、 両側検定になります。
有意水準を \(\alpha=0.05\) とすると、 左右2.5%ずつを棄却域にします。
なら、 帰無仮説 \(H_0:\beta_j=0\) を棄却します。
F検定とt検定を並べて整理する
各説明変数を個別に見たいならt検定。
重回帰モデルの仮説検定を整理する
① 重回帰でも誤差項の正規性が推測の土台になる
② モデル全体はF検定で調べる
③ 個別の偏回帰係数はt検定で調べる
④ 残差の自由度は \(n-p-1\)
その2つに対応するのが、 F検定とt検定です。
次のステップ:統計検定®2級を目指す
このサイトで統計学の基礎を学んだあと、 統計検定®2級の合格まで体系的に学びたい方へ。
統計検定®2級対策講座【ベストセラー版】
約9時間の動画講義と200問以上の小テストに加えて、 模擬試験にも取り組めます。 講座内ではQ&Aも利用でき、 これまでに400問以上の質問に回答してきました。
記述統計・確率・推定・検定を基礎から学ぶ 「統計学ベーシック講座その1『確率分布・推定・検定』」 も用意しています。
統計学ベーシック講座を見る →