スマホで統計学

48

重回帰モデル

重回帰モデルでは、複数の説明変数をまとめたモデル全体に説明力があるかを検定する方法と、それぞれの偏回帰係数に有意な効果があるかを検定する方法があります。このレクチャーでは、誤差項の正規性を前提として、F分布によるモデル全体の検定と、t分布による個別の偏回帰係数の検定を整理します。
このページのゴール

重回帰モデルにおけるモデル全体のF検定と、個別の偏回帰係数のt検定の違いを理解し、それぞれの帰無仮説・検定統計量・自由度・棄却域を説明できるようになる。

STEP 01

重回帰モデルでも考え方の出発点は同じ

このレクチャーでは、 重回帰モデル における仮説検定を見ていきます。

重回帰モデルでも、 単回帰モデルと基本的な考え方は同じです。

母集団には、 本当に知りたい回帰関係があり、 そこから誤差をともなって標本データが観測されると考えます。

単回帰でも重回帰でも基本構造は同じ
母集団の真の回帰モデル
↓ 誤差をともなって観測
標本データ
↓ 最小二乗法
標本から推定された重回帰式

重回帰では、 説明変数が複数あるため、 回帰関係を2次元上の1本の直線として描くことはできません。

ただし、 標本から推定したモデルを使って、母集団の真のモデルについて推測する という考え方は単回帰と同じです。

STEP 02

重回帰モデルでは2種類の仮説検定を考える

重回帰モデルでは、 偏回帰係数が複数あります。

そのため、 仮説検定も大きく2種類に分かれます。

① モデル全体の有意性
複数の説明変数をまとめて見たときに、
モデル全体として \(y\) を説明する力があるか を検定します。
② 個別の偏回帰係数の有意性
それぞれの説明変数について、
他の説明変数を固定したうえで効果があるか を検定します。
まず区別する
モデル全体を見るのがF検定。
個別の偏回帰係数を見るのがt検定。
STEP 03

重回帰モデルの基本式と誤差の仮定

まず、 重回帰モデルそのものを確認しておきましょう。

\[ Y_i = \beta_0 + \beta_1x_{1i} + \cdots + \beta_px_{pi} + \varepsilon_i \]

ここで、

\[ \varepsilon_i \sim N(0,\sigma^2) \]

という誤差の仮定を置きます。

さらに、 各誤差は互いに独立で、 同じ分散 \(\sigma^2\) をもつと考えます。

重回帰モデルの推測の土台

単回帰モデルと同様に、 誤差項 \(\varepsilon_i\) の確率分布を仮定することで、 モデル全体や偏回帰係数について 確率的な仮説検定を行えるようになります。
STEP 04

手順0:モデル全体の有意性について帰無仮説を立てる

まず、 回帰モデル全体の有意性 を検定します。

このときの帰無仮説は、

\[ H_0: \beta_1 = \beta_2 = \cdots = \beta_p = 0 \]

です。

つまり、 すべての偏回帰係数が0 という世界を仮定します。

\[ \beta_1=0,\quad \beta_2=0,\quad \cdots,\quad \beta_p=0 \]
どの説明変数も
\(y\) の説明に効果がない

この帰無仮説を棄却できれば、

少なくとも1つの偏回帰係数は0ではない

少なくとも1つの説明変数には \(y\) を説明する効果がある
モデル全体の検定
「すべての偏回帰係数が0」 という世界を棄却できるかを見る。
STEP 05

手順1:\(S_e\) と \(S_R\) をカイ二乗分布に整理する

誤差が正規分布にしたがうという仮定を使うと、 2つの平方和について カイ二乗分布にしたがう形を作ることができます。

残差平方和
\[ \frac{S_e}{\sigma^2} \sim \chi^2(n-p-1) \]
回帰による平方和
\[ \frac{S_R}{\sigma^2} \sim \chi^2(p) \]

ここで、 \(S_e\) は モデルで説明できずに残った変動、 \(S_R\) は 回帰モデルによって説明できた変動 です。

注意
\(S_R/\sigma^2\sim\chi^2(p)\) という整理は、 ここで検定している \(H_0:\beta_1=\cdots=\beta_p=0\) のもとで考えています。
STEP 06

平方和だけでなく自由度も分解できる

ここで、 \(S_R\) の自由度が なぜ \(p\) になるのか確認しておきましょう。

まず、 これまで見てきた平方和の分解は、

\[ S_y = S_R + S_e \]

でした。

つまり、 \(y\) 全体の変動は、

回帰モデルによって説明できた変動
\(S_R\)
回帰モデルで説明できずに残った変動
\(S_e\)

に分かれています。

そして、 平方和がこのように分解されるのに対応して、 自由度も同じように分解できます。

全平方和 \(S_y\)
自由度 \[ n-1 \]
回帰平方和 \(S_R\)
自由度 \[ p \]
残差平方和 \(S_e\)
自由度 \[ n-p-1 \]

全平方和 \(S_y\) の自由度は \(n-1\)、 残差平方和 \(S_e\) の自由度は \(n-p-1\) でした。

したがって、 残った回帰平方和 \(S_R\) の自由度は、

\[ p = (n-1)-(n-p-1) \]

と導かれます。

なお、 残差平方和の自由度が \(n-p-1\) なのは、 \(p\) 個の偏回帰係数と 1個の定数項を標本から推定しているためでした。

自由度の分解
平方和の分解 \[ S_y=S_R+S_e \] に対応して、自由度も \[ n-1 = p + (n-p-1) \] と分解できます。
STEP 07

手順2:平均平方和の比をとるとF分布になる

手順1では、 回帰平方和 \(S_R\) と 残差平方和 \(S_e\) について、

\[ \frac{S_R}{\sigma^2} \sim \chi^2(p) \]
\[ \frac{S_e}{\sigma^2} \sim \chi^2(n-p-1) \]

と整理しました。

さらに、 正規線形モデルのもとでは、 この2つの平方和 \(S_R\) と \(S_e\) は互いに独立 です。

F分布につなげるためのポイント

① それぞれがカイ二乗分布にしたがう
② その2つが互いに独立である

この2つがそろうことで、 それぞれを自由度で割った値の比が F分布にしたがいます。

そこで、 それぞれの平方和を 自由度で割って 平均平方和 にします。

\[ F = \frac{S_R/p} {S_e/(n-p-1)} \sim F(p,n-p-1) \]
分子 \[ \frac{S_R}{p} \] 回帰モデルによって説明できた変動を、 自由度 \(p\) で平均したもの
分母 \[ \frac{S_e}{n-p-1} \] 回帰モデルで説明できずに残った変動を、 自由度 \(n-p-1\) で平均したもの

したがって、 Fが大きいということは、 残差として残った変動に比べて、 回帰モデルが説明できた変動が大きい ということになります。

自由度の順番にも注意

F分布では、 1つ目に分子の自由度 \(p\)
2つ目に分母の自由度 \(n-p-1\) がきます。

\[ F(p,n-p-1) \] の順番を逆にしないようにしましょう。
手順2の結論
独立な2つのカイ二乗変数を、 それぞれの自由度で割って比をとることで、 F統計量を作ることができます。
STEP 08

手順3:モデル全体のF検定は上側だけを見る

有意水準を \(\alpha=0.05\) としてみましょう。

今回知りたいのは、 回帰による変動 \(S_R\) が 帰無仮説のもとで想定されるより 有意に大きいか です。

F統計量では \(S_R\) が分子にあるため、 Fが大きいほど モデルの説明力が強い方向になります。

上側5%
\[ F_{\mathrm{obs}} \ge F_{0.05}(p,n-p-1) \]

なら、 帰無仮説を棄却します。

F検定は上側
関心があるのは 「回帰による変動が大きすぎるか」なので、 棄却域はF分布の上側だけに置く。
STEP 09

次は個別の偏回帰係数を検定する

ここまでは、 重回帰モデル全体として 有意性があるかを検定しました。

次は、 個別の説明変数に効果があるか を見ていきます。

たとえば
\[ \hat y = 5.29 + 0.39x_1 – 0.52x_2 \]
モデル全体が有意でも、
・\(x_1\) の効果は本当にあるのか
・\(x_2\) の効果は本当にあるのか
は別々に確認する必要があります。
STEP 10

手順0:個別の偏回帰係数について帰無仮説を立てる

個別の偏回帰係数 \(\beta_j\) については、

帰無仮説
\[ H_0:\beta_j=0 \]
対立仮説
\[ H_1:\beta_j\neq0 \]

と設定します。

これは、 他の説明変数を固定したときに、 \(x_j\) が \(y\) に線形な効果をもつか を検定することになります。

STEP 11

手順1:\(\hat\beta_j\) も標本によって変動する

単回帰モデルの回帰係数と同じように、 重回帰モデルの偏回帰係数 \(\hat\beta_j\) も標本から計算される値です。

したがって、 標本を取り直せば \(\hat\beta_j\) の値も変わります。

標本A \[ \hat\beta_{j,A} \]
標本を変えると
標本B \[ \hat\beta_{j,B} \]
\(\hat\beta_j\) は確率変数

誤差が正規分布にしたがうことを使うと、

\[ \hat\beta_j \sim N\left( \beta_j,\; V(\hat\beta_j) \right) \]

と整理できます。

つまり、 \(\hat\beta_j\) は 真の偏回帰係数 \(\beta_j\) を中心として変動します。

STEP 12

手順2:標準誤差で割るとt分布になる

前のSTEPで、 偏回帰係数の推定値 \(\hat\beta_j\) は標本によって変動し、

\[ \hat\beta_j \sim N\left( \beta_j,\; V(\hat\beta_j) \right) \]

と整理しました。

もし \(\hat\beta_j\) の真の標準偏差

\[ \sqrt{V(\hat\beta_j)} \]

がわかっていれば、 \(\hat\beta_j\) を標準化して、

\[ \frac{ \hat\beta_j-\beta_j }{ \sqrt{V(\hat\beta_j)} } \sim N(0,1) \]

とできます。

ただし実際には、 誤差分散 \(\sigma^2\) が未知であるため、 \(\hat\beta_j\) の真の標準偏差もわかりません。

そこで、 標本データから推定した 偏回帰係数の標準誤差

\[ se(\hat\beta_j) \]

を代わりに使います。

標準誤差とは?
同じ母集団から標本を繰り返し取り直したときに、
\(\hat\beta_j\) がどの程度ばらつくか
を標本データから推定したもの

つまり、 標準誤差が小さいほど \(\hat\beta_j\) の推定は安定しており、 大きいほど標本によるブレが大きい、 ということになります。

重回帰ならではのポイント

\(se(\hat\beta_j)\) は、 単に残差の大きさだけでなく、 説明変数のばらつき方や、 説明変数どうしの関係 にも影響されます。

そして、 真の標準偏差の代わりに \(se(\hat\beta_j)\) を使うことで、

\[ T = \frac{ \hat\beta_j-\beta_j }{ se(\hat\beta_j) } \sim t(n-p-1) \]

と整理できます。

さらに、 今回の帰無仮説

\[ H_0:\beta_j=0 \]

のもとでは、 分子の \(\beta_j\) に0を代入できるので、

\[ T = \frac{ \hat\beta_j }{ se(\hat\beta_j) } \]

となります。

手順2の結論
偏回帰係数の推定値を、 その推定値の「ブレの大きさ」である標準誤差で割ることで、 t統計量を作ります。
STEP 13

なぜt分布の自由度は \(n-p-1\) なのか

偏回帰係数の標準誤差 \(se(\hat\beta_j)\) は、 誤差分散 \(\sigma^2\) を 残差から推定して計算します。

その中心となるのが、

\[ \hat\sigma^2 = \frac{S_e}{n-p-1} \]

です。

残差平方和 \(S_e\)
自由度 \(n-p-1\) で割る
誤差分散を推定
t分布の自由度も \(n-p-1\)
自由度
偏回帰係数のt検定では、 標準誤差の計算に使う残差平方和の自由度 \(n-p-1\) が、そのままt分布の自由度になる。
STEP 14

手順3:個別の偏回帰係数は両側t検定で判定する

ここでは、 対立仮説を

\[ H_1:\beta_j\neq0 \]

としているため、 両側検定になります。

有意水準を \(\alpha=0.05\) とすると、 左右2.5%ずつを棄却域にします。

2.5% 2.5%
\[ |t_{\mathrm{obs}}| \ge t_{0.025}(n-p-1) \]

なら、 帰無仮説 \(H_0:\beta_j=0\) を棄却します。

STEP 15

F検定とt検定を並べて整理する

モデル全体:F検定
帰無仮説: \[ H_0:\beta_1=\cdots=\beta_p=0 \] 検定統計量: \[ F = \frac{S_R/p}{S_e/(n-p-1)} \] 自由度: \[ (p,\;n-p-1) \] 棄却域: 上側
個別の係数:t検定
帰無仮説: \[ H_0:\beta_j=0 \] 検定統計量: \[ T = \frac{\hat\beta_j}{se(\hat\beta_j)} \] 自由度: \[ n-p-1 \] 棄却域: 両側
使い分け
モデル全体を見たいならF検定。
各説明変数を個別に見たいならt検定。
SUMMARY

重回帰モデルの仮説検定を整理する

モデル全体
\[ H_0: \beta_1=\cdots=\beta_p=0 \] F検定を使う
F統計量
\[ F = \frac{S_R/p} {S_e/(n-p-1)} \] 自由度は \((p,n-p-1)\)
個別係数
\[ H_0:\beta_j=0 \] t検定を使う
t統計量
\[ T = \frac{\hat\beta_j} {se(\hat\beta_j)} \] 自由度は \(n-p-1\)
特に重要な4点
① 重回帰でも誤差項の正規性が推測の土台になる
② モデル全体はF検定で調べる
③ 個別の偏回帰係数はt検定で調べる
④ 残差の自由度は \(n-p-1\)
最後に
重回帰モデルでは、 「モデル全体に説明力があるか」と 「各説明変数に個別の効果があるか」を 分けて考えます。

その2つに対応するのが、 F検定とt検定です。
NEXT STEP

次のステップ:統計検定®2級を目指す

このサイトで統計学の基礎を学んだあと、 統計検定®2級の合格まで体系的に学びたい方へ。

統計検定®2級対策講座【ベストセラー版】

約9時間の動画講義と200問以上の小テストに加えて、 模擬試験にも取り組めます。 講座内ではQ&Aも利用でき、 これまでに400問以上の質問に回答してきました。

約9時間の動画講義
200問以上の小テスト
模擬試験
400問以上のQ&A
統計検定®2級対策講座を見る
資格試験ではなく、統計学そのものを動画で学びたい方へ

記述統計・確率・推定・検定を基礎から学ぶ 「統計学ベーシック講座その1『確率分布・推定・検定』」 も用意しています。

統計学ベーシック講座を見る →