47
単回帰モデル
単回帰モデルの誤差項と回帰係数推定量 \(\hat\beta\) の分布を理解し、残差から誤差分散を推定して、回帰係数 \(\beta\) の信頼区間と仮説検定を導けるようになる。
単回帰モデルでは「真の回帰係数」を推測する
このレクチャーでは、 線形モデルのうち 単回帰モデル について見ていきます。
ここまでの回帰直線では、 2つの量的変数の関係を 1本の直線で記述してきました。
ここからはさらに一歩進んで、 確率統計や推測統計の考え方を使い、 回帰係数そのものを推定・検定 します。
このうち、 説明変数 \(x\) にかかる 回帰係数 \(\beta\) が今回の主役です。
したがって、 \(\beta\) の値を調べることは、 \(x\) と \(y\) の 線形な関係の程度 を調べることにつながります。
母回帰直線と標本回帰直線を区別する
まず、 全体像を確認しておきましょう。
母集団には、 私たちが本当に知りたい 真の回帰直線 があると考えます。
手元にあるのは標本なので、 実際に計算できるのは \(\hat\alpha,\hat\beta\) です。
そこから、 母集団の真の係数 \(\alpha,\beta\) を推測していきます。
\(\hat\beta\) は標本から推定した回帰係数です。
手順0:回帰係数について帰無仮説を設定する
仮説検定を行う場合は、 まず回帰係数について 帰無仮説と対立仮説を設定します。
回帰係数の検定では、 とくに
と設定する場面が多くあります。
\(\beta=0\) なら、 \(x\) が変化しても \(y\) の平均的な線形変化はありません。
\(\beta=0\) は、 「\(x\) と \(y\) にまったく関係がない」 という意味ではありません。
正確には、 この線形モデルにおいて線形な関係が認められない という意味です。
単回帰モデルには「誤差項」が加わる
推測統計として回帰を扱うときには、 単なる直線
ではなく、 誤差項 \(\varepsilon\) を加えたモデルを考えます。
ここで、 \(\alpha+\beta x_i\) は母集団における平均的な \(y\) の値です。
実際の観測値 \(Y_i\) は、 そこから誤差 \(\varepsilon_i\) の分だけずれて観測されます。
誤差は平均0・分散 \(\sigma^2\) の正規分布にしたがうと仮定する
ここで、 単回帰モデルにおける 非常に重要な仮定 を確認します。
単回帰モデルでは、 観測値 \(Y_i\) を
と表しました。
この式は、 観測値 \(Y_i\) が 母回帰直線上の値と 誤差の2つからできている、 と考えていることを意味します。
\(Y_i\) の平均的な位置
上下方向のズレ
つまり、 同じ \(x_i\) であっても、 必ず母回帰直線上の値がそのまま観測されるわけではありません。
母回帰直線 \(\alpha+\beta x_i\) を中心として、 誤差 \(\varepsilon_i\) の分だけ 上下にずれたところで \(Y_i\) が観測される、 と考えます。
\(\alpha+\beta x_i\)
では、 この上下方向のズレである \(\varepsilon_i\) がどのように発生すると考えるのでしょうか。
ここで単回帰モデルでは、 誤差について
と仮定します。
誤差はプラス側・マイナス側の どちらか一方に偏るのではなく、 母回帰直線を中心として発生する。
母回帰直線からどの程度大きくずれやすいかを表す。
小さな誤差ほど起こりやすく、 大きな誤差ほど起こりにくいと考える。
さらに、 ここでは各誤差が 互いに独立で、 同じ分散 \(\sigma^2\) をもつと考えます。
この誤差の分布を仮定することで、 標本ごとに変動する回帰係数 \(\hat\beta\) の確率分布を考えられるようになります。
そして、 その確率分布を利用することで、 回帰係数 \(\beta\) の 区間推定や仮説検定へ進むことができます。
そこから正規分布にしたがう誤差 \(\varepsilon_i\) の分だけずれて 観測値 \(Y_i\) が生まれる。
この確率的な誤差の仮定が、 回帰係数の区間推定・仮説検定の出発点です。
手順1:回帰係数の推定値 \(\hat\beta\) の分布を整理する
ここから、 回帰係数の推定値 \(\hat\beta\) がどんな分布にしたがうか を整理していきます。
まず、 最小二乗法によって推定される回帰係数は、
でした。
ここで大切なのは、 \(\hat\beta\) は 標本から計算される値 だということです。
母集団から取り出す標本が変われば、 観測される点の位置も変わります。 すると、 その標本から最小二乗法で推定される回帰直線も変わり、 回帰係数 \(\hat\beta\) の値も変わります。
このように、 同じ母集団から標本を取っているとしても、
と、 得られる回帰係数の推定値は 標本によって変動します。
つまり、 \(\hat\beta\) は 標本によって値が変わる確率変数 として考えることができます。
そして、 前のSTEPで仮定したように、 誤差 \(\varepsilon_i\) が正規分布にしたがうことを利用すると、 この \(\hat\beta\) の確率分布も整理できます。
つまり、 標本から得られる \(\hat\beta\) は、 母集団の真の回帰係数 \(\beta\) を中心として変動する ということです。
分散の式に \(T_{xx}\) という新しい記号が登場しました。
これは 説明変数 \(x\) のばらつきの大きさ を表す量です。
なぜこの \(T_{xx}\) が \(\hat\beta\) の分散に関係するのかも含めて、 次のSTEPで詳しく確認します。
その \(\hat\beta\) は、 真の回帰係数 \(\beta\) を平均とする 正規分布にしたがう。
\(\hat\beta\) のばらつきは何で決まる?
前のSTEPでは、 標本を取り直すたびに 回帰直線の傾き \(\hat\beta\) も変動することを確認しました。
そして、 その \(\hat\beta\) の分散は、
と表されます。
この式は、 分子と分母を分けて考える と意味がわかりやすくなります。
= データの「縦方向」のばらつき
= データの「横方向」の広がり
つまり、 \(\hat\beta\) の推定が安定するかどうかは、
と
横方向に \(x\) がどれくらい広がっているか
の両方で決まります。
\(\sigma^2\) は、 母回帰直線からの誤差 \(\varepsilon_i\) の分散でした。
誤差が大きければ、 標本としてどの点が観測されるかによって 推定される回帰直線も大きく変わりやすくなります。
\(T_{xx}\) は、 説明変数 \(x\) の平均からの偏差平方和です。
つまり、 \(T_{xx}\) が大きいということは、 \(x\) の値が平均の近くに集まらず、 横方向に広く散らばっている ということです。
\(x\) が広い範囲に散らばっていれば、 データ全体を見たときに 回帰直線の傾きを判断しやすくなります。
逆に、 \(x\) が狭い範囲に固まっていると、 わずかな誤差によって 推定される傾きが大きく変わりやすくなります。
大きいほど \(\hat\beta\) はばらつく
大きいほど \(\hat\beta\) は安定する
「母回帰直線からどれくらい誤差があるか」 と 「説明変数 \(x\) がどれくらい広くばらついているか」
の2つによって決まります。
手順2:\(\sigma\) がわかれば標準化できる
手順1で、
と整理できました。
もし誤差の標準偏差 \(\sigma\) がわかっていれば、 \(\hat\beta\) を標準化して、
とできます。
ただし実際には、 母集団の誤差分散 \(\sigma^2\) は未知であることが一般的です。
分母に未知の \(\sigma\) が残っているため、 このままでは実際のデータから \(Z\) を計算できません。
未知の \(\sigma^2\) を残差の不偏分散で推定する
母集団の誤差 \(\varepsilon_i\) は直接観測できません。
そこで、 標本から計算できる 残差
を使います。
残差は、 母集団の誤差 \(\varepsilon_i\) に対応する標本上のズレと考えられます。
そこで、 誤差分散 \(\sigma^2\) の代わりに 残差の不偏分散 を使います。
なぜ残差の自由度は \(n-2\) なのか
残差の不偏分散では、 分母が \(n-2\) となっています。
これは、 回帰直線を推定するときに、 標本から2つの係数を推定しているためです。
つまり、 \(n\) でも \(n-1\) でもなく、 \(n-2\) であることに注意しましょう。
\(\sigma\) を \(\hat\sigma\) に置き換えるとt分布になる
未知の \(\sigma\) を、 残差の不偏分散から得られる \(\hat\sigma\) で置き換えます。
すると、
となります。
これで、 t分布の付表を使って 回帰係数について具体的な確率を考えられるようになりました。
回帰係数 \(\beta\) の信頼区間を求める
まず、 区間推定について見てみましょう。
信頼係数を \(1-\alpha\) とすると、
です。
ここに
を代入して、 \(\beta\) について整理すると、
これが、 回帰係数 \(\beta\) の \(100(1-\alpha)\%\) 信頼区間です。
回帰係数 \(\beta\) の仮説検定を行う
次に、 仮説検定です。
帰無仮説を
とすると、 帰無仮説のもとでの検定統計量は
です。
有意水準5%の両側検定なら、
なら、 帰無仮説を棄却します。
\[ H_0:\beta=0 \] つまり、 「線形な関係がない」という世界を検定します。
区間推定と仮説検定をまとめて整理する
回帰係数の推定量の分布 \[ \hat\beta \sim N\left( \beta, \frac{\sigma^2}{T_{xx}} \right) \]
\(\sigma\) を残差から推定 \[ T = \frac{\hat\beta-\beta} {\hat\sigma/\sqrt{T_{xx}}} \sim t(n-2) \]
\(\beta\) の信頼区間を求める
\(H_0:\beta=\beta_0\) を棄却できるか判定
単回帰モデルの推測を整理する
単回帰モデルでは、 回帰係数 \(\beta\) を推定し、 その区間推定や仮説検定を行います。
① 区間推定では、\(\beta\) の信頼区間を求める
② 仮説検定では、ふつう \(H_0:\beta=0\) を検定する
③ 自由度は、\(\hat{\alpha}\) と \(\hat{\beta}\) の2つを推定しているので \(n-2\)
「誤差 \(\varepsilon_i\) が正規分布にしたがう」
という仮定を土台として、
回帰係数 \(\beta\) の区間推定や仮説検定を行います。
次のステップ:統計検定®2級を目指す
このサイトで統計学の基礎を学んだあと、 統計検定®2級の合格まで体系的に学びたい方へ。
統計検定®2級対策講座【ベストセラー版】
約9時間の動画講義と200問以上の小テストに加えて、 模擬試験にも取り組めます。 講座内ではQ&Aも利用でき、 これまでに400問以上の質問に回答してきました。
記述統計・確率・推定・検定を基礎から学ぶ 「統計学ベーシック講座その1『確率分布・推定・検定』」 も用意しています。
統計学ベーシック講座を見る →