スマホで統計学

47

単回帰モデル

単回帰モデルでは、標本から推定した回帰直線を使って、母集団における真の回帰係数 \(\beta\) を推測します。このレクチャーでは、誤差項の正規性を前提として、回帰係数の標本分布を整理し、区間推定と仮説検定へつなげます。
このページのゴール

単回帰モデルの誤差項と回帰係数推定量 \(\hat\beta\) の分布を理解し、残差から誤差分散を推定して、回帰係数 \(\beta\) の信頼区間と仮説検定を導けるようになる。

STEP 01

単回帰モデルでは「真の回帰係数」を推測する

このレクチャーでは、 線形モデルのうち 単回帰モデル について見ていきます。

ここまでの回帰直線では、 2つの量的変数の関係を 1本の直線で記述してきました。

ここからはさらに一歩進んで、 確率統計や推測統計の考え方を使い、 回帰係数そのものを推定・検定 します。

\[ y=\alpha+\beta x \]

このうち、 説明変数 \(x\) にかかる 回帰係数 \(\beta\) が今回の主役です。

回帰係数 \(\beta\) が表すこと
\(x\) が1単位増える
\(y\) が平均的に \(\beta\) だけ変化

したがって、 \(\beta\) の値を調べることは、 \(x\) と \(y\) の 線形な関係の程度 を調べることにつながります。

今回のテーマ
標本から推定した \(\hat\beta\) を使って、 母集団の真の回帰係数 \(\beta\) を推測する。
STEP 02

母回帰直線と標本回帰直線を区別する

まず、 全体像を確認しておきましょう。

母集団には、 私たちが本当に知りたい 真の回帰直線 があると考えます。

標本回帰直線 母回帰直線 x y
母集団の真の回帰直線 \[ y=\alpha+\beta x \]
標本から推定した回帰直線 \[ \hat y=\hat\alpha+\hat\beta x \]

手元にあるのは標本なので、 実際に計算できるのは \(\hat\alpha,\hat\beta\) です。

そこから、 母集団の真の係数 \(\alpha,\beta\) を推測していきます。

混同しない
\(\beta\) は母集団の真の回帰係数、
\(\hat\beta\) は標本から推定した回帰係数です。
STEP 03

手順0:回帰係数について帰無仮説を設定する

仮説検定を行う場合は、 まず回帰係数について 帰無仮説と対立仮説を設定します。

帰無仮説
\[ H_0:\beta=\beta_0 \]
対立仮説
\[ H_1:\beta\neq\beta_0 \]

回帰係数の検定では、 とくに

\[ H_0:\beta=0 \]

と設定する場面が多くあります。

\(\beta=0\) なら、 \(x\) が変化しても \(y\) の平均的な線形変化はありません。

注意
\(\beta=0\) は、 「\(x\) と \(y\) にまったく関係がない」 という意味ではありません。
正確には、 この線形モデルにおいて線形な関係が認められない という意味です。
STEP 04

単回帰モデルには「誤差項」が加わる

推測統計として回帰を扱うときには、 単なる直線

\[ y=\alpha+\beta x \]

ではなく、 誤差項 \(\varepsilon\) を加えたモデルを考えます。

\[ Y_i = \alpha+\beta x_i+\varepsilon_i \]

ここで、 \(\alpha+\beta x_i\) は母集団における平均的な \(y\) の値です。

実際の観測値 \(Y_i\) は、 そこから誤差 \(\varepsilon_i\) の分だけずれて観測されます。

真の回帰直線上の値 \[ \alpha+\beta x_i \]
+ 誤差 \(\varepsilon_i\)
観測値 \[ Y_i \]
STEP 05

誤差は平均0・分散 \(\sigma^2\) の正規分布にしたがうと仮定する

ここで、 単回帰モデルにおける 非常に重要な仮定 を確認します。

単回帰モデルでは、 観測値 \(Y_i\) を

\[ Y_i = \alpha+\beta x_i+\varepsilon_i \]

と表しました。

この式は、 観測値 \(Y_i\) が 母回帰直線上の値誤差の2つからできている、 と考えていることを意味します。

観測値が生まれるイメージ
母回帰直線
\[ \alpha+\beta x_i \]
\(x_i\) が与えられたときの
\(Y_i\) の平均的な位置
誤差
\[ \varepsilon_i \]
母回帰直線からの
上下方向のズレ
実際に観測される値
\[ Y_i \]

つまり、 同じ \(x_i\) であっても、 必ず母回帰直線上の値がそのまま観測されるわけではありません。

母回帰直線 \(\alpha+\beta x_i\) を中心として、 誤差 \(\varepsilon_i\) の分だけ 上下にずれたところで \(Y_i\) が観測される、 と考えます。

1つの \(x_i\) に注目すると
観測値 \(Y_i\)
\(+\varepsilon_i\)
母回帰直線上の値
\(\alpha+\beta x_i\)
\(-\varepsilon_i\)
観測値 \(Y_i\)

では、 この上下方向のズレである \(\varepsilon_i\) がどのように発生すると考えるのでしょうか。

ここで単回帰モデルでは、 誤差について

\[ \varepsilon_i \sim N(0,\sigma^2) \]

と仮定します。

平均は0
誤差はプラス側・マイナス側の どちらか一方に偏るのではなく、 母回帰直線を中心として発生する。
分散は \(\sigma^2\)
母回帰直線からどの程度大きくずれやすいかを表す。
正規分布にしたがう
小さな誤差ほど起こりやすく、 大きな誤差ほど起こりにくいと考える。

さらに、 ここでは各誤差が 互いに独立で、 同じ分散 \(\sigma^2\) をもつと考えます。

この誤差の分布を仮定することで、 標本ごとに変動する回帰係数 \(\hat\beta\) の確率分布を考えられるようになります。

そして、 その確率分布を利用することで、 回帰係数 \(\beta\) の 区間推定や仮説検定へ進むことができます。

ここがポイント
母回帰直線が \(Y\) の平均的な位置を決め、
そこから正規分布にしたがう誤差 \(\varepsilon_i\) の分だけずれて 観測値 \(Y_i\) が生まれる。

この確率的な誤差の仮定が、 回帰係数の区間推定・仮説検定の出発点です。
STEP 06

手順1:回帰係数の推定値 \(\hat\beta\) の分布を整理する

ここから、 回帰係数の推定値 \(\hat\beta\) がどんな分布にしたがうか を整理していきます。

まず、 最小二乗法によって推定される回帰係数は、

\[ \hat\beta = \frac{s_{xy}}{s_{xx}} \]

でした。

ここで大切なのは、 \(\hat\beta\) は 標本から計算される値 だということです。

母集団から取り出す標本が変われば、 観測される点の位置も変わります。 すると、 その標本から最小二乗法で推定される回帰直線も変わり、 回帰係数 \(\hat\beta\) の値も変わります。

標本を取り直すと、推定される傾きも変わる
同じ母集団から標本を繰り返し抽出するイメージ
標本 A
\(\hat\beta_A\)
標本 B
\(\hat\beta_B\)
標本 C
\(\hat\beta_C\)

このように、 同じ母集団から標本を取っているとしても、

\[ \hat\beta_A,\quad \hat\beta_B,\quad \hat\beta_C,\quad\ldots \]

と、 得られる回帰係数の推定値は 標本によって変動します。

母集団は同じ
↓ 標本を取り直す
観測されるデータが変わる
推定される回帰直線が変わる
\(\hat\beta\) も変動する

つまり、 \(\hat\beta\) は 標本によって値が変わる確率変数 として考えることができます。

そして、 前のSTEPで仮定したように、 誤差 \(\varepsilon_i\) が正規分布にしたがうことを利用すると、 この \(\hat\beta\) の確率分布も整理できます。

\[ \hat\beta \sim N\left( \beta,\; \frac{\sigma^2}{T_{xx}} \right) \]

つまり、 標本から得られる \(\hat\beta\) は、 母集団の真の回帰係数 \(\beta\) を中心として変動する ということです。

平均 \[ E(\hat\beta)=\beta \] 標本を繰り返し取り直したときの \(\hat\beta\) の中心は、 真の回帰係数 \(\beta\) になります。
分散 \[ V(\hat\beta) = \frac{\sigma^2}{T_{xx}} \] \(\hat\beta\) が 真の回帰係数 \(\beta\) のまわりで どの程度ばらつくかを表します。
\(T_{xx}\) とは?

分散の式に \(T_{xx}\) という新しい記号が登場しました。
これは 説明変数 \(x\) のばらつきの大きさ を表す量です。

なぜこの \(T_{xx}\) が \(\hat\beta\) の分散に関係するのかも含めて、 次のSTEPで詳しく確認します。
手順1の結論
標本を取り直すたびに、 推定される回帰直線の傾き \(\hat\beta\) も変動する。

その \(\hat\beta\) は、 真の回帰係数 \(\beta\) を平均とする 正規分布にしたがう。
STEP 07

\(\hat\beta\) のばらつきは何で決まる?

前のSTEPでは、 標本を取り直すたびに 回帰直線の傾き \(\hat\beta\) も変動することを確認しました。

そして、 その \(\hat\beta\) の分散は、

\[ V(\hat\beta) = \frac{\sigma^2}{T_{xx}} \]

と表されます。

この式は、 分子と分母を分けて考える と意味がわかりやすくなります。

\(\hat\beta\) の分散を2つに分けて見る
分子
\[ \sigma^2 \]
母回帰直線からの誤差の大きさ
= データの「縦方向」のばらつき
÷
分母
\[ T_{xx} = \sum_{i=1}^{n}(x_i-\bar x)^2 \]
説明変数 \(x\) のばらつきの大きさ
= データの「横方向」の広がり

つまり、 \(\hat\beta\) の推定が安定するかどうかは、

縦方向の誤差はどれくらい大きいか

横方向に \(x\) がどれくらい広がっているか

の両方で決まります。

① 分子:\(\sigma^2\) が大きいとどうなる?

\(\sigma^2\) は、 母回帰直線からの誤差 \(\varepsilon_i\) の分散でした。

誤差が大きい

誤差が大きければ、 標本としてどの点が観測されるかによって 推定される回帰直線も大きく変わりやすくなります。

\[ \sigma^2 \uparrow \]
\(\hat\beta\) のばらつきも大きくなる
② 分母:\(T_{xx}\) が大きいとどうなる?

\(T_{xx}\) は、 説明変数 \(x\) の平均からの偏差平方和です。

\[ T_{xx} = \sum_{i=1}^{n} (x_i-\bar x)^2 \]

つまり、 \(T_{xx}\) が大きいということは、 \(x\) の値が平均の近くに集まらず、 横方向に広く散らばっている ということです。

\(x\) の広がりを比べる
\(T_{xx}\) が小さい
\(x\) が狭い範囲に集中
\(T_{xx}\) が大きい
\(x\) が広い範囲に分布

\(x\) が広い範囲に散らばっていれば、 データ全体を見たときに 回帰直線の傾きを判断しやすくなります。

逆に、 \(x\) が狭い範囲に固まっていると、 わずかな誤差によって 推定される傾きが大きく変わりやすくなります。

\[ T_{xx} \uparrow \]
\(\hat\beta\) のばらつきは小さくなる
もう一度、分散の式を見ると
\[ V(\hat\beta) = \frac{\sigma^2}{T_{xx}} \]
分子 \(\sigma^2\)
大きいほど \(\hat\beta\) はばらつく
分母 \(T_{xx}\)
大きいほど \(\hat\beta\) は安定する
ここがポイント
回帰係数 \(\hat\beta\) の推定精度は、

「母回帰直線からどれくらい誤差があるか」 と 「説明変数 \(x\) がどれくらい広くばらついているか」

の2つによって決まります。
STEP 08

手順2:\(\sigma\) がわかれば標準化できる

手順1で、

\[ \hat\beta \sim N\left( \beta, \frac{\sigma^2}{T_{xx}} \right) \]

と整理できました。

もし誤差の標準偏差 \(\sigma\) がわかっていれば、 \(\hat\beta\) を標準化して、

\[ Z = \frac{ \hat\beta-\beta }{ \sigma/\sqrt{T_{xx}} } \sim N(0,1) \]

とできます。

ただし実際には、 母集団の誤差分散 \(\sigma^2\) は未知であることが一般的です。

ここで問題
分母に未知の \(\sigma\) が残っているため、 このままでは実際のデータから \(Z\) を計算できません。
STEP 09

未知の \(\sigma^2\) を残差の不偏分散で推定する

母集団の誤差 \(\varepsilon_i\) は直接観測できません。

そこで、 標本から計算できる 残差

\[ e_i = y_i-\hat y_i \]

を使います。

残差は、 母集団の誤差 \(\varepsilon_i\) に対応する標本上のズレと考えられます。

そこで、 誤差分散 \(\sigma^2\) の代わりに 残差の不偏分散 を使います。

\[ \hat\sigma^2 = \frac{ \sum_{i=1}^{n} (y_i-\hat y_i)^2 }{ n-2 } \]
分子は、 これまで学んできた 残差平方和 です。
STEP 10

なぜ残差の自由度は \(n-2\) なのか

残差の不偏分散では、 分母が \(n-2\) となっています。

これは、 回帰直線を推定するときに、 標本から2つの係数を推定しているためです。

データは \(n\) 個
定数項 \(\alpha\) を推定
回帰係数 \(\beta\) を推定
自由度 \[ n-2 \]

つまり、 \(n\) でも \(n-1\) でもなく、 \(n-2\) であることに注意しましょう。

自由度
単回帰では \(\alpha,\beta\) の2つを標本から推定するため、 残差の自由度は \(n-2\)。
STEP 11

\(\sigma\) を \(\hat\sigma\) に置き換えるとt分布になる

未知の \(\sigma\) を、 残差の不偏分散から得られる \(\hat\sigma\) で置き換えます。

すると、

\[ T = \frac{ \hat\beta-\beta }{ \hat\sigma/\sqrt{T_{xx}} } \sim t(n-2) \]

となります。

これで、 t分布の付表を使って 回帰係数について具体的な確率を考えられるようになりました。

手順2の結論
誤差分散が未知なので、 残差の不偏分散で代用し、 自由度 \(n-2\) のt分布を使う。
STEP 12

回帰係数 \(\beta\) の信頼区間を求める

まず、 区間推定について見てみましょう。

信頼係数を \(1-\alpha\) とすると、

\[ P\left( -t_{\alpha/2}(n-2) \le T \le t_{\alpha/2}(n-2) \right) = 1-\alpha \]

です。

ここに

\[ T = \frac{ \hat\beta-\beta }{ \hat\sigma/\sqrt{T_{xx}} } \]

を代入して、 \(\beta\) について整理すると、

\[ \hat\beta – t_{\alpha/2}(n-2) \frac{\hat\sigma}{\sqrt{T_{xx}}} \le \beta \le \hat\beta + t_{\alpha/2}(n-2) \frac{\hat\sigma}{\sqrt{T_{xx}}} \]

これが、 回帰係数 \(\beta\) の \(100(1-\alpha)\%\) 信頼区間です。

95%信頼区間なら
\(t_{0.025}(n-2)\) を使って、 \(\hat\beta\) を中心とした区間を作る。
STEP 13

回帰係数 \(\beta\) の仮説検定を行う

次に、 仮説検定です。

帰無仮説を

\[ H_0:\beta=\beta_0 \]

とすると、 帰無仮説のもとでの検定統計量は

\[ t_{\mathrm{obs}} = \frac{ \hat\beta-\beta_0 }{ \hat\sigma/\sqrt{T_{xx}} } \]

です。

有意水準5%の両側検定なら、

t分布の左右2.5%を棄却域にする
2.5% 2.5%
\[ |t_{\mathrm{obs}}| \ge t_{0.025}(n-2) \]

なら、 帰無仮説を棄却します。

よく使う帰無仮説

\[ H_0:\beta=0 \] つまり、 「線形な関係がない」という世界を検定します。
STEP 14

区間推定と仮説検定をまとめて整理する

手順1
回帰係数の推定量の分布 \[ \hat\beta \sim N\left( \beta, \frac{\sigma^2}{T_{xx}} \right) \]
手順2
\(\sigma\) を残差から推定 \[ T = \frac{\hat\beta-\beta} {\hat\sigma/\sqrt{T_{xx}}} \sim t(n-2) \]
区間推定
\(\beta\) の信頼区間を求める
または
仮説検定
\(H_0:\beta=\beta_0\) を棄却できるか判定
基本はこれまでと同じ
何がどんな分布にしたがうかを整理し、 付表が使える形に変換して、 区間推定または仮説検定へ進む。
SUMMARY

単回帰モデルの推測を整理する

単回帰モデルでは、 回帰係数 \(\beta\) を推定し、 その区間推定や仮説検定を行います。

単回帰モデルの前提
\[ y_i=\alpha+\beta x_i+\varepsilon_i, \qquad \varepsilon_i \sim N(0,\sigma^2) \]
回帰係数の推定値
\[ \hat{\beta} = \frac{s_{xy}}{s_{xx}} \sim N\!\left(\beta,\frac{\sigma^2}{T_{xx}}\right) \]
\(\color{white}{\beta}\)
母集団の真の回帰係数
\(\color{white}{\hat{\beta}}\)
標本から最小二乗法で推定した回帰係数
\(\color{white}{T_{xx}}\)
\[ T_{xx} = \sum_{i=1}^{n}(x_i-\bar{x})^2 \] 説明変数 \(x\) のばらつき
検定統計量
\[ t = \frac{\hat{\beta}-\beta}{\hat{\sigma}/\sqrt{T_{xx}}} \sim t(n-2) \]
区間推定と仮説検定
① 区間推定では、\(\beta\) の信頼区間を求める
② 仮説検定では、ふつう \(H_0:\beta=0\) を検定する
③ 自由度は、\(\hat{\alpha}\) と \(\hat{\beta}\) の2つを推定しているので \(n-2\)
最後に
単回帰モデルの推測では、

「誤差 \(\varepsilon_i\) が正規分布にしたがう」
という仮定を土台として、
回帰係数 \(\beta\) の区間推定や仮説検定を行います。
NEXT STEP

次のステップ:統計検定®2級を目指す

このサイトで統計学の基礎を学んだあと、 統計検定®2級の合格まで体系的に学びたい方へ。

統計検定®2級対策講座【ベストセラー版】

約9時間の動画講義と200問以上の小テストに加えて、 模擬試験にも取り組めます。 講座内ではQ&Aも利用でき、 これまでに400問以上の質問に回答してきました。

約9時間の動画講義
200問以上の小テスト
模擬試験
400問以上のQ&A
統計検定®2級対策講座を見る
資格試験ではなく、統計学そのものを動画で学びたい方へ

記述統計・確率・推定・検定を基礎から学ぶ 「統計学ベーシック講座その1『確率分布・推定・検定』」 も用意しています。

統計学ベーシック講座を見る →