46
自由度調整済み決定係数
通常の決定係数 \(R^2\) は、説明変数を追加すると下がらないという性質があります。そのため、説明変数の数が異なる重回帰モデルを比較する際には、そのままでは公平に評価できません。このレクチャーでは、説明変数の個数を考慮した自由度調整済み決定係数を学びます。
このページのゴール
通常の決定係数の欠点を理解し、残差平方和と全変動をそれぞれ自由度で調整することで、自由度調整済み決定係数がどのように定義されるかを説明できるようになる。
STEP 01
決定係数の欠点を補う指標
このレクチャーでは、
自由度調整済み決定係数
を見ていきます。
自由度調整済み決定係数は、
通常の決定係数 \(R^2\) の欠点を補うための
回帰式の評価指標です。
特に、
複数の説明変数を扱う
重回帰分析
で重要になります。
今回考えたい問題
説明変数を増やす
↓
残差平方和は増えない
↓
通常の \(R^2\) は下がらない
では、
説明変数をたくさん入れたモデルほど
本当に優れたモデルなのでしょうか。
この問題を考えるために登場するのが、
自由度調整済み決定係数です。
今回のテーマ
「説明変数を増やしただけ」で
決定係数が高くなる問題を調整する。
STEP 02
まず通常の決定係数を復習する
決定係数 \(R^2\) は、
被説明変数 \(y\) の全体の変動のうち、
回帰式によってどの程度を説明できたかを表す指標でした。
\[
R^2
=
\frac{S_R}{S_y}
\]
\(S_y\)
\(y\) の全変動
\(S_R\)
回帰式によって説明できた変動
\(S_e\)
回帰式で説明できずに残った変動
そして、
定数項を含む回帰式を最小二乗法で推定した場合、
これらの平方和には
\[
S_y=S_R+S_e
\]
という関係が成立します。
つまり、
\(y\) の全体の変動 \(S_y\) は、
回帰式によって説明できた変動 \(S_R\) と、
説明できずに残った変動 \(S_e\) に
分解できる、ということです。
決定係数
定数項を含む最小二乗回帰では、
\(S_y=S_R+S_e\) と分解できる。
そのうち、全変動 \(S_y\) に対する
説明できた変動 \(S_R\) の割合が
決定係数 \(R^2\)。
STEP 03
決定係数は残差平方和からも表せる
平方和の分解
\[
S_y=S_R+S_e
\]
から、
\[
S_R=S_y-S_e
\]
と書けます。
これを決定係数
\[
R^2=\frac{S_R}{S_y}
\]
に代入すると、
\[
R^2
=
\frac{S_y-S_e}{S_y}
=
1-\frac{S_e}{S_y}
\]
となります。
この式からわかること
残差平方和 \(S_e\) が小さいほど、
\(R^2\) は大きくなります。
STEP 04
説明変数を増やすと \(R^2\) は下がらない
ここで、
前のレクチャーの最後に確認した性質を思い出しましょう。
たとえば、
もともとの回帰式が
\[
\hat y
=
\hat\beta_0
+
\hat\beta_1x_1
\]
だったところに、
新しい説明変数 \(x_2\) を追加します。
\[
\hat y
=
\hat\beta_0
+
\hat\beta_1x_1
+
\hat\beta_2x_2
\]
もし \(x_2\) がまったく役に立たなければ、
\[
\hat\beta_2=0
\]
とすれば、
元のモデルをそのまま再現できます。
説明変数を追加
↓
最悪でも追加した係数を0にできる
↓
\(S_e\) は増えない
↓
\(R^2\) は下がらない
つまり、
説明変数が本当に役立つかどうかとは別に、
説明変数を増やすだけで決定係数が有利になりやすい
という問題があります。
\(R^2\) の欠点
説明変数の数が違うモデルを、
通常の \(R^2\) だけで単純比較しにくい。
STEP 05
自由度調整済み決定係数を使う
そこで登場するのが、
自由度調整済み決定係数
です。
英語では
adjusted R-squared
と呼ばれ、
\[
R_{\mathrm{adj}}^2
\]
などと表記します。
通常の決定係数は
\[
R^2
=
1-\frac{S_e}{S_y}
\]
でした。
自由度調整済み決定係数では、
\(S_e\) と \(S_y\) をそのまま比べるのではなく、
それぞれを自由度で割ってから比較
します。
\[
R_{\mathrm{adj}}^2
=
1-
\frac{
S_e/(n-p-1)
}{
S_y/(n-1)
}
\]
ここで、
\(n\) はサンプルサイズ、
\(p\) は説明変数の個数です。
調整の考え方
平方和そのものではなく、
「自由度1あたりの平方和」で比べる。
STEP 06
\(S_y\) の自由度は \(n-1\)
まず、
分母側の
\(S_y\)
について確認します。
\(S_y\) は、
\[
S_y
=
\sum_{i=1}^{n}
(y_i-\bar y)^2
\]
でした。
ここでは、
母平均ではなく、
標本から計算した平均
\(\bar y\)
を使っています。
データは \(n\) 個
↓
平均 \(\bar y\) を1つ推定
↓
自由度 \(n-1\)
したがって、
\(S_y\) を自由度で割ると、
\[
\frac{S_y}{n-1}
\]
となります。
STEP 07
\(S_e\) の自由度は \(n-p-1\)
次に、
分子側の残差平方和
\(S_e\)
を見ていきます。
\[
S_e
=
\sum_{i=1}^{n}
(y_i-\hat y_i)^2
\]
この
\(\hat y_i\)
は、
\[
\hat y_i
=
\hat\beta_0
+
\hat\beta_1x_{1i}
+
\hat\beta_2x_{2i}
+\cdots+
\hat\beta_px_{pi}
\]
という重回帰式から計算されます。
この式では、
データから
偏回帰係数
\(\beta_1,\ldots,\beta_p\)
\(p\) 個
+
定数項
\(\beta_0\)
1個
↓
合計 \(p+1\) 個の係数を推定
したがって、
残差の自由度は
\[
n-(p+1)
=
n-p-1
\]
となります。
残差の自由度
データ \(n\) 個から、
\(p\) 個の偏回帰係数と
1個の定数項を推定するため、
\(n-p-1\)。
STEP 08
自由度調整済み決定係数の式を読む
ここまで整理すると、
自由度調整済み決定係数の式の意味が見えてきます。
\[
R_{\mathrm{adj}}^2
=
1-
\frac{
S_e/(n-p-1)
}{
S_y/(n-1)
}
\]
分子
\[
\frac{S_e}{n-p-1}
\]
残差の平均的なばらつき
分母
\[
\frac{S_y}{n-1}
\]
もともとの \(y\) の平均的なばらつき
つまり、
単なる平方和の比ではなく、
自由度を考慮した平均的なばらつきの比
を使って評価しています。
STEP 09
説明変数が多いほどハンデがかかる
自由度調整済み決定係数の重要な点は、
説明変数の個数 \(p\) を考慮できることです。
\(p\) が増えると、
説明変数の数 \(p\) が増える
↓
\(n-p-1\) が小さくなる
↓
\[
\frac{S_e}{n-p-1}
\]
が大きくなりやすい
↓
\(R_{\mathrm{adj}}^2\) を下げる方向
つまり、
説明変数を増やしたこと自体に、
ある意味で
ハンデ
がかかります。
調整されるもの
サンプルサイズ \(n\) に対して、
説明変数 \(p\) が多すぎないかを考慮する。
STEP 10
本当に役立つ説明変数なら追加する価値がある
では、
説明変数を増やすことは
すべて悪いのでしょうか。
もちろん、
そうではありません。
説明変数を1つ追加すると、
2つの効果が同時に起こります。
効果① モデルが改善する
説明変数が本当に役立つなら、
残差平方和 \(S_e\) がしっかり減る
→ \(R_{\mathrm{adj}}^2\) を
上げる方向
効果② 説明変数が増える
\(p\) が増えることで
\(n-p-1\) が小さくなる
→ \(R_{\mathrm{adj}}^2\) を
下げる方向
どちらの効果が大きいかを見る
↓
本当に有効な説明変数なら、
\(S_e\) の減少効果が
自由度のペナルティを上回る
一方、
ほとんど役に立たない説明変数を追加すると、
\(S_e\) はあまり減らないのに
自由度だけが減るため、
自由度調整済み決定係数が下がることがあります。
STEP 11
説明変数の数が違うモデルを比較するときに使う
通常の決定係数 \(R^2\) は、
説明変数を増やしたモデルほど
有利になりやすい性質があります。
そのため、
説明変数の数が異なる重回帰モデルを比較する場合には、
自由度調整済み決定係数
を確認することが重要です。
通常の \(R^2\)
当てはまりのよさを表すが、
説明変数を増やすことへのペナルティがない
自由度調整済み \(R^2\)
当てはまりのよさに加えて、
説明変数の個数も考慮する
モデル比較
説明変数の個数が異なる回帰モデルを比較するときは、
通常の \(R^2\) だけでなく、
自由度調整済み \(R^2\) を確認する。
STEP 12
自由度調整済み決定係数の流れを整理する
通常の決定係数
\[
R^2
=
1-\frac{S_e}{S_y}
\]
↓
説明変数を増やすと
\(S_e\) は増えない
↓
\(R^2\) は下がらない
↓
平方和を自由度で割って調整
↓
\[
R_{\mathrm{adj}}^2
=
1-
\frac{
S_e/(n-p-1)
}{
S_y/(n-1)
}
\]
このレクチャーの核心
自由度調整済み決定係数は、
「残差をどれだけ減らしたか」と
「説明変数を何個使ったか」の
両方を考慮する指標。
SUMMARY
自由度調整済み決定係数を整理する
通常の決定係数
\[
R^2
=
\frac{S_R}{S_y}
=
1-\frac{S_e}{S_y}
\]
自由度調整済み決定係数
\[
R_{\mathrm{adj}}^2
=
1-
\frac{
S_e/(n-p-1)
}{
S_y/(n-1)
}
\]
Sy
\[
S_y
=
\sum_{i=1}^{n}
(y_i-\bar y)^2
\]
自由度は \(n-1\)
Se
\[
S_e
=
\sum_{i=1}^{n}
(y_i-\hat y_i)^2
\]
自由度は \(n-p-1\)
特に重要な3点
① 通常の \(R^2\) は、説明変数を追加しても下がらない
② 自由度調整済み \(R^2\) は、説明変数の数 \(p\) を考慮する
③ 役に立たない説明変数を追加すると、自由度調整済み \(R^2\) は下がることがある
最後に
モデルを評価するときは、
単に「どれだけ残差を小さくできたか」だけでなく、
「そのために何個の説明変数を使ったか」も考える。
その調整を行うのが、
自由度調整済み決定係数です。
NEXT STEP
次のステップ:統計検定®2級を目指す
このサイトで統計学の基礎を学んだあと、
統計検定®2級の合格まで体系的に学びたい方へ。
統計検定®2級対策講座【ベストセラー版】
約9時間の動画講義と200問以上の小テストに加えて、
模擬試験にも取り組めます。
講座内ではQ&Aも利用でき、
これまでに400問以上の質問に回答してきました。
約9時間の動画講義
200問以上の小テスト
模擬試験
400問以上のQ&A
統計検定®2級対策講座を見る
資格試験ではなく、統計学そのものを動画で学びたい方へ
記述統計・確率・推定・検定を基礎から学ぶ
「統計学ベーシック講座その1『確率分布・推定・検定』」
も用意しています。
統計学ベーシック講座を見る →