51
一元配置分散分析の検定
一元配置分散分析では、水準によって説明できるばらつきと、水準内に残るばらつきを比較して、水準の違いに意味があるかを検定します。このレクチャーでは、平方和の分解をもとに自由度と平均平方を整理し、F分布を用いた仮説検定の流れを確認します。
このページのゴール
一元配置分散分析のF検定と、分散分析表の読み方を理解する。
STEP 01
一元配置分散分析では平均平方の比を検定する
このレクチャーでは、
一元配置分散分析の仮説検定
を見ていきます。
前のレクチャーでは、
\(y\) 全体のばらつきを、
\[
S_T
=
S_A
+
S_e
\]
と、
水準によって説明できる部分と、
水準内に残る部分に分解しました。
水準によって説明できたばらつき
\[
S_A
\]
と
水準内に残ったばらつき
\[
S_e
\]
を比較する
平均平方の比
\[
F
=
\frac{V_A}{V_e}
\]
ここで、
\(V_A\) と \(V_e\) という
新しい記号が登場しました。
\(V_A\)、\(V_e\) とは?
これらは、
\(S_A\) と \(S_e\) という平方和を、
それぞれの自由度で割って平均した
「平均平方」
です。
なぜ平方和をそのまま比べるのではなく、
自由度で割った平均平方を比べるのかも含めて、
このあとのSTEPで詳しく確認します。
全体像
水準間のばらつきが、
水準内のばらつきに比べて
十分に大きいかを調べます。
STEP 02
手順0:すべての水準効果が0と仮定する
仮説検定ですので、
まず帰無仮説を設定します。
一元配置モデルは、
\[
y_{ji}
=
\mu+\alpha_j+\varepsilon_{ji}
\]
でした。
ここで、
水準による効果
\(\alpha_j\)
がすべて0であるという帰無仮説を立てます。
\[
H_0:
\alpha_1
=
\alpha_2
=
\cdots
=
\alpha_a
=
0
\]
一方の対立仮説は、
すべてが0なのではなく、
少なくとも1つの水準効果が0ではない
というものです。
\[
H_1:
\alpha_1,\alpha_2,\ldots,\alpha_a
\]
\[
\text{少なくとも1つは }0\text{ ではない}
\]
帰無仮説の世界
どの水準にも特別な効果はなく、
水準の違いでは \(y\) を説明できない、
という世界をまず仮定します。
STEP 03
帰無仮説は「各水準の母平均が等しい」とも読める
帰無仮説
\[
H_0:
\alpha_1
=
\alpha_2
=
\cdots
=
\alpha_a
=
0
\]
が何を意味しているのか、
一元配置モデルから確認してみましょう。
一元配置モデルは、
\[
y_{ji}
=
\mu+\alpha_j+\varepsilon_{ji}
\]
でした。
誤差
\(\varepsilon_{ji}\)
の平均は0ですので、
水準 \(j\) における
母平均
は、
\[
\mu+\alpha_j
\]
となります。
ここで、
帰無仮説のように
すべての水準効果が0なら、
\[
\mu+\alpha_1
=
\mu+\alpha_2
=
\cdots
=
\mu+\alpha_a
=
\mu
\]
となります。
つまり、
帰無仮説は
すべての水準の母平均が等しい
という仮説として読み替えることができます。
\(H_1\) の世界
少なくとも1つの水準の母平均が異なる
帰無仮説の意味
一元配置分散分析では、
「すべての水準効果が0」
という仮説は、
「すべての水準の母平均が等しい」
という仮説と同じ意味になります。
STEP 04
手順1:2つの平方和をカイ二乗分布に整理する
次に、
何がどんな分布にしたがうかを整理します。
注目するのは、
水準間平方和 \(S_A\)
と
水準内平方和 \(S_e\)
です。
\[
\frac{S_A}{\sigma^2}
\sim
\chi^2(a-1)
\]
\[
\frac{S_e}{\sigma^2}
\sim
\chi^2(n-a)
\]
この結果は、
コクランの定理などを用いて導くことができますが、
証明は統計検定2級の範囲を超えるため、
ここでは割愛します。
重要なのは前提
この整理の拠り所になっているのは、
一元配置モデルの誤差
\(\varepsilon_{ji}\)
が正規分布にしたがうという仮定です。
STEP 05
平方和の分解に対応して自由度も分解できる
平方和は、
\[
S_T
=
S_A
+
S_e
\]
と分解できました。
これに対応して、
自由度も同じように分解できます。
総平方和 \(S_T\)
自由度
\[
n-1
\]
=
水準間平方和 \(S_A\)
自由度
\[
a-1
\]
+
水準内平方和 \(S_e\)
自由度
\[
n-a
\]
\[
n-1
=
(a-1)
+
(n-a)
\]
STEP 06
自由度がなぜこの値になるかを確認する
まず、
水準内平方和 \(S_e\) では、
水準ごとの平均
\(\bar y_{j\cdot}\)
を使っています。
全データ数
\[
n
\]
−
水準平均を \(a\) 個使用
↓
\(S_e\) の自由度
\[
n-a
\]
一方、
総平方和 \(S_T\) では、
全体平均
\(\bar y_{\cdot\cdot}\)
を1個使うため、
自由度は \(n-1\) です。
したがって、
水準間平方和 \(S_A\) の自由度は、
\[
(n-1)-(n-a)
=
a-1
\]
自由度も分解
平方和の分解
\(S_T=S_A+S_e\)
に対応して、
自由度も
\(n-1=(a-1)+(n-a)\)
と分解されます。
STEP 07
平方和を自由度で割って「平均平方」にする
ここで、
\(S_A\) と \(S_e\) を
そのまま比較するわけではありません。
なぜなら、
2つの平方和では使っている自由度が違う
からです。
平方和をそのまま比べると、
それぞれが持つ自由度の違いも
一緒に比較してしまいます。
そこで、
平方和を自由度で割り、
1自由度あたりのばらつき
にそろえて比較します。
水準間平均平方
\[
V_A
=
\frac{S_A}{a-1}
\]
水準内平均平方
\[
V_e
=
\frac{S_e}{n-a}
\]
平均平方とは
平方和を自由度で割った、
「1自由度あたりのばらつき」です。
STEP 08
手順2:カイ二乗分布からF分布へつなげる
ここまでの流れを、
一度まとめて見てみましょう。
水準間平方和
\[
S_A
\]
水準内平方和
\[
S_e
\]
↓ \(\sigma^2\) で割る
↓ \(\sigma^2\) で割る
\[
\chi^2(a-1)
\]
\[
\chi^2(n-a)
\]
↓ \(a-1\) で割る
↓ \(n-a\) で割る
平均平方
\[
V_A
=
\frac{S_A}{a-1}
\]
平均平方
\[
V_e
=
\frac{S_e}{n-a}
\]
↓ 比をとる
\[
F
=
\frac{V_A}{V_e}
\sim
F(a-1,n-a)
\]
また、
正規性の仮定のもとでは、
\(S_A\) と \(S_e\) は
互いに独立
です。
したがって、
それぞれのカイ二乗変数を
自由度で割った比が
F分布にしたがいます。
F分布の自由度
1つ目:
分子の自由度 \(a-1\)
2つ目:
分母の自由度 \(n-a\)
STEP 09
Fが大きいとは、どういうことか
検定統計量は、
\[
F
=
\frac{V_A}{V_e}
\]
でした。
まず、
水準間と水準内のばらつきが
同程度なら、
\[
V_A
\approx
V_e
\]
↓
\[
F
\approx
1
\]
↓
水準による違いは
特別大きいとは言えない
一方で、
水準間のばらつきが
水準内のばらつきよりかなり大きければ、
\[
V_A
\gg
V_e
\]
↓
\(F\) が大きくなる
↓
「すべての水準効果が0」
では説明しづらい
Fが大きいほど
水準による違いが、
水準内に存在する偶然のばらつきに比べて
大きいことを意味します。
STEP 10
手順3:F分布の上側を棄却域にする
ここでは、
有意水準を
\(\alpha=0.05\)
とします。
帰無仮説が正しい世界では、
\(F\) が極端に大きくなることは
まれです。
そこで、
F分布の
上側5%
を棄却域とします。
標本から計算された
\(F\) の実現値が
この棄却域に入れば、
帰無仮説を棄却します。
\[
F_{\mathrm{obs}}
\ge
F_{0.05}(a-1,n-a)
\]
STEP 11
検定の流れを一本につなげる
帰無仮説
\[
\alpha_1=\cdots=\alpha_a=0
\]
↓
水準間と水準内の
平均平方を求める
↓
\[
F
=
\frac{V_A}{V_e}
\]
↓
Fが上側棄却域に入るか判定
↓
水準による効果があるかを判断
STEP 12
分散分析表は、ここまでの流れを1つにまとめたもの
実際の問題では、
一元配置分散分析の結果が
分散分析表
に整理されて提示されることが多くあります。
分散分析表は新しい内容ではありません。
ここまで見てきた、
平方和 → 自由度 → 平均平方 → F
という計算の流れを、
1つの表にまとめたものです。
平方和
↓ 自由度で割る
平均平方
↓ 水準間 ÷ 水準内
F値
|
変動要因
|
平方和
|
自由度
|
平均平方
|
F
|
|
水準間
|
\(S_A\)
|
\(a-1\)
|
\(V_A=S_A/(a-1)\)
|
\(V_A/V_e\)
|
|
残差
|
\(S_e\)
|
\(n-a\)
|
\(V_e=S_e/(n-a)\)
|
—
|
|
合計
|
\(S_T\)
|
\(n-1\)
|
—
|
—
|
STEP 13
具体的な分散分析表を読んでみる
スライドの数値例では、
分散分析表が次のように整理されています。
|
変動要因
|
平方和
|
自由度
|
平均平方
|
F
|
|
水準間
|
\(69.31\)
|
\(3\)
|
\(23.103\)
|
\(0.6045\)
|
|
残差
|
\(2293.11\)
|
\(60\)
|
\(38.218\)
|
|
合計
|
\(2362.42\)
|
\(63\)
|
—
|
—
|
平方和は、
\[
2362.42
=
69.31
+
2293.11
\]
と分解されています。
自由度についても、
\[
63
=
3
+
60
\]
と分解されています。
さらに、
平方和をそれぞれの自由度で割ると、
\[
V_A
=
\frac{69.31}{3}
=
23.103
\]
と
\[
V_e
=
\frac{2293.11}{60}
=
38.218
\]
となり、
最後に、
\[
F
=
\frac{23.103}{38.218}
\approx
0.6045
\]
とF値を計算できます。
SUMMARY
一元配置分散分析の検定を整理する
帰無仮説
\[
H_0:
\alpha_1=\alpha_2=\cdots=\alpha_a=0
\]
すべての水準効果が0、
つまり
すべての水準の平均に差がない世界を仮定します。
平方和と自由度
\[
S_T=S_A+S_e
\]
\[
n-1
=
(a-1)
+
(n-a)
\]
平均平方
\[
V_A
=
\frac{S_A}{a-1},
\qquad
V_e
=
\frac{S_e}{n-a}
\]
平方和を自由度で割り、
1自由度あたりのばらつきにそろえます。
F統計量
\[
F
=
\frac{V_A}{V_e}
\sim
F(a-1,n-a)
\]
Fが大きいほど、
水準間の違いが
水準内のばらつきに比べて大きい、
と考えます。
特に重要な3点
① 平方和だけでなく自由度も分解できる
② 平方和を自由度で割ると平均平方になる
③ 水準間平均平方と水準内平均平方の比をF分布で検定する
最後に
一元配置分散分析では、
「水準による違い」が
「同じ水準内に存在するばらつき」に比べて
十分に大きいかを、
F統計量によって判定します。
NEXT STEP
次のステップ:統計検定®2級を目指す
このサイトで統計学の基礎を学んだあと、
統計検定®2級の合格まで体系的に学びたい方へ。
統計検定®2級対策講座【ベストセラー版】
約9時間の動画講義と200問以上の小テストに加えて、
模擬試験にも取り組めます。
講座内ではQ&Aも利用でき、
これまでに400問以上の質問に回答してきました。
約9時間の動画講義
200問以上の小テスト
模擬試験
400問以上のQ&A
統計検定®2級対策講座を見る
資格試験ではなく、統計学そのものを動画で学びたい方へ
記述統計・確率・推定・検定を基礎から学ぶ
「統計学ベーシック講座その1『確率分布・推定・検定』」
も用意しています。
統計学ベーシック講座を見る →