スマホで統計学

51

一元配置分散分析の検定

一元配置分散分析では、水準によって説明できるばらつきと、水準内に残るばらつきを比較して、水準の違いに意味があるかを検定します。このレクチャーでは、平方和の分解をもとに自由度と平均平方を整理し、F分布を用いた仮説検定の流れを確認します。
このページのゴール

一元配置分散分析のF検定と、分散分析表の読み方を理解する。

STEP 01

一元配置分散分析では平均平方の比を検定する

このレクチャーでは、 一元配置分散分析の仮説検定 を見ていきます。

前のレクチャーでは、 \(y\) 全体のばらつきを、

\[ S_T = S_A + S_e \]

と、 水準によって説明できる部分と、 水準内に残る部分に分解しました。

水準によって説明できたばらつき \[ S_A \]
水準内に残ったばらつき \[ S_e \]
を比較する
平均平方の比 \[ F = \frac{V_A}{V_e} \]

ここで、 \(V_A\) と \(V_e\) という 新しい記号が登場しました。

\(V_A\)、\(V_e\) とは?

これらは、 \(S_A\) と \(S_e\) という平方和を、 それぞれの自由度で割って平均した 「平均平方」 です。

なぜ平方和をそのまま比べるのではなく、 自由度で割った平均平方を比べるのかも含めて、 このあとのSTEPで詳しく確認します。
全体像
水準間のばらつきが、 水準内のばらつきに比べて 十分に大きいかを調べます。
STEP 02

手順0:すべての水準効果が0と仮定する

仮説検定ですので、 まず帰無仮説を設定します。

一元配置モデルは、

\[ y_{ji} = \mu+\alpha_j+\varepsilon_{ji} \]

でした。

ここで、 水準による効果 \(\alpha_j\) がすべて0であるという帰無仮説を立てます。

\[ H_0: \alpha_1 = \alpha_2 = \cdots = \alpha_a = 0 \]

一方の対立仮説は、 すべてが0なのではなく、 少なくとも1つの水準効果が0ではない というものです。

\[ H_1: \alpha_1,\alpha_2,\ldots,\alpha_a \]
\[ \text{少なくとも1つは }0\text{ ではない} \]
帰無仮説の世界
どの水準にも特別な効果はなく、 水準の違いでは \(y\) を説明できない、 という世界をまず仮定します。
STEP 03

帰無仮説は「各水準の母平均が等しい」とも読める

帰無仮説

\[ H_0: \alpha_1 = \alpha_2 = \cdots = \alpha_a = 0 \]

が何を意味しているのか、 一元配置モデルから確認してみましょう。

一元配置モデルは、

\[ y_{ji} = \mu+\alpha_j+\varepsilon_{ji} \]

でした。

誤差 \(\varepsilon_{ji}\) の平均は0ですので、 水準 \(j\) における 母平均 は、

\[ \mu+\alpha_j \]

となります。

ここで、 帰無仮説のように すべての水準効果が0なら、

\[ \mu+\alpha_1 = \mu+\alpha_2 = \cdots = \mu+\alpha_a = \mu \]

となります。

つまり、 帰無仮説は

すべての水準の母平均が等しい

という仮説として読み替えることができます。

\(H_0\) の世界
水準1
水準2
水準3
水準4
各水準の母平均が同じ
\(H_1\) の世界
水準1
水準2
水準3
水準4
少なくとも1つの水準の母平均が異なる
帰無仮説の意味
一元配置分散分析では、 「すべての水準効果が0」 という仮説は、 「すべての水準の母平均が等しい」 という仮説と同じ意味になります。
STEP 04

手順1:2つの平方和をカイ二乗分布に整理する

次に、 何がどんな分布にしたがうかを整理します。

注目するのは、 水準間平方和 \(S_A\)水準内平方和 \(S_e\) です。

\[ \frac{S_A}{\sigma^2} \sim \chi^2(a-1) \]
\[ \frac{S_e}{\sigma^2} \sim \chi^2(n-a) \]

この結果は、 コクランの定理などを用いて導くことができますが、 証明は統計検定2級の範囲を超えるため、 ここでは割愛します。

重要なのは前提

この整理の拠り所になっているのは、 一元配置モデルの誤差 \(\varepsilon_{ji}\) が正規分布にしたがうという仮定です。
STEP 05

平方和の分解に対応して自由度も分解できる

平方和は、

\[ S_T = S_A + S_e \]

と分解できました。

これに対応して、 自由度も同じように分解できます。

総平方和 \(S_T\)
自由度 \[ n-1 \]
水準間平方和 \(S_A\)
自由度 \[ a-1 \]
水準内平方和 \(S_e\)
自由度 \[ n-a \]
\[ n-1 = (a-1) + (n-a) \]
STEP 06

自由度がなぜこの値になるかを確認する

まず、 水準内平方和 \(S_e\) では、 水準ごとの平均 \(\bar y_{j\cdot}\) を使っています。

全データ数 \[ n \]
水準平均を \(a\) 個使用
\(S_e\) の自由度 \[ n-a \]

一方、 総平方和 \(S_T\) では、 全体平均 \(\bar y_{\cdot\cdot}\) を1個使うため、 自由度は \(n-1\) です。

したがって、 水準間平方和 \(S_A\) の自由度は、

\[ (n-1)-(n-a) = a-1 \]
自由度も分解
平方和の分解 \(S_T=S_A+S_e\) に対応して、 自由度も \(n-1=(a-1)+(n-a)\) と分解されます。
STEP 07

平方和を自由度で割って「平均平方」にする

ここで、 \(S_A\) と \(S_e\) を そのまま比較するわけではありません。

なぜなら、 2つの平方和では使っている自由度が違う からです。

平方和をそのまま比べると、 それぞれが持つ自由度の違いも 一緒に比較してしまいます。

そこで、 平方和を自由度で割り、 1自由度あたりのばらつき にそろえて比較します。
水準間平均平方
\[ V_A = \frac{S_A}{a-1} \]
水準内平均平方
\[ V_e = \frac{S_e}{n-a} \]
平均平方とは
平方和を自由度で割った、 「1自由度あたりのばらつき」です。
STEP 08

手順2:カイ二乗分布からF分布へつなげる

ここまでの流れを、 一度まとめて見てみましょう。

水準間平方和 \[ S_A \]
水準内平方和 \[ S_e \]
↓ \(\sigma^2\) で割る
↓ \(\sigma^2\) で割る
\[ \chi^2(a-1) \]
\[ \chi^2(n-a) \]
↓ \(a-1\) で割る
↓ \(n-a\) で割る
平均平方 \[ V_A = \frac{S_A}{a-1} \]
平均平方 \[ V_e = \frac{S_e}{n-a} \]
↓ 比をとる
\[ F = \frac{V_A}{V_e} \sim F(a-1,n-a) \]

また、 正規性の仮定のもとでは、 \(S_A\) と \(S_e\) は 互いに独立 です。

したがって、 それぞれのカイ二乗変数を 自由度で割った比が F分布にしたがいます。

F分布の自由度

1つ目: 分子の自由度 \(a-1\)
2つ目: 分母の自由度 \(n-a\)
STEP 09

Fが大きいとは、どういうことか

検定統計量は、

\[ F = \frac{V_A}{V_e} \]

でした。

まず、 水準間と水準内のばらつきが 同程度なら、

\[ V_A \approx V_e \]
\[ F \approx 1 \]
水準による違いは 特別大きいとは言えない

一方で、 水準間のばらつきが 水準内のばらつきよりかなり大きければ、

\[ V_A \gg V_e \]
\(F\) が大きくなる
「すべての水準効果が0」 では説明しづらい
Fが大きいほど
水準による違いが、 水準内に存在する偶然のばらつきに比べて 大きいことを意味します。
STEP 10

手順3:F分布の上側を棄却域にする

ここでは、 有意水準を \(\alpha=0.05\) とします。

帰無仮説が正しい世界では、 \(F\) が極端に大きくなることは まれです。

そこで、 F分布の 上側5% を棄却域とします。

上側5%

標本から計算された \(F\) の実現値が この棄却域に入れば、 帰無仮説を棄却します。

\[ F_{\mathrm{obs}} \ge F_{0.05}(a-1,n-a) \]
STEP 11

検定の流れを一本につなげる

帰無仮説 \[ \alpha_1=\cdots=\alpha_a=0 \]
水準間と水準内の 平均平方を求める
\[ F = \frac{V_A}{V_e} \]
Fが上側棄却域に入るか判定
水準による効果があるかを判断
STEP 12

分散分析表は、ここまでの流れを1つにまとめたもの

実際の問題では、 一元配置分散分析の結果が 分散分析表 に整理されて提示されることが多くあります。

分散分析表は新しい内容ではありません。

ここまで見てきた、 平方和 → 自由度 → 平均平方 → F という計算の流れを、 1つの表にまとめたものです。
平方和
↓ 自由度で割る
平均平方
↓ 水準間 ÷ 水準内
F値
変動要因 平方和 自由度 平均平方 F
水準間 \(S_A\) \(a-1\) \(V_A=S_A/(a-1)\) \(V_A/V_e\)
残差 \(S_e\) \(n-a\) \(V_e=S_e/(n-a)\)
合計 \(S_T\) \(n-1\)
STEP 13

具体的な分散分析表を読んでみる

スライドの数値例では、 分散分析表が次のように整理されています。

変動要因 平方和 自由度 平均平方 F
水準間 \(69.31\) \(3\) \(23.103\) \(0.6045\)
残差 \(2293.11\) \(60\) \(38.218\)
合計 \(2362.42\) \(63\)

平方和は、

\[ 2362.42 = 69.31 + 2293.11 \]

と分解されています。

自由度についても、

\[ 63 = 3 + 60 \]

と分解されています。

さらに、 平方和をそれぞれの自由度で割ると、

\[ V_A = \frac{69.31}{3} = 23.103 \]
\[ V_e = \frac{2293.11}{60} = 38.218 \]

となり、 最後に、

\[ F = \frac{23.103}{38.218} \approx 0.6045 \]

とF値を計算できます。

SUMMARY

一元配置分散分析の検定を整理する

帰無仮説
\[ H_0: \alpha_1=\alpha_2=\cdots=\alpha_a=0 \]
すべての水準効果が0、 つまり すべての水準の平均に差がない世界を仮定します。
平方和と自由度
\[ S_T=S_A+S_e \] \[ n-1 = (a-1) + (n-a) \]
平均平方
\[ V_A = \frac{S_A}{a-1}, \qquad V_e = \frac{S_e}{n-a} \]
平方和を自由度で割り、 1自由度あたりのばらつきにそろえます。
F統計量
\[ F = \frac{V_A}{V_e} \sim F(a-1,n-a) \]
Fが大きいほど、 水準間の違いが 水準内のばらつきに比べて大きい、 と考えます。
特に重要な3点
① 平方和だけでなく自由度も分解できる
② 平方和を自由度で割ると平均平方になる
③ 水準間平均平方と水準内平均平方の比をF分布で検定する
最後に
一元配置分散分析では、

「水準による違い」が 「同じ水準内に存在するばらつき」に比べて 十分に大きいかを、

F統計量によって判定します。
NEXT STEP

次のステップ:統計検定®2級を目指す

このサイトで統計学の基礎を学んだあと、 統計検定®2級の合格まで体系的に学びたい方へ。

統計検定®2級対策講座【ベストセラー版】

約9時間の動画講義と200問以上の小テストに加えて、 模擬試験にも取り組めます。 講座内ではQ&Aも利用でき、 これまでに400問以上の質問に回答してきました。

約9時間の動画講義
200問以上の小テスト
模擬試験
400問以上のQ&A
統計検定®2級対策講座を見る
資格試験ではなく、統計学そのものを動画で学びたい方へ

記述統計・確率・推定・検定を基礎から学ぶ 「統計学ベーシック講座その1『確率分布・推定・検定』」 も用意しています。

統計学ベーシック講座を見る →